MiniCPM-V
袖珍多模态语言模型,手机端高效实现图像视频理解
OpenBMB/MiniCPM-V是袖珍型多模态语言模型,能在手机上高效实现图像和视频理解。专注跨图像、视频和文本输入的视觉语言理解,基于LLaVA-UHD v4中intra-ViT早期压缩技术,降低视觉编码计算成本超50%,支持4x/16x视觉令牌压缩率。可部署在iOS、Android和HarmonyOS等移动平台,边缘适配代码开源。
袖珍多模态语言模型,手机端高效实现图像视频理解
OpenBMB/MiniCPM-V是袖珍型多模态语言模型,能在手机上高效实现图像和视频理解。专注跨图像、视频和文本输入的视觉语言理解,基于LLaVA-UHD v4中intra-ViT早期压缩技术,降低视觉编码计算成本超50%,支持4x/16x视觉令牌压缩率。可部署在iOS、Android和HarmonyOS等移动平台,边缘适配代码开源。
点击查看界面细节
OpenBMB/MiniCPM-V是袖珍型多模态语言模型,能在手机上高效实现图像和视频理解。专注跨图像、视频和文本输入的视觉语言理解,基于LLaVA-UHD v4中intra-ViT早期压缩技术,降低视觉编码计算成本超50%,支持4x/16x视觉令牌压缩率。可部署在iOS、Android和HarmonyOS等移动平台,边缘适配代码开源。
还没有公开评论,欢迎分享你的体验。