Ovis:阿里国际发布的最新开源多模态模型

阿里国际于2024年9月19日发布了最新的多模态大模型Ovis,Ovis模型在多个领域展现出色的能力,特别是在数学推理问答、物体识别、文本提取和复杂任务决策等方面。

阿里国际发布的最新开源多模态模型

根据多模态评测平台OpenCompass的数据,Ovis1.6-Gemma2-9B版本在OpenCompass这一权威综合评测基准上,超越了多个知名开源模型,包括Qwen2VL-7B、InternVL2-26B和MiniCPM-V-2.6,在300亿参数以下的开源模型中位居第一。值得注意的是,Ovis在某些任务上的表现甚至超过了闭源的大型模型GPT-4o-mini。

Ovis的核心能力:

  • 多模态任务处理:Ovis能够出色地完成视觉感知推理、数学和科学理解、生活场景分析等多模态任务。它不仅能够辅助理解复杂的数学概念,还能帮助分析财务报表,甚至根据图片指导烹饪过程,如制作炸鱼薯条。

  • 技术细节:Ovis的设计亮点在于其结构上对齐视觉和文本嵌入的方式,通过引入可学习的视觉嵌入表,将连续视觉特征转换为概率化的token,再生成结构化的视觉嵌入,这克服了传统多模态模型中视觉与文本信息融合的限制。

  • 性能与优势:Ovis在数学推理和视觉理解等任务中的得分表现出色,甚至媲美一些参数量级更高的模型。它在幻觉现象和错误率方面的控制也优于同级别模型,确保了高文本质量和准确度。

  • 开源与商用友好:遵循Apache 2.0开源协议,Ovis的开源使得其在商业应用上非常友好,鼓励更广泛的应用和二次开发。

  • 架构创新:Ovis通过创新的架构设计,包括动态子图方案,支持处理极端长宽比和高分辨率图像,以及全面数据优化策略,覆盖Caption、VQA、OCR、Table、Chart等多种多模态数据方向,从而提升了多模态任务的综合表现。

Ovis应用案例:

  • 图像识别与处理:Ovis能准确识别手写内容并翻译,处理复杂的数学公式,比如通过图片识别给出详细的菜谱制作步骤。

  • 自动驾驶:整合摄像头、雷达和激光雷达的数据。

  • 医疗诊断:用于图像分析和诊断支持。

  • 视频内容理解:分析和生成视频内容。

  • 图像描述生成:自动生成图像描述。

  • 视觉问答:支持多种语言的文本提取和问答。

Ovis开源信息:

  • Ovis系列模型License采用Apache 2.0。

  • Ovis 1.0、1.5的数据、模型、训练和推理代码已开源。

  • Ovis1.6系列中的Ovis1.6-Gemma2-9B也已开源权重。

  • 开发者可以在GitHub上获取模型和代码。

  • 开源代码可用于商用和改进。

Ovis技术优势:

  • 创新架构设计:克服MLLM中MLP连接器架构的局限性。

  • 高分图像处理:兼容高分辨率图像。

  • 全面数据优化:显著提升多模态问答、指令跟随等任务表现。

  • 卓越模型性能:在OpenCompass上综合排名第一。

  • 幻觉现象和错误率显著低于同级别的模型。

Ovis Ghub地址:

https://github.com/aiDC-AI/Ovis

阿里国际团队表示,近半年的数据显示,商家对AI的需求不断增长,平均每两个月调用量翻一番。Ovis无疑将助力更多商家提升运营效率。

收藏
最新工具
Freebeat AI
Freebeat AI

一个可以帮音乐人和内容创作者把音频、文字或图片快速做成爆款音乐视...

DownSub
DownSub

一个免费的在线字幕下载工具,能从 YouTube、Viki、Vi...

GamePix
GamePix

全球领先的 HTML5 和 WebGL 游戏分发平台。它把各类分...

PixelSquid
PixelSquid

Shutterstock推出的专为平面设计师和Photoshop...

Dos.Zone
Dos.Zone

一个聚合经典DOS游戏的在线游玩平台,游戏种类特别多,有动作、策...

KBHgames
KBHgames

一个老牌免费在线游戏网站,谁都可以在这儿找到想玩的游戏。涵盖动作...

SoundWise AI
SoundWise AI

一个完全免费的AI音视频转录工具,能在浏览器里直接把音频和视频转...

Armor Games
Armor Games

全球知名免费在线游戏平台与独立游戏发行商​,ArmorGames...

Social Auto Upload
Social Auto Upload

社交媒体视频一键多平台发布工具​,一站式解决抖音、小红书、视频号...

在线DOS游戏
在线DOS游戏

一个能在浏览器直接玩DOS游戏的在线模拟器,适合怀旧玩家和游戏开...