正文内容 评论(0)
7月 24 日,阿里巴巴正式开源发布文档解析模型OvisOCR2。该模型以96.58的综合得分刷新OmniDocBench v1.6榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,这是文档解析领域迎来技术路线的重要突破。
图 OvisOCR2 在 OmniDocBench v1.6 上的综合及分项表现。
端到端模型首次超越流水线方法
文档解析是大模型落地的关键基础设施。企业知识库、RAG检索、智能问答等场景应用,都需将PDF、扫描件等非结构化文档高质量地转化为机器可读的结构化文本。
长期以来,文档解析领域由“流水线方法”主导,通常由版面分析模型和内容识别模型两个模型组成,前者负责识别文档布局,后者负责文字、公式、表格等内容的识别,最后拼接输出。这种方式虽成熟,但存在维护成本高、误差累积、部署复杂等固有瓶颈。
OvisOCR2选择了一条更具挑战性的技术路线,即面向页面级文档解析的端到端模型:输入一张文档图像,模型在一次生成中输出符合自然阅读顺序的 Markdown 表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。
在文档解析领域最权威的公开基准OmniDocBench v1.6上,OvisOCR2以96.58分登顶,首次证明端到端模型能够全面超越流水线方法。
小参数大能力,0.8B实现SOTA
OvisOCR2由Qwen3.5-0.8B后训练得到,仅有0.8B参数规模。在模型训练层面,团队构建了独特的数据引擎体系。真实文档提供自然页面分布,合成文档精准补充表格与公式交织、多栏版式、长输出等复杂场景。两类数据互补共建,确保模型在各类真实业务场景中的泛化能力。
图 OvisOCR2 数据引擎体系
训练方案融合了监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四大技术手段,形成多阶段递进式的训练流程,充分释放紧凑模型的潜力。
OvisOCR2以极致紧凑的体量达到了最优性能。相较于动辄数十亿参数的大模型和需要两个模型叠加的流水线方法,它仅用单个0.8B模型即实现SOTA。以更低的GPU显存需求、更快的推理速度、更简单的部署流程,让企业用户无需配置昂贵的算力基础设施,即可获得业界领先的文档解析能力。对追求降本增效的落地场景,OvisOCR2提供了"效果最优、成本最低"的方案。
项目已开源发布,无缝融入千问生态
OvisOCR2以Apache 2.0许可证完全开源,已上线Hugging Face、魔搭等AI开源社区,开发者可自由使用或商业化部署。模型兼容vLLM等主流推理框架,与Qwen3.5推理生态无缝衔接,开发者无需额外适配即可快速集成。
作为阿里云MaaS平台的重要开源成果,OvisOCR2丰富了千问模型家族在文档智能领域的能力版图,为开发者和企业提供从开源体验到云端部署的完整路径。端到端方法首次登顶,也意味着文档智能正从复杂的系统工程走向更简洁高效的模型驱动范式。
本文收录在
#阿里
- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...


