阿里云开源OvisOCR2文档解析模型,端到端技术路线实现重大突破登顶榜单

   发布时间:2026-07-24 18:00 作者:胡颖

阿里云近日宣布,正式开源其最新研发的文档解析模型OvisOCR2。该模型在OmniDocBench v1.6基准测试中以96.58分的综合成绩打破纪录,成为全球首个超越传统流水线方法的端到端文档解析模型,标志着文档处理领域技术路线迎来重大革新。

传统文档解析技术长期依赖"流水线方法",该方案需通过版面分析模型定位文档结构,再由内容识别模型提取文字、公式和表格信息,最后拼接输出结果。这种多阶段协作模式虽成熟稳定,但存在部署复杂度高、误差传递风险大、维护成本高等显著缺陷,尤其在处理复杂版式文档时表现受限。

OvisOCR2采用革命性的端到端架构,仅需输入文档图像即可直接生成符合自然阅读顺序的Markdown格式输出,完整覆盖文本、公式、表格及视觉区域等要素。通过单模型实现多任务协同处理,该方案成功将传统需要多个模型协作的复杂流程简化为单次推理过程,在保证解析精度的同时大幅提升处理效率。

技术实现层面,该模型基于Qwen3.5-0.8B架构优化而来,通过构建真实文档与合成文档互补的数据训练体系,重点强化了表格公式交织、多栏排版、长文本输出等复杂场景的处理能力。训练流程创新性地融合监督微调、强化学习、在线策略蒸馏和模型融合四阶段技术,形成递进式训练框架,充分释放了紧凑型模型的性能潜力。

开源生态建设方面,OvisOCR2采用Apache 2.0许可证协议发布,已实现与vLLM等主流推理框架的无缝兼容,并深度适配Qwen3.5推理生态。开发者可直接调用模型接口,无需进行额外适配即可集成到现有系统中,显著降低了文档解析技术的落地门槛。

 
 
更多>同类内容
全站最新
热门内容
本栏最新