在文档解析技术领域,阿里云近日取得了一项重大突破。其自主研发的文档解析模型OvisOCR2正式开源发布,凭借卓越性能刷新了OmniDocBench v1.6榜单纪录,成为首个超越传统流水线方法并登顶该榜单的端到端模型。
OvisOCR2的研发基于Qwen3.5-0.8B模型进行后训练,尽管参数量仅为0.8B,却实现了SOTA(State-of-the-Art)级别的性能表现。这一成果得益于阿里云在训练过程中采用的四阶段流程,包括监督微调、强化学习、在线策略蒸馏和模型融合。这些技术手段有效提升了模型的解析能力,使其在复杂文档处理任务中表现出色。
为了充分释放紧凑模型的潜力,阿里云还构建了真实与合成文档互补的数据引擎体系。这一体系不仅提供了丰富的训练数据,还通过数据增强技术提升了模型的泛化能力。在OmniDocBench v1.6榜单测试中,OvisOCR2以综合得分96.58的成绩刷新纪录,充分证明了其技术优势。
目前,OvisOCR2已以Apache 2.0许可证开源,并兼容vLLM等主流推理框架。这意味着开发者可以自由使用和修改该模型,同时还能与Qwen3.5生态无缝衔接,进一步拓展其应用场景。这一举措将推动文档解析技术在更多领域落地应用,为行业带来新的发展机遇。