文档解析界杀疯了!阿里新开源模型横扫复杂格式,公式表格一键结构化
你是否经历过这样的崩溃瞬间:花两小时手动录入PDF里的化学分子式,结果因为一个下标标错前功尽弃;对着论文里的复杂表格抓耳挠腮,复制粘贴后格式全乱;现在,这些烦恼可能要被一个新开源工具终结了。
项目地址:https://github.com/alibaba/Logics-Parsing

从手写笔记到科研论文,它通吃了
最近阿里达摩团队悄悄开源了一个叫Logics-Parsing的文档解析模型,直接把「文档识别」的难度拉到了新高度。不同于传统OCR工具只能的"见字识字",这个模型能像人类一样「理解」文档的逻辑结构。
看这组对比就知道有多猛:
- 科研论文里的嵌套表格,它能精准拆分单元格并保留数据关系
- 手写公式旁的批注,会被标记为"注释"而非正文
- 化学结构式自动转成SMILES标准格式,直接对接实验室分析工具
- 连横跨两页的流程图,都能识别出完整的箭头指向关系
最绝的是它的输出格式——不是乱糟糟的文本块,而是带标签的HTML代码。每个内容块都贴心地标注了类别(段落/公式/图表)、坐标位置和识别文本,开发者拿过去就能直接用。
性能碾压同类,刷新9项指标第一
在包含1078页复杂文档的 benchmark 上,Logics-Parsing 交出了一份亮眼成绩单:
- 整体编辑距离比Mathpix低3.2%,比GPT-5低近50%
- 中文表格识别准确率86.6%,超过专业工具Textin
- 手写内容解析错误率仅25.2%,领先第二名14%
特别在STEM领域,这个模型展现了碾压优势。处理化学结构式时,它的错误率只有51.9%,而同类工具普遍在80%以上。对于带公式的学术论文,其文本识别错误率低至8.9%,相当于每百字仅错不到1个。
三步上手,小白也能玩转
这个黑科技用起来其实很简单,连我这种代码小白都能轻松搞定:
- 搭环境
先建个conda环境,一行命令安装依赖:
conda create -n logis-parsing python=3.10
conda activate logis-parsing
pip install -r requirement.txt
- 下模型
支持从HuggingFace或ModelScope下载,选一个就行:
# 从HuggingFace下载
pip install huggingface_hub
python download_model.py -t huggingface
# 从ModelScope下载
pip install modelscope
python download_model.py -t modelscope
- 跑起来
丢张图片进去,等几秒就出结果:
python3 inference.py --image_path 你的图片路径 --output_path 结果保存路径 --model_path 模型文件夹路径
生成的HTML文件可以直接用浏览器打开,还会自动输出带 bounding box 的可视化图片,哪里识别了什么一目了然。
谁会爱上这个工具?
实测下来,这几类人可能会立刻爱上它:
- 研究生:批量处理文献时,公式表格一键提取成可编辑格式
- 数据分析师:把扫描版报表转成结构化数据,省去手动录入
- 化学研究员:结构式自动转SMILES,直接导入实验分析软件
- 开发者:现成的API接口,三行代码集成到自己的系统里
不过要注意,目前模型对极端长宽比的文档(比如长截图)支持还不太好,团队说下个版本会优化这个问题。
开源精神值得点赞
最让人惊喜的是,这么强的工具居然完全开源,基于Apache 2.0协议,商用也没问题。团队还贴心地提供了在线Demo,不想搭环境的可以先去ModelScope试玩。
对比那些动辄收费几百的PDF转换工具,Logics-Parsing 简直是业界良心。更重要的是,它证明了VLMs模型在专业领域的潜力——原来文档解析也能告别繁琐的多步 pipeline,用一个模型搞定所有事。
你平时被哪种文档格式折磨得最惨?是手写笔记、复杂表格还是化学公式?来留言区聊聊。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)