你是否经历过这样的崩溃瞬间:花两小时手动录入PDF里的化学分子式,结果因为一个下标标错前功尽弃;对着论文里的复杂表格抓耳挠腮,复制粘贴后格式全乱;现在,这些烦恼可能要被一个新开源工具终结了。

项目地址:https://github.com/alibaba/Logics-Parsing

在这里插入图片描述

从手写笔记到科研论文,它通吃了

最近阿里达摩团队悄悄开源了一个叫Logics-Parsing的文档解析模型,直接把「文档识别」的难度拉到了新高度。不同于传统OCR工具只能的"见字识字",这个模型能像人类一样「理解」文档的逻辑结构。

看这组对比就知道有多猛:

  • 科研论文里的嵌套表格,它能精准拆分单元格并保留数据关系
  • 手写公式旁的批注,会被标记为"注释"而非正文
  • 化学结构式自动转成SMILES标准格式,直接对接实验室分析工具
  • 连横跨两页的流程图,都能识别出完整的箭头指向关系

最绝的是它的输出格式——不是乱糟糟的文本块,而是带标签的HTML代码。每个内容块都贴心地标注了类别(段落/公式/图表)、坐标位置和识别文本,开发者拿过去就能直接用。
在这里插入图片描述

性能碾压同类,刷新9项指标第一

在包含1078页复杂文档的 benchmark 上,Logics-Parsing 交出了一份亮眼成绩单:

  • 整体编辑距离比Mathpix低3.2%,比GPT-5低近50%
  • 中文表格识别准确率86.6%,超过专业工具Textin
  • 手写内容解析错误率仅25.2%,领先第二名14%

特别在STEM领域,这个模型展现了碾压优势。处理化学结构式时,它的错误率只有51.9%,而同类工具普遍在80%以上。对于带公式的学术论文,其文本识别错误率低至8.9%,相当于每百字仅错不到1个。

三步上手,小白也能玩转

这个黑科技用起来其实很简单,连我这种代码小白都能轻松搞定:

  1. 搭环境
    先建个conda环境,一行命令安装依赖:
conda create -n logis-parsing python=3.10
conda activate logis-parsing
pip install -r requirement.txt
  1. 下模型
    支持从HuggingFace或ModelScope下载,选一个就行:
# 从HuggingFace下载
pip install huggingface_hub
python download_model.py -t huggingface

# 从ModelScope下载
pip install modelscope
python download_model.py -t modelscope
  1. 跑起来
    丢张图片进去,等几秒就出结果:
python3 inference.py --image_path 你的图片路径 --output_path 结果保存路径 --model_path 模型文件夹路径

生成的HTML文件可以直接用浏览器打开,还会自动输出带 bounding box 的可视化图片,哪里识别了什么一目了然。

谁会爱上这个工具?

实测下来,这几类人可能会立刻爱上它:

  • 研究生:批量处理文献时,公式表格一键提取成可编辑格式
  • 数据分析师:把扫描版报表转成结构化数据,省去手动录入
  • 化学研究员:结构式自动转SMILES,直接导入实验分析软件
  • 开发者:现成的API接口,三行代码集成到自己的系统里

不过要注意,目前模型对极端长宽比的文档(比如长截图)支持还不太好,团队说下个版本会优化这个问题。

开源精神值得点赞

最让人惊喜的是,这么强的工具居然完全开源,基于Apache 2.0协议,商用也没问题。团队还贴心地提供了在线Demo,不想搭环境的可以先去ModelScope试玩。

对比那些动辄收费几百的PDF转换工具,Logics-Parsing 简直是业界良心。更重要的是,它证明了VLMs模型在专业领域的潜力——原来文档解析也能告别繁琐的多步 pipeline,用一个模型搞定所有事。

你平时被哪种文档格式折磨得最惨?是手写笔记、复杂表格还是化学公式?来留言区聊聊。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐