返回深读目录

docling:把 PDF 表格公式喂给 AI 之前,先过它这一手

docling 是一个文档解析工具,把 PDF、DOCX、PPTX、XLSX、HTML、EPUB、图片、音频等格式统一转成 Markdown、HTML 或 JSON。今天在涨星榜上,星数 67418。

现在的做法是复制粘贴。PDF 里的表格粘进对话框就散成一行行文字,公式变成乱码,扫描件干脆一个字都提不出来。想让模型读一份财报或论文,光整理格式就耗掉半小时,还经常漏掉跨页的表格。

它解决的就是这一步。把一份带表格和公式的 PDF 丢进去,输出的 Markdown 里表格还是表格,公式还是公式,标题层级和阅读顺序都保留。扫描件走 OCR,图片里的文字也能提出来。输出直接喂给模型,不用再手工对齐。

它有一个统一的 DoclingDocument 表示格式,所有输入格式先转成这个中间结构,再导出成你要的格式。省掉的是逐格式写解析脚本这一步——PDF 一套逻辑、DOCX 另一套、图片再一套,现在一份代码走完。

本地执行,敏感数据不用上传。装完打开就能用,对新手不算难。涉及批量处理文件时,动手前备份原始文档。

如果你感兴趣但不会装,评论区或私信喊我一声。