-
Pdf-inspector:先给 PDF 做分诊,再决定要不要上 OCR
你大概率默认了一件事:把 PDF 变成干净的 Markdown,就得上 OCR 或者视觉大模型。pdf-inspector 干的第一件事,是把这个前提推翻。它先问一句:这份 PDF 里到底有没有现成文字?哪些页能直接读,哪些页才真需要 OCR? 它的做法很克制。读 PDF 的内部结构,看字体编码、文本操作符、图像覆盖度,几十毫秒就判断出它属于 TextBased、Scanned、ImageBase…- 1.2k
- 0
-
Anydoc:把 Office 文档转 Markdown 这件事,Firecrawl 直接开源了一个引擎
一个仓库从创建到冲到 1.6 万 Star,用了不到两周。anydoc 在 2026 年 8 月 3 日才第一次提交,到今天 8 月 16 日,已经攒下 16386 个 Star 和 916 个 fork。这个速度放在 Rust 工具链里相当反常,尤其是它解决的问题听起来一点都不性感:把 Word、Excel、PPT 这些办公文档转成干净的 Markdown。 我第一次看到这个数据时的反应不是惊叹…- 1.2k
- 0




