-
Pdf-inspector:先给 PDF 做分诊,再决定要不要上 OCR
你大概率默认了一件事:把 PDF 变成干净的 Markdown,就得上 OCR 或者视觉大模型。pdf-inspector 干的第一件事,是把这个前提推翻。它先问一句:这份 PDF 里到底有没有现成文字?哪些页能直接读,哪些页才真需要 OCR? 它的做法很克制。读 PDF 的内部结构,看字体编码、文本操作符、图像覆盖度,几十毫秒就判断出它属于 TextBased、Scanned、ImageBase…- 1.2k
- 0
-
Bright Data CLI :终端里的网页数据全家桶,一行命令绕过整条反爬链路
6,284 颗星。这个数字放在 2026 年的开源生态里不算夸张,但放在这个仓库上就很值得琢磨:它 3 月 7 日才首次提交,到 8 月中旬已经摸到六千,其中近 30 天涨了约 4,700。一个 CLI 工具,凭什么? 打开 README 之前,我已经在脑子里列了三条它可能翻车的方式:要么是营销号式的包装,要么是半成品画饼,要么是又一个重复造轮子的抓取器。翻完之后发现,三条都没完全命中。 它叫 B…- 1.1k
- 0
-
Anydoc:把 Office 文档转 Markdown 这件事,Firecrawl 直接开源了一个引擎
一个仓库从创建到冲到 1.6 万 Star,用了不到两周。anydoc 在 2026 年 8 月 3 日才第一次提交,到今天 8 月 16 日,已经攒下 16386 个 Star 和 916 个 fork。这个速度放在 Rust 工具链里相当反常,尤其是它解决的问题听起来一点都不性感:把 Word、Excel、PPT 这些办公文档转成干净的 Markdown。 我第一次看到这个数据时的反应不是惊叹…- 1.2k
- 0






