firecrawl/pdf-inspector
今日唯一实验|pdf-inspector 14 页 51.342 ms 本机 Markdown,0 页 OCR
已完成本地实测 pdf-inspector 1.17.0:样例 0.901/5.671 ms,14 页论文 8.296/51.342 ms,0 页 OCR。未执行 OCR。txt→Not a PDF。音频已由用户提供,视频待 15 项媒体通过后制作。外部平台未发布。
实验田正式路线
这项项目没有绕过实验田。
01种子区 · 已发现Trending 线索、GitHub 仓库和项目库档案已经绑定。
02种子区 · 已核验固定提交,核对 README、许可、版本、外部服务和数据边界。
03播种区 · 已实测0 次工作记录保留环境、命令、退出码、失败和修复。
04收成区 · 已产出0 项成果与同一实验绑定,阶段状态仍为进行中。
05收获记 · 已公开公开实验页、竞技场摘要与多平台发布证据回到同一条记录。
01 · 问题
我想解决什么
默认把 PDF 送去 OCR,文本型文件也在排队。
02 · 过程
我是怎样做的
本机 uv pip install pdf-inspector==1.17.0 后 classify_pdf / process_pdf。未执行 OCR。
03 · 结果
实际发生了什么
样例 0.901/5.671 ms;论文 8.296/51.342 ms;txt → Not a PDF。
05 · 最终评价
这次实验的结论
适合文本型 PDF 先分流。公开实验 https://jianailab.com/experiments/pdf-inspector-cf28f675