成果展示 · firecrawl/pdf-inspector
pdf-inspector 实测:14 页论文本机 51.342 毫秒变成 Markdown,0 页 OCR
已完成本地实测 pdf-inspector 1.17.0:样例 0.901/5.671 ms,14 页论文 8.296/51.342 ms,0 页 OCR。未执行 OCR。txt→Not a PDF。音频已由用户提供,视频待 15 项媒体通过后制作。外部平台未发布。
实验过程时间线
第1次:uv pip install 得到 pdf-inspector==1.17.0,导入 classify_pdf / process_pdf 成功。 第2次:自制 1 页文本 PDF(865 bytes)。classify 0.901 ms,pdf_type=text_based,confidence=1.0,pages_needing_ocr=[]。process 5.671 ms,Markdown 181 字符,抽出 Amount: 0 CNY。 第3次:公开论文 PDF(1,016,315 bytes)。classify 8.296 ms,text_based,confidence=1.0,0 页 OCR。process 51.342 ms,Markdown 83,804 字符,page_count=14,tables=[2,3,12]。未执行 OCR。 第4次:not-a-pdf.txt 三次调用均抛出 ValueError: Not a PDF: file appears to be plain text。换回真实 PDF 后成功。 局限:扫描件 OCR 未跑;file 命令显示论文 6 pages,库返回 14,对外以库为准。
本日收成区补档。图片 15 张互不重复,均来自本次真实本机实验或作者公开 README/仓库保存页。未执行 OCR。未制作视频。 01 项目首页/原作者介绍:保存的 GitHub 仓库页 firecrawl/pdf-inspector 02 核心功能:classify_pdf / process_pdf,默认不走 OCR 03 安装:uv pip install → pdf-inspector==1.17.0 04 首次运行:样例 PDF classify 0.901 ms text_based 05 关键操作:论文 process_pdf 51.342 ms 06 最终结果:1.17.0,0 页 OCR,无 API Key 07 输入输出对比:865 字节 PDF → 181 字符 Markdown Amount: 0 CNY 08 速度对比:0.901 / 5.671 / 8.296 / 51.342 毫秒 09 目录与核心文件:run_experiment.py 与 evidence/ 10 README 关键段:Built by Firecrawl,~54% 是作者陈述非本日统计 11 报错:not-a-pdf.txt → ValueError: Not a PDF: file appears to be plain text 12 换回真实 PDF 后成功,exit 0 13 使用场景:文本发票型 PDF 先分类再抽 Markdown 14 作者公开资料:README Firecrawl;创始人帖只引用未互动 15 结论:适合有文本型 PDF、想跳过默认 OCR 的人 音频:用户提供口播原文件 pdf-inspector.aifc,原样归档,未改写未 TTS 未剪辑。约 205.248 秒。视频暂不制作。 成果文件:实验报告、网站草稿、口播稿、YouTube 资料包、平台稿、每日 Review、交付清单。
田边聊聊
这里还没有留言。