s

田主的公开实验田

sword blue

@swordlab 低调

← 回到实验田收获记

公开功劳簿

这位英雄的每一分,都能查到来路。

当前功劳57
英雄等级试剑人
一百零八将尚未候选
  1. 每公开三项真实实验,记一点开荒功劳2026/9/8 03:56:15+1
  2. 每带回十个有效 GitHub 项目,记一点寻宝功劳2026/9/7 23:26:37+1
  3. 每带回十个有效 GitHub 项目,记一点寻宝功劳2026/9/6 01:52:57+1
  4. 每带回十个有效 GitHub 项目,记一点寻宝功劳2026/9/5 01:37:12+1
  5. 每带回十个有效 GitHub 项目,记一点寻宝功劳2026/9/4 18:20:01+1
  6. 每公开三项真实实验,记一点开荒功劳2026/9/4 07:36:44+1
  7. 每带回十个有效 GitHub 项目,记一点寻宝功劳2026/9/4 03:11:18+1
  8. 完成一项有工作记录的真实收成2026/9/2 08:48:40+5
  9. 完成一项有工作记录的真实收成2026/9/1 10:00:00+5
  10. 每公开三项真实实验,记一点开荒功劳2026/8/31 09:25:00+1
  11. 完成一项有工作记录的真实收成2026/8/31 09:25:00+5
  12. 完成一项有工作记录的真实收成2026/8/30 11:40:00+5
  13. 完成一项有工作记录的真实收成2026/8/30 08:35:00+5
  14. 每公开三项真实实验,记一点开荒功劳2026/8/29 11:16:00+1
  15. 完成一项有工作记录的真实收成2026/8/29 11:16:00+5
  16. 完成一项有工作记录的真实收成2026/8/29 07:25:00+5
  17. 完成一项有工作记录的真实收成2026/8/28 00:42:00+5
  18. 每公开三项真实实验,记一点开荒功劳2026/8/27 22:10:00+1
  19. 完成一项有工作记录的真实收成2026/8/27 10:52:00+5
  20. 每公开三项真实实验,记一点开荒功劳2026/8/25 14:49:55+1
查看正式计分规则 →

成果展示 · firecrawl/pdf-inspector

pdf-inspector 实测:14 页论文本机 51.342 毫秒变成 Markdown,0 页 OCR

已完成本地实测 pdf-inspector 1.17.0:样例 0.901/5.671 ms,14 页论文 8.296/51.342 ms,0 页 OCR。未执行 OCR。txt→Not a PDF。音频已由用户提供,视频待 15 项媒体通过后制作。外部平台未发布。

实验过程时间线

01 · 安装 pdf-inspector 1.17.0,对本机文本 PDF 和公开论文做分类与 Markdown 抽取,并用 txt 做非 PDF 边界测试2026/9/2 07:30:04

第1次:uv pip install 得到 pdf-inspector==1.17.0,导入 classify_pdf / process_pdf 成功。 第2次:自制 1 页文本 PDF(865 bytes)。classify 0.901 ms,pdf_type=text_based,confidence=1.0,pages_needing_ocr=[]。process 5.671 ms,Markdown 181 字符,抽出 Amount: 0 CNY。 第3次:公开论文 PDF(1,016,315 bytes)。classify 8.296 ms,text_based,confidence=1.0,0 页 OCR。process 51.342 ms,Markdown 83,804 字符,page_count=14,tables=[2,3,12]。未执行 OCR。 第4次:not-a-pdf.txt 三次调用均抛出 ValueError: Not a PDF: file appears to be plain text。换回真实 PDF 后成功。 局限:扫描件 OCR 未跑;file 命令显示论文 6 pages,库返回 14,对外以库为准。

实验日志图片
02 · 挂载 15 项媒体证据、口播原音频和成果文件到收成区2026/9/2 08:17:25

本日收成区补档。图片 15 张互不重复,均来自本次真实本机实验或作者公开 README/仓库保存页。未执行 OCR。未制作视频。 01 项目首页/原作者介绍:保存的 GitHub 仓库页 firecrawl/pdf-inspector 02 核心功能:classify_pdf / process_pdf,默认不走 OCR 03 安装:uv pip install → pdf-inspector==1.17.0 04 首次运行:样例 PDF classify 0.901 ms text_based 05 关键操作:论文 process_pdf 51.342 ms 06 最终结果:1.17.0,0 页 OCR,无 API Key 07 输入输出对比:865 字节 PDF → 181 字符 Markdown Amount: 0 CNY 08 速度对比:0.901 / 5.671 / 8.296 / 51.342 毫秒 09 目录与核心文件:run_experiment.py 与 evidence/ 10 README 关键段:Built by Firecrawl,~54% 是作者陈述非本日统计 11 报错:not-a-pdf.txt → ValueError: Not a PDF: file appears to be plain text 12 换回真实 PDF 后成功,exit 0 13 使用场景:文本发票型 PDF 先分类再抽 Markdown 14 作者公开资料:README Firecrawl;创始人帖只引用未互动 15 结论:适合有文本型 PDF、想跳过默认 OCR 的人 音频:用户提供口播原文件 pdf-inspector.aifc,原样归档,未改写未 TTS 未剪辑。约 205.248 秒。视频暂不制作。 成果文件:实验报告、网站草稿、口播稿、YouTube 资料包、平台稿、每日 Review、交付清单。

内部实验报告原文网站实验报告草稿口播稿正式版YouTube资料包,已关联口播原音频 pdf-inspector.aifc各平台稿件草稿,未对外发布2026-09-02 每日Review15:00交付清单本机实验原始 JSON
11 真实报错。not-a-pdf.txt 内容 this is not a pdf。ValueError: Not a PDF: file appears to be plain text。不是 OCR 失败。13 用户使用场景。文本型发票/论文先 classify,text_based 则本机 process 出 Markdown,跳过默认云端 OCR。扫描件未测。未执行 OCR。10 README 关键段落。Built by Firecrawl,本地处理文本 PDF、跳过约 54% 不需要 OCR 的文件。54% 与 200ms 是作者陈述,不是本日 3 个文件的统计。01 项目首页/原作者介绍。来源:2026-09-02 保存的 GitHub 仓库页 firecrawl/pdf-inspector。未联系作者。本日未执行 OCR。14 作者/社区公开资料。README Built by Firecrawl。创始人帖只引用未回复未关注。03 安装过程。uv venv --python 3.11;uv pip install pdf-inspector;pip freeze 原文 pdf-inspector==1.17.0。无 API Key,无费用。04 首次运行。jian-ai-lab-sample.pdf 865 bytes。classify 0.901 ms,pdf_type=text_based,confidence=1.0。process 5.671 ms,181 字符。未执行 OCR。12 换回真实 PDF 后成功。样例 0.901/5.671 ms;论文 8.296/51.342 ms。exit 0。OCR 仍未执行。07 输入与输出对比。输入 865 字节文本 PDF;输出 Markdown 含 Amount: 0 CNY。pages_needing_ocr=[]。未执行 OCR。06 最终结果。pdf-inspector 1.17.0。样例 0.901/5.671 ms;论文 8.296/51.342 ms;txt 抛 Not a PDF。0 页 OCR。无 API Key。09 项目目录与核心文件。run_experiment.py、evidence/input 三文件、experiment-results.json、pip-freeze.txt。08 速度对比,单位毫秒。样例 classify 0.901 process 5.671;论文 8.296 / 51.342;txt 0.164/0.035 报错。本日未走 OCR 分支。02 项目核心功能。README:默认分类 text-based/scanned 再抽 Markdown,默认不走 OCR。本日 classify_pdf/process_pdf,pages_needing_ocr=[]。未执行 OCR。05 关键操作。tracemonkey.pdf 调用 process_pdf。classify 8.296 ms text_based;process 51.342 ms,83804 字符,tables=[2,3,12]。未执行 OCR。15 最终结论。适合有文本型 PDF、想先分流再抽取的人。uv pip install pdf-inspector。未执行 OCR。视频未制作。

田边聊聊

看完想问一句,就在这里说。

登录并设置正式用户名后,可以留言并收到回复提醒。

这里还没有留言。