# Scientific Agent Skills 全流程实验报告

## 实验结论

Scientific Agent Skills 可以把科研方法拆成可安装、可复用的 Agent 工作说明，但安装成功只说明文件已经进入工作环境。今天真正跑通的是其中两项能力，一项负责统计分析，一项负责科研图表。

我们用 2026 年 8 月 29 日 15 时 02 分抓取的 GitHub Trending 全球 Today 前 20 个项目做真实任务。预先选择双侧 Spearman 等级相关，保留全部 20 行，以固定随机种子完成 10,000 次 bootstrap。

最终得到 Spearman rho 0.0451，双侧 p 值 0.8502，95% 区间为 -0.3983 至 0.4754。这份样本没有给出累计 Star 越多、当天新增越多的稳定单调关系证据。

## 种子区

当天榜首为 tt-a1i/archify。它已经在实验田完成发现、核验、实测和产出，因此按去重规则跳过。

第二名 K-Dense-AI/scientific-agent-skills 此前只完成了安装核验。官方仓库公开、未归档，采用 MIT 许可证，主语言为 Python。GitHub API 在本次实验时显示 36,802 stars、3,497 forks，最近一次推送发生在 2026 年 8 月 28 日。

官方 README 声明仓库包含 163 个科研 Skill，也提醒使用者按需安装、逐项审查。不同 Skill 可能运行代码、访问网络、安装软件包或连接外部数据库，这一点决定了我们不能把一次批量安装写成 163 项科研流程全部通过。

## 播种区

本次只安装两个与任务直接相关的 Skill。

```bash
npx -y skills add K-Dense-AI/scientific-agent-skills \
  --skill statistical-analysis \
  --skill scientific-visualization \
  --agent codex --copy --yes
```

命令退出码为 0。安装器识别 163 个 Skill，最终复制 statistical-analysis 和 scientific-visualization 两项。过程没有调用外部模型、付费数据库或付费 API。

真实任务是分析当天雷达抓到的 20 个 Trending 项目。研究问题、变量、检验方法、显著性阈值、bootstrap 次数、随机种子和解释边界均在运行前写入分析计划。

首轮运行退出码为 1。统计量和图表已经生成，失败发生在 Markdown 报告导出阶段。pandas 的 to_markdown 方法需要可选依赖 tabulate，而当前环境没有安装它。

我们没有为了通过测试临时增加依赖。修复方法是用 Python 标准字符串生成 Markdown 表格。第二轮运行退出码为 0，20 行数据全部保留，CSV、JSON、PNG、SVG 和实验结果同时生成。

## 收成区

本次收成包括预注册分析计划、原始 Trending 快照、可复现分析脚本、增强数据、统计摘要、PNG 图、SVG 图、导出清单、两轮运行记录和完整实验报告。

相对动量最高的五个项目依次为 God's Eye View、Tailcat、TypePHP、Go Modern Guidelines 和 Archify。这里的相对动量只表示当天新增 Star 占累计 Star 的比例，不代表代码质量、未来增长或投资价值。

Scientific Agent Skills 自身没有进入相对动量前五。这个结果反而提醒我们，Trending 排名、累计 Star 和当天增长是三件不同的事。

## 收获记

这次实验最有用的收获并非某个漂亮数字，而是一条可以复查的方法路线。

先写清问题和边界，再选择统计方法。保留失败日志，不把报告导出失败删掉。图表同时提供适合阅读的 PNG、适合编辑的 SVG 和机器可读清单。结论只落在当天的 20 个项目上，不向整个 GitHub 外推。

对于剑的 AI 实验室，这套 Skill 更适合当作科研工作说明库。它可以帮助我们建立分析计划、检查假设、规范图表和组织报告。每一次使用仍然需要重新检查数据、依赖、权限和结论边界。

## 竞技场结论

项目状态由已验证升级为已产出。

推荐给需要文献、统计、可视化和科研写作工作流的人。新手可以按任务只安装一两个 Skill。涉及医疗、化学、生物数据、受限数据库和付费模型时，应另行核对授权、隐私、成本与专业审查要求。

本次验证范围只覆盖 statistical-analysis 和 scientific-visualization。其余 161 个 Skill 没有在本次实验中逐项运行。

