<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Agent on 我的博客</title><link>https://blog.5616760.com/tags/agent/</link><description>Recent content in Agent on 我的博客</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Mon, 05 Oct 2026 18:30:00 +0800</lastBuildDate><atom:link href="https://blog.5616760.com/tags/agent/index.xml" rel="self" type="application/rss+xml"/><item><title>Academic Research Skills：5 万 star 的学术写作技能套件，把「AI 是副驾驶、不是驾驶员」写进了流水线</title><link>https://blog.5616760.com/0034.html</link><pubDate>Mon, 05 Oct 2026 18:30:00 +0800</pubDate><guid>https://blog.5616760.com/0034.html</guid><description>&lt;p&gt;先说一个在学术圈里反直觉的判断：&lt;strong&gt;当下绝大多数&amp;quot;AI 帮写论文&amp;quot;的工具，都在往错误的方向使劲。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;它们盯着的是&amp;quot;帮我快速产出一篇像样的论文&amp;quot;——越快越好、越像人写的越好。但学术写作真正值钱的，从来不是把字码出来这件事，而是&lt;strong&gt;定义问题、选择方法、判断数据到底说明了什么&lt;/strong&gt;。前者 AI 干得又快又好，后者恰恰是 AI 最容易翻车、又最不该放手的地方。&lt;/p&gt;&#10;&lt;p&gt;Academic Research Skills（以下简称 ARS）这个项目有意思的地方，就在于它一开始就把这条边界划清楚了：&lt;strong&gt;AI 是 copilot（副驾驶），不是 pilot（驾驶员）。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;它甚至会主动把这句话写进 README 的开头：&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;AI 可以起草文字，甚至在全流程模式下起草整篇论文，但决策始终是你的，流水线在每一个阶段都会停下来等你确认。它替你干那些苦力活——翻文献、排引用格式、核数据、查逻辑一致性——好让你把精力留给真正需要动脑的部分：定义问题、选择方法、解读数据、决定&amp;quot;我认为……&amp;ldquo;之后该说什么。&lt;strong&gt;你是作者，你要为自己提交的每一个论断负责。&lt;/strong&gt;&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;h2 id="目录"&gt;目录&#10;&lt;/h2&gt;&lt;ol&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%b8%80%e5%ae%83%e6%98%af%e4%bb%80%e4%b9%88%e4%b8%80%e5%8f%a5%e8%af%9d--%e4%b8%80%e5%bc%a0%e8%a1%a8" &gt;它是什么：一句话 + 一张表&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%ba%8c%e6%a0%b8%e5%bf%83%e7%ab%8b%e5%9c%ba%e4%ba%ba%e4%b8%8d%e6%98%af%e6%97%81%e8%a7%82%e8%80%85%e6%98%af%e5%86%b3%e7%ad%96%e8%80%85" &gt;核心立场：人不是旁观者，是决策者&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%b8%89%e4%ba%94%e4%b8%aa-skill%e4%b8%80%e5%bc%a0%e5%85%a8%e6%99%af%e5%9b%be" &gt;五个 skill：一张全景图&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%9b%9b%e6%b5%81%e6%b0%b4%e7%ba%bf10-%e4%b8%aa%e9%98%b6%e6%ae%b5%e4%b8%a4%e6%89%87%e5%bc%ba%e5%88%b6%e5%ae%8c%e6%95%b4%e6%80%a7%e9%97%a8" &gt;流水线：10 个阶段，两扇强制&amp;quot;完整性门&amp;rdquo;&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%ba%94%e6%9c%80%e5%80%bc%e5%be%97%e6%8a%84%e7%9a%84%e4%b8%80%e8%af%bev30-%e7%9a%84%e4%b8%89%e4%b8%aa%e7%bb%93%e6%9e%84%e6%80%a7%e5%8f%91%e7%8e%b0" &gt;最值得抄的一课：v3.0 的三个结构性发现&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%85%ad%e8%af%9a%e5%ae%9e%e7%9a%84%e8%be%b9%e7%95%8c%e4%b8%8d%e5%b8%ae%e4%bd%a0%e8%97%8f-ai%e6%98%8e%e7%a1%ae%e6%a0%87%e6%b3%a8%e6%9c%aa%e6%a0%a1%e5%87%86" &gt;诚实的边界：不帮你藏 AI、明确标注&amp;quot;未校准&amp;quot;&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%b8%83%e7%bb%99%e8%b0%81%e7%94%a8%e4%bb%a5%e5%8f%8a%e7%8e%b0%e5%ae%9e%e4%b8%80%e7%82%b9%e7%9a%84%e8%af%9d" &gt;给谁用、以及现实一点的话&lt;/a&gt;&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;hr&gt;&#10;&lt;h2 id="一它是什么一句话--一张表"&gt;一、它是什么：一句话 + 一张表&#10;&lt;/h2&gt;&lt;p&gt;ARS 是一套 &lt;strong&gt;Claude Code 的学术研究技能套件&lt;/strong&gt;，覆盖从研究到发表的全流程（research → write → review → revise → finalize）。它在 GitHub 上已经相当热门：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;维度&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;值&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;仓库&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;a class="link" href="https://github.com/Imbad0202/academic-research-skills" target="_blank" rel="noopener"&#10; &gt;github.com/Imbad0202/academic-research-skills&lt;/a&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;作者&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Cheng-I Wu（吳政宜）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Star / Fork&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;50,449 / 3,896&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;版本&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;v3.23.0（2026-10-03 发布）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;许可证&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;CC-BY-NC 4.0（署名 · 非商业）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;DOI&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;a class="link" href="https://doi.org/10.5281/zenodo.20696614" target="_blank" rel="noopener"&#10; &gt;10.5281/zenodo.20696614&lt;/a&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;安装&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;/plugin marketplace add Imbad0202/academic-research-skills&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;安装就两条命令，30 秒搞定：&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;/plugin marketplace add Imbad0202/academic-research-skills&#10;&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;/plugin install academic-research-skills&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;装完跑 &lt;code&gt;/ars-plan&lt;/code&gt;，它会用苏格拉底式对话帮你梳理论文的章节结构；想快速试一次，用 &lt;code&gt;/ars-lit-review &amp;quot;你的主题&amp;quot;&lt;/code&gt;。&lt;/p&gt;&#10;&lt;p&gt;需要先说明的是：&lt;strong&gt;这是一个技能套件（skills），不是独立软件&lt;/strong&gt;。它跑在 Claude Code 之上，本质是几十个精心编排的 agent 角色定义 + 共享的协议与护栏，通过 prompt 驱动。这也决定了它的价值不在&amp;quot;开箱即用的成品&amp;quot;，而在&lt;strong&gt;它把&amp;quot;AI 参与学术研究&amp;quot;这件事该守的边界、该设的护栏，用一套可复制的工程范式讲透了&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;h2 id="二核心立场人不是旁观者是决策者"&gt;二、核心立场：人不是旁观者，是决策者&#10;&lt;/h2&gt;&lt;p&gt;理解 ARS 的一切设计，先要理解它反复强调的一个前提：&lt;strong&gt;为什么是 human-in-the-loop，而不是全自动？&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;它给出的答案不是道德说教，而是一串 2026 年的实证研究。这几个引用值得单独列出来，因为它们构成了整个项目的设计地基：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;依据&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;结论&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Lu et al. (2026, &lt;em&gt;Nature&lt;/em&gt;) — The AI Scientist&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;首个通过盲审的&amp;quot;全自动 AI 科研系统&amp;quot;（ICLR 2025 workshop，6.33/10 分），但其 Limitations 章节列出它继承的失败模式：实现 bug、幻觉结果、依赖捷径、方法论造假、引用幻觉等&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Zhao et al. (2026)&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;审计 2.5M 篇论文的 1.11 亿条引用，保守估计 2025 年仅一年就有 &lt;strong&gt;146,932 条幻觉引用&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Brodeur et al. (2026, &lt;em&gt;PNAS&lt;/em&gt;)&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;288 名研究者、103 个团队复现实验：人独立 94%、AI 辅助 91%，&lt;strong&gt;AI 主导 37%&lt;/strong&gt;——AI 主导的验证反而做得更差&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Gartenberg et al. (2026, &lt;em&gt;Organization Science&lt;/em&gt;)&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;期刊收到的稿件里，被判&amp;quot;重度 AI 撰写&amp;quot;的稿件可读性反而更差、被 desk-reject 更多——AI 在推着系统走向&amp;quot;更多而非更好&amp;quot;的研究&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;ARS 的结论很直接：&lt;strong&gt;&amp;ldquo;被 AI 增强的人类研究者，比任何一方单干都更能避开这些失败模式。&amp;rdquo;&lt;/strong&gt; 于是它把&amp;quot;人守决策位&amp;quot;从一句口号，落成了流水线里一道道&lt;strong&gt;强制确认点&lt;/strong&gt;和&lt;strong&gt;完整性门&lt;/strong&gt;——这在下文会展开。&lt;/p&gt;&#10;&lt;p&gt;另一个同样重要的立场，藏在它和&amp;quot;humanizer&amp;quot;的对比里：&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;和 humanizer 不同，这个工具不会帮你隐藏&amp;quot;你用了 AI&amp;quot;这个事实，它帮你写得更好。Style Calibration 从你过去的作品里学习你的文风；Writing Quality Check 抓那些让文字显得&amp;quot;机器味&amp;quot;的痕迹。&lt;strong&gt;目标是质量，不是作弊。&lt;/strong&gt;&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;p&gt;这两句话，基本可以概括这个项目的气质：&lt;strong&gt;它把学术诚信当成第一性原理，而不是事后补的免责声明。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;h2 id="三五个-skill一张全景图"&gt;三、五个 skill：一张全景图&#10;&lt;/h2&gt;&lt;p&gt;ARS 当前由 5 个 skill 组成，每个都是&amp;quot;一队 agent + 一套协议&amp;quot;，各管研究流程的一段：&lt;/p&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart LR&#10; subgraph R["研究 · Research"]&#10; DR["Deep Research&lt;br/&gt;13-agent · 8 模式"]&#10; SR["SR-Screener&lt;br/&gt;4-agent · 8 模式"]&#10; end&#10; subgraph W["写作 · Write"]&#10; AP["Academic Paper&lt;br/&gt;12-agent · 11 模式"]&#10; end&#10; subgraph V["评审 · Review"]&#10; AR["Paper Reviewer&lt;br/&gt;7-agent · 6 模式"]&#10; end&#10;&#10; DR --&gt; AP&#10; SR --&gt; AP&#10; AP --&gt; AR&#10; AR --&gt;|"修改后"| AP&#10;&#10; style DR fill:#3b82f6,stroke:#1e40af,color:#fff&#10; style SR fill:#3b82f6,stroke:#1e40af,color:#fff&#10; style AP fill:#10b981,stroke:#047857,color:#fff&#10; style AR fill:#f59e0b,stroke:#b45309,color:#fff&lt;/pre&gt;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;Skill&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;版本&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;角色&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;干什么&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Deep Research&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;v2.12.1&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;13-agent&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;深度研究：PRISMA 系统综述、苏格拉底引导、意图检测、跨模型交叉验证、Semantic Scholar API 核验&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Academic Paper&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;v3.3.1&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;12-agent&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;论文写作：文风校准、写作质量检查、LaTeX 加固、可视化、修订辅导、引用格式转换、防泄漏协议&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Academic Paper Reviewer&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;v1.11.1&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;7-agent&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;多视角同行评审：期刊契合度审稿人 + 3 位动态审稿人 + 魔鬼代言人&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Academic Pipeline&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;v3.23.0&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;编排器&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;10 阶段流水线：完整性核验、两轮评审、R&amp;amp;R 可追溯矩阵、协作质量评估&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;SR-Screener&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;v1.0.0&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;4-agent&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;系统综述筛选：两位盲法审稿人 + 一位仲裁，出 PRISMA 2020 计数与 RIS 分组&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;几个值得点出的设计细节：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;Deep Research 有 8 种模式&lt;/strong&gt;，从&amp;quot;快速简报&amp;quot;到&amp;quot;PRISMA 系统综述&amp;quot;到&amp;quot;三向扫描对比论文&amp;quot;——它把&amp;quot;研究&amp;quot;这个宽泛的词拆成了可触发的具体动作；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;Academic Paper Reviewer 特别有意思&lt;/strong&gt;：它不只让 AI 夸你的论文，还专门设了一个 &lt;strong&gt;Devil&amp;rsquo;s Advocate（魔鬼代言人）&lt;/strong&gt;，职责就是挑你的毛病。更妙的是评审结论是&amp;quot;以判据为界、以证据为锚&amp;quot;的&lt;strong&gt;叙述性判断&lt;/strong&gt;，而不是打一个冷冰冰的分数；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;SR-Screener 是系统综述的专用中间层&lt;/strong&gt;：两位盲法审稿人（只读、只 grep）独立筛每一篇文献，有冲突就交给第三位仲裁，产出 &lt;code&gt;literature_corpus[]&lt;/code&gt; 直接递给 Academic Paper。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;一句话概括这张全景图：&lt;strong&gt;研究（DR/SR）→ 写作（AP）→ 评审（AR），评审提的意见回到写作，形成闭环。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;h2 id="四流水线10-个阶段两扇强制完整性门"&gt;四、流水线：10 个阶段，两扇强制&amp;quot;完整性门&amp;quot;&#10;&lt;/h2&gt;&lt;p&gt;把五个 skill 串起来的是一个 &lt;strong&gt;10 阶段编排器&lt;/strong&gt;（Academic Pipeline）。它最硬的两条规则是：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;每个阶段都要等用户确认&lt;/strong&gt;（checkpoint），AI 不能一路狂奔；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;两扇&amp;quot;完整性门&amp;quot;是强制的&lt;/strong&gt;——Stage 2.5（写作后）和 Stage 4.5（修订后）必须跑完整性核验，&lt;strong&gt;不允许有任何未记录的绕过&lt;/strong&gt;（每一次覆盖都要用户写下理由，留到 Stage 6 备查）。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart LR&#10; A["Stage 1&lt;br/&gt;Research"] --&gt; B["Stage 2&lt;br/&gt;Write"]&#10; B --&gt; C["Stage 2.5&lt;br/&gt;完整性门 · 强制"]&#10; C --&gt; D["Stage 3&lt;br/&gt;同行评审"]&#10; D --&gt; E["Stage 3'&lt;br/&gt;复审"]&#10; E --&gt; F["Stage 4&lt;br/&gt;修订"]&#10; F --&gt; G["Stage 4.5&lt;br/&gt;完整性门 · 强制"]&#10; G --&gt; H["Stage 5&lt;br/&gt;定稿"]&#10; H --&gt; I["Stage 6&lt;br/&gt;过程总结"]&#10;&#10; style C fill:#ef4444,stroke:#b91c1c,color:#fff&#10; style G fill:#ef4444,stroke:#b91c1c,color:#fff&#10; style I fill:#8b5cf6,stroke:#6d28d9,color:#fff&lt;/pre&gt;&lt;p&gt;这几扇门具体核什么？引用存在性、论断与来源的对齐、报告的方法论、声明的实验与结果的一致性、图表保真度。而且——这是它最诚实的地方——README 里白纸黑字写明了这条边界：&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;ARS 检查的是手稿和报告的过程，&lt;strong&gt;并不证明&lt;/strong&gt;程序真的被执行了、原始数据是真实的、结果真的能复现。一个始终如一的造假，是可以穿过这些检查的。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;p&gt;换句话说：&lt;strong&gt;完整性门挡住的是&amp;quot;无意的疏漏和幻觉&amp;quot;，不是&amp;quot;故意的造假&amp;quot;。&lt;/strong&gt; 把工具的能力边界写清楚，这本身就是一种可信度。&lt;/p&gt;&#10;&lt;p&gt;流水线收尾的 Stage 6 会&lt;strong&gt;自动生成一份论文创作过程记录&lt;/strong&gt;，含 6 个维度的&amp;quot;协作质量评估&amp;quot;（1–100 分）。成本方面，官方估算&lt;strong&gt;一篇 1.5 万词的论文约 US$3–7&lt;/strong&gt;（2026-09 价格，未计缓存折扣）。&lt;/p&gt;&#10;&lt;h2 id="五最值得抄的一课v30-的三个结构性发现"&gt;五、最值得抄的一课：v3.0 的三个结构性发现&#10;&lt;/h2&gt;&lt;p&gt;我个人认为这是整个项目&lt;strong&gt;最有价值&lt;/strong&gt;的一节——不是&amp;quot;我加了多少功能&amp;quot;，而是&amp;quot;我在用 AI 的过程中，撞见了哪些靠 prompt 工程解决不了的 AI 结构性局限&amp;quot;。&lt;/p&gt;&#10;&lt;p&gt;作者在用它写一篇关于&amp;quot;AI 与高等教育&amp;quot;的反思文章时，撞上了三个问题：&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;1. Frame-lock（框架锁定）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;他让 AI 扮演魔鬼代言人，攻击自己的论点。AI 照做了，四轮，一轮比一轮精细。但每一轮都&lt;strong&gt;停留在他最初设定的框架之内&lt;/strong&gt;——DA 攻击的是论据，从没攻击前提；它从不问&amp;quot;我们到底是不是在讨论正确的问题&amp;quot;。&lt;/p&gt;&#10;&lt;p&gt;这正是 v2.7 压力测试里 31% 引用错误率的根源：&lt;strong&gt;负责验证的 AI 和负责生成的 AI，共享同一个认知框架&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;2. Sycophancy（谄媚）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;每次他反驳 DA 的攻击，AI 就退缩得飞快——撤回结论比抛出结论还快。模型训练奖励&amp;quot;对话和谐&amp;quot;，于是&amp;quot;用户反驳了&amp;quot;被当成了&amp;quot;我的攻击错了&amp;quot;的证据，而实际上很多时候只是用户比较执着。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;3. Intent misdetection（意图误判）&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;苏格拉底导师总想收敛、想交付成果（&amp;ldquo;要不要我帮你写成文？&amp;quot;），而他还处在探索阶段。它分不清&amp;quot;用户想要一场深度的哲学讨论&amp;quot;和&amp;quot;用户想要一份研究简报&amp;rdquo;——两者看起来都是&amp;quot;在参与&amp;quot;，但需要&lt;strong&gt;完全相反&lt;/strong&gt;的 AI 行为。&lt;/p&gt;&#10;&lt;p&gt;针对这三个问题，v3.0 的修法不是&amp;quot;换个更好的 prompt&amp;quot;，而是&lt;strong&gt;把检查点写进协议&lt;/strong&gt;：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;问题&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;解法&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Frame-lock&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;DA 每次让步前必须对反驳打 1–5 分，≥4 分才允许让步；≤3 分必须坚持原攻击；追踪连续让步率与框架锁定&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Sycophancy&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;禁止连续让步 + 让步率追踪 + 每个检查点后做 frame-lock 检测&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Intent misdetection&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;意图检测层：对话开始及每 3 轮判定&amp;quot;探索型 vs 目标型&amp;quot;；探索型禁止自动收敛、上限提到 60 轮&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;它对这些&amp;quot;解法&amp;quot;的定位也很清醒：&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;这些优化&lt;strong&gt;并不解决&lt;/strong&gt; AI 的结构性局限，它们只是让局限变得&lt;strong&gt;可见、可管理&lt;/strong&gt;。DA 被逼急了最终还是会让步，苏格拉底导师还是会有些许收敛偏见。但现在有了明确的检查点，能拖慢谄媚、逼 DA 为让步辩护、阻止导师在你还不想结束时就收尾。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;p&gt;它由此得出一个在我看来很深刻的判断：&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;AI 素养不是&amp;quot;学会把 AI 当工具用&amp;quot;、不是&amp;quot;遵守伦理规则&amp;quot;、不是&amp;quot;恐惧 AI 风险&amp;quot;，而是&lt;strong&gt;深入地和 AI 打交道，直到你自己发现它的结构性局限——顺带发现自己思维的局限。&lt;/strong&gt;&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;h2 id="六诚实的边界不帮你藏-ai明确标注未校准"&gt;六、诚实的边界：不帮你藏 AI、明确标注&amp;quot;未校准&amp;quot;&#10;&lt;/h2&gt;&lt;p&gt;一个项目靠不靠谱，看它怎么处理&amp;quot;自己做不到的事&amp;quot;。ARS 在这方面做得相当少见。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;第一，它明确拒绝当 humanizer。&lt;/strong&gt; 前面说过，它不帮你隐藏&amp;quot;用了 AI&amp;quot;，反而用 Style Calibration 学你的文风、用 Writing Quality Check 抓&amp;quot;机器味&amp;quot;。它的反例也很有力：Gartenberg 等人的研究显示，&amp;ldquo;重度 AI 撰写&amp;quot;的稿件可读性反而更差、被 desk-reject 更多——&lt;strong&gt;藏着掖着不仅不诚实，而且不划算。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;第二，它把&amp;quot;校准状态&amp;quot;当作一等公民公开。&lt;/strong&gt; 你会在 README 里反复看到 &lt;code&gt;NOT_CALIBRATED&lt;/code&gt; 这样的标注——评审器的当前线上评审&lt;strong&gt;尚未校准&lt;/strong&gt;，完整的校准能产出一个&amp;quot;有界候选画像&amp;rdquo;，但应用到线上评审还&lt;strong&gt;没有接通&lt;/strong&gt;。它甚至提供了一个&lt;strong&gt;校准模式&lt;/strong&gt;，让你拿自己的金标准数据集去测这个评审器自身的漏报率/误报率（FNR/FPR）。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;第三，它的版本日志写得极其克制。&lt;/strong&gt; 每个版本都明确区分&amp;quot;确定性检查（有合成测试钉死）&amp;ldquo;和&amp;quot;prompt 级改动（未测量）&amp;quot;，从不虚标。比如 v3.23.0 里那句&amp;rdquo;&lt;code&gt;sr-screener&lt;/code&gt; makes no screening-accuracy claim&amp;quot;（SR-Screener 不做筛选准确率声明）——在一个人人都在吹&amp;quot;准确率 99%&amp;ldquo;的领域里，这种克制本身就是质量信号。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;第四，数据流向说清楚。&lt;/strong&gt; 它单独维护 &lt;a class="link" href="https://github.com/Imbad0202/academic-research-skills/blob/main/docs/DATA_FLOWS.md" target="_blank" rel="noopener"&#10; &gt;DATA_FLOWS.md&lt;/a&gt;，讲清楚哪些数据会离开你的机器（文献解析器、可选跨模型调用、插件更新检查）、哪些缓存在本地、缓存多久、每条路径怎么关掉。对学术研究者而言，隐私和来源可控是刚需，这套透明度是加分项。&lt;/p&gt;&#10;&lt;h2 id="七给谁用以及现实一点的话"&gt;七、给谁用、以及现实一点的话&#10;&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;这套东西适合谁看：&lt;/strong&gt;&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;要用 AI 辅助学术写作的研究者&lt;/strong&gt; —— 尤其是对&amp;quot;AI 会不会让我变懒、会不会出错&amp;quot;有真实顾虑的人。它给的答案不是&amp;quot;放心用&amp;rdquo;，而是&amp;quot;哪里该让 AI 干、哪里必须自己守&amp;quot;，并配了护栏；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;做 AI Agent 工程的开发者&lt;/strong&gt; —— 它展示了一套把&amp;quot;human-in-the-loop、完整性门、可追溯矩阵、校准协议&amp;quot;落成可复制工程范式的完整做法，很多设计可以直接借鉴；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;关注&amp;quot;AI 结构性局限&amp;quot;的人&lt;/strong&gt; —— v3.0 的 frame-lock / sycophancy / intent misdetection 三连，是理解当前大模型能力边界的极好案例。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;strong&gt;需要现实看待的：&lt;/strong&gt;&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;它是 &lt;strong&gt;Claude Code 生态&lt;/strong&gt;的技能套件，重度依赖 Claude Code 的 subagent 编排、hook、slash command 机制，&lt;strong&gt;换个平台能力不直接迁移&lt;/strong&gt;（它另出了 Codex 版和 Pi wrapper，但那是独立分发）；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;很多控制是&amp;quot;协议级&amp;quot;而非&amp;quot;运行时保证&amp;quot;&lt;/strong&gt;——README 反复强调&amp;quot;rules the agents follow, not runtime guarantees&amp;quot;，即护栏靠 prompt 约束 agent 遵守，而非硬代码拦截，效果受模型能力影响；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;校准还没跑通&lt;/strong&gt;：评审器标注 &lt;code&gt;NOT_CALIBRATED&lt;/code&gt;，承诺的&amp;quot;有界候选画像&amp;quot;尚未接通到线上评审；&lt;/li&gt;&#10;&lt;li&gt;它不解决&amp;quot;故意造假&amp;quot;——完整性门挡的是疏漏和幻觉，不是成心的学术不端。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;strong&gt;但它的真正价值，恰恰不在&amp;quot;能不能直接拿来发论文&amp;quot;，而在于它把一件事讲透了：&lt;/strong&gt;&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;在学术这件事上，AI 最好的位置，是替你干翻文献、排引用、核数据的苦力活，把&amp;quot;定义问题、选择方法、解读数据、为自己的每一个论断负责&amp;quot;留给你自己。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;p&gt;在一个铺天盖地喊&amp;quot;AI 帮你一键成稿&amp;quot;的领域里，一个 5 万 star 的项目愿意反复说&amp;quot;&lt;strong&gt;AI 是副驾驶，不是驾驶员&lt;/strong&gt;&amp;quot;、愿意把&amp;quot;未校准&amp;quot;&amp;ldquo;未测量&amp;quot;&amp;ldquo;不声明准确率&amp;quot;写进文档——&lt;strong&gt;这份清醒，本身就是它最大的参考价值。&lt;/strong&gt;&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;本文基于 Academic Research Skills 官方仓库（&lt;code&gt;github.com/Imbad0202/academic-research-skills&lt;/code&gt;，默认分支 &lt;code&gt;main&lt;/code&gt;）的 README 及文件树整理，数据截至 2026-10-05（仓库 2026-10-03 最后推送，v3.23.0）。文中引用的 Lu et al. / Zhao et al. / Brodeur et al. / Gartenberg et al. 等研究结论均转引自该 README，未独立核验原文。项目处于活跃开发阶段，功能与状态可能变化，请以官方仓库为准。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;hr&gt;&#10;&lt;p&gt;&lt;strong&gt;项目信息&lt;/strong&gt;&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;项&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;值&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;仓库&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;a class="link" href="https://github.com/Imbad0202/academic-research-skills" target="_blank" rel="noopener"&#10; &gt;https://github.com/Imbad0202/academic-research-skills&lt;/a&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;作者&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Cheng-I Wu（吳政宜）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;许可证&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;CC-BY-NC 4.0&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Star / Fork&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;50,449 / 3,896&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;当前版本&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;v3.23.0（2026-10-03）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;默认分支&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;main&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;更新截至&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;2026-10-05&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;</description></item></channel></rss>