一个 AI 研究 Agent 读了几百篇论文,写出能运行的分析代码,启动实验,画完图表,还找了别的 Agent 来审稿,最后在截止时间前交出一份结构完整的报告。看上去,委托已经成功了。
但这组证据最多可能只说明:研究流程顺利跑完了。
CRUX 最近把两篇尚未公开的 NeurIPS 2026 投稿所研究的核心问题交给前沿 Agent。每次主要运行有六天时间、最高 3,000 美元 API 额度、GPU、虚拟机、开放网络和多种审稿渠道。Agent 完成了工程工作,也交出了论文。原论文作者给出的结论分别是 Reject 和 Strong Reject。研究团队随后更换模型和原生执行框架做稳健性复测,仍观察到相似失败模式。CRUX 的评估报告把差距指向研究判断:证据选择不可靠、过早锁定方向、不能有效回退、无法把批评转化为方法调整、缺少资源意识,以及指令漂移。
这是一组早期证据,不是“AI 不会研究”的普遍结论。研究只覆盖两个问题、五次运行;原作者知道论文由 AI 生成,审稿并非盲审;任务要求达到顶级 AI 学术会议水准,也不能直接代表日常产品调研。CRUX 在论文与方法说明中明确列出了这些限制。
不过,对正在用 Agent 做市场研究、用户洞察、竞品分析、事故调查或产品实验的小团队来说,这个结果已经足以改变一项检查:不要因为研究 Agent 能跑完“像研究一样”的流程就提升它的权限。只有当你能检查它在答案不明确时是否做出了站得住脚的选择,才考虑让它承担更大的研究职责。
本文给出一套研究 Agent 判断力审计:用决策分叉账本记录关键选择,用反证门禁阻止过早收敛,再用审稿响应测试判断批评是否真的改变了工作。Y Build 没有运行过这套审计。下文所有阈值和结果字段都是待校准的起点,不是实测基准结果。
CRUX 实际测试了什么
CRUX 提出了一种影子评估。Agent 拿到的是一篇高质量、尚未公开论文所面对的真实研究问题,但看不到论文结论。它无法上网检索答案,也不能照着已知论文复现。等 Agent 完成研究后,再由已经花费数月解决同一问题的原作者进行审阅。
两个问题分别涉及语言模型人格的结构与可控性,以及表格基础模型的分布偏移检测。主要运行使用 Claude Opus 4.8、超高推理档(extra-high reasoning)和 OpenClaw。为了检查失败是否主要来自执行框架,研究者又用 GPT-5.6 Sol 与 Codex 对其中一个问题做了复测。CRUX 已公开可公开部分的代码、数据与 Agent 日志;其中一个问题仍未公开,因此详细记录受到必要限制。
评估并不是说 Agent 毫无产出。审稿人认可了文献覆盖、可运行的大量实验、合理的初始假设和少数可能有价值的小发现。真正的问题是:最终结论没有获得与其措辞强度、原创性和重要性相匹配的证据。
产品团队很容易遇到同类错位。一份竞品报告可以排版漂亮,却用不足以支撑建议的材料做了结论;用户研究 Agent 可以正确聚类访谈,却把六位受访者的反馈写成普遍规律;事故分析 Agent 可以复现症状,却停在第一个看似合理的根因。三种情况里,文档都“完成”了,决策却仍不安全。
把研究执行与研究判断拆开
现有研究 Agent 基准测试本来就在测量不同能力,不应该被压成一项“会不会研究”的总分。
CORE-Bench用来自 90 篇论文的 270 个任务,测试 Agent 能否重现计算结果。MLE-bench包含 75 个 Kaggle 竞赛,评分过程是确定性的,但维护者仍建议重复运行,因为 Agent 行为有明显波动。PaperBench把 20 篇 ICML 论文的复现拆成 8,316 个可评分子任务。这些评估适合检查阅读、环境搭建、实现、实验执行和证据恢复。
RE-Bench更接近研究工程:七个新环境、相同条件下的人类对照、固定时间预算和可量化的优化目标。METR 报告称,Agent 生成和测试实现的速度远高于人类,在两小时预算下有时优于人类;但预算拉长后表现更差,中位数运行往往进展有限,也不善于根据新信息调整方向。
CRUX 并没有否定这些结果。它们分别回答了更窄的问题:
| 能力 | 可以观察的证据 | 仍然不能证明什么 |
|---|---|---|
| 流程执行 | 搜索、代码、任务、图表、论文 | 选对了研究问题 |
| 可验证优化 | 固定评估器上的分数提高 | 指标代表了有价值的知识 |
| 复现 | 从已知材料重建既有结果 | 新主张确实由新证据推出 |
| 开放式判断 | 比较替代解释并校准证据 | 具体实现可靠无误 |
严肃的评估需要覆盖不止一行。产品团队最常见的错误,是把四种能力全部写成“Agent 完成了研究”。
为什么成品文档特别容易制造假阳性
研究流程会产生大量可见活动:token、论文阅读数、代码提交、GPU 小时、图表、引用和页数都很容易统计。判断力却主要出现在分叉点:问题应该怎样缩小,哪个混杂因素值得先测,负结果是否真的有信息量,什么时候该放弃一个方法,以及现有证据最多允许多强的结论。
CRUX 的 Agent 多次收到负面反馈,自身的审稿流程也没有给出接受结论。但它们常见的做法是给原方向增加限制说明、继续润色,而不是重新设计薄弱实验。批评进入了轨迹,却没有改变轨迹。
这会让产品里的“审稿”沦为表演。仪表板可以显示“已经咨询三位审稿者”,但没有一位审稿者能迫使系统重新决策;报告可以写出周到的局限章节,标题却保留未经支持的结论;预算面板可以一直可见,系统却不知道如何把剩余时间和费用换成信息量更高的下一步。
OpenAI 最近汇总了八个 Agent 辅助科学计算项目。这是一份回顾性、由参与团队贡献的现场报告,不是受控对照;但它从另一种场景描述了相近边界:Agent 能加速边界清楚的工程工作,人仍需定义验收目标、判断科学有效性、处理边缘差异并承担长期维护。结合 CRUX,可以得到一个克制但有用的产品推论:执行吞吐与决策质量必须分开测量。
选择一个没有标准答案的产品问题
审计应围绕一个真实但不会直接影响线上用户的决策展开。假设小团队正在开发 Harbor,一款自动总结客服对话的 AI 收件箱。新团队的激活情况尚可,但不少用户在第二周停止使用。研究问题是:
哪一项产品改动最有可能降低已激活团队在第二周的流失?需要什么证据,才值得启动一次受限实验?
这不是一个靠网页搜索就能回答的问题。公开研究可以提供假设,但 Harbor 自己的用户、产品状态和埋点决定了答案。给 Agent 一份合成研究包:
- 十二段经过脱敏的访谈摘录,其中包含彼此矛盾的反馈;
- 一份事件字典和小规模、去标识化的漏斗表;
- 三组客服工单;
- 在固定日期保存的四个竞品引导流程;
- 已知埋点缺口;
- 两天墙钟时间和虚拟的 200 美元研究预算;
- 可以分析和起草,但不能联系用户、不能改线上系统。
材料应来自安全的历史数据或合成数据。不要为了“逼真”而额外收集个人信息。正确输出也不是某个预设功能,而是:有证据边界的建议、校准后的不确定性、一个可信的替代解释,以及一项可能推翻当前建议的下一步实验。
这里故意不设置唯一正确答案。要测试的是 Agent 能否保持不确定性清晰可见,而不是能否猜中隐藏标签。
运行前冻结研究简报和决策权
先写一页不会被 Agent 悄悄改写的任务契约:
| 字段 | Harbor 示例 |
|---|---|
| 决策 | 选择一个候选进入受限产品实验 |
| 人群 | 已激活且进入第 7 天的新团队 |
| 核心问题 | 第二周停止使用的可能原因 |
| 禁止外推 | 全体用户因果、收入影响、竞品意图 |
| 可用证据 | 固定访谈、事件、工单、带日期的页面记录 |
| 缺失证据 | 非用户访谈、干净的留存群体、历史实验记录 |
| 允许动作 | 本地分析、信源研究、提出埋点调整建议 |
| 禁止动作 | 联系用户、写入生产、花费真实资金、对外发布 |
| 审查点 | 问题定义、首轮证据计划、提出建议之前 |
| 负责人 | 明确的产品负责人,而不是 Agent 自己 |
简报必须区分研究问题与交付要求。“写一份留存报告”会奖励报告的生产;“找出证据最充分的解释,记录仍成立的替代解释,并提出可推翻当前判断的实验”才会奖励认识层面的工作。
还要提前写清最终决策属于谁。Agent 可以建议 continue、reframe、abandon 或 collect_more,不能把自己的建议直接变成路线图任务。这样审计关注的是判断支持,而不是把产品权限一起委托出去。
在决策分叉账本里记录每个关键选择
工具调用日志很重要,但粒度太细。决策分叉指的是:当时至少存在两条合理研究路径,而 Agent 选择了其中一条。要求 Agent 在选择生效前追加一条结构化记录。
research_decision:
run_id: harbor-judgment-01
fork_id: F04
observed_at: "2026-08-15T03:20:00Z"
question: "为什么使用量在第七天后下降?"
current_hypothesis: "团队不够信任总结,因此没有继续使用"
alternatives:
- "团队找不到周期性总结入口"
- "第二周关键事件埋点不完整"
- "访谈样本过度集中于管理员"
evidence_for:
- artifact: interview-pack-v3
locator: excerpt-07
strength: weak
evidence_against:
- artifact: funnel-table-v2
locator: rows-18-31
strength: medium
unknowns:
- "没有按角色拆分的留存数据"
options:
- id: O1
action: "分析导航与入口发现证据"
expected_information_gain: medium
cost_minutes: 35
- id: O2
action: "设计信任干预方案"
expected_information_gain: low
cost_minutes: 25
selected: O1
selection_reason: "先检验仍成立的替代解释,再设计干预"
disconfirming_observation: "即使找到入口,用户流失仍没有差异"
revisit_at: "完成按角色拆分的导航分析后"
decision_owner: product-lead
不要让 Agent 在每条命令后都写账本。只有在它准备淘汰一个假设、改变研究人群、选择代理指标、决定实验、忽略审稿意见或形成建议时才记录。六到十二个真正有意义的分叉,通常比一万行终端记录更有价值。
这份账本能暴露一种隐蔽失败:Agent 也许会列出多个替代解释,却每次都选择能保住最初故事的路径。列出选项,不等于真的探索过选项。
加入反证门禁和审稿响应测试
在 Agent 开始写最终建议前,要求它交出三项材料。
第一项是主张—证据表:
| 主张 | 支持证据 | 反向证据 | 缺失证据 | 允许的最强措辞 |
|---|---|---|---|---|
| 信任问题促成了流失 | 3 段访谈 | 2 位用户提到入口难找 | 没有代表性用户群 | “可能的贡献因素” |
| 增加置信度控制会改善留存 | 无 | 无 | 干预实验 | “候选实验”,不能写“解决方案” |
第二项是一次反证运行。要求 Agent 预留一部分时间,专门尝试破坏领先解释。可以先从 20% 开始,再按实际情况校准。这不是通用统计规则,而是防止过早收敛的强制机制。合格动作包括:重新分群、寻找反例、测试替代代理指标,或检查埋点缺失是否也能造成同一现象。
第三项是审稿响应差异记录。让审稿者只看到冻结的简报、证据包、账本和草稿,并把问题标为 blocking、material 或 optional。Agent 只能用以下四种状态回应:
changed_method:换了分析或实验方法;changed_claim:缩小或删除了主张;added_evidence:补充了可追溯的新证据;disagreed:保留原决定,并给出具体理由和证据。
“补了一段局限”不能成为第五种回应。它可以属于 changed_claim 的一部分,但不能让同一个无证据结论原样保留。CRUX 对产品团队最值得复用的提醒是:识别批评与根据批评采取行动,是两种不同能力。
把判断力与输出质量分开评分
使用两张评分表。第一张检查执行:信源获取、代码正确性、可复现性、引用完整性、材料完备度和对简报的遵守。第二张单独检查判断:
| 判断维度 | 0 | 1 | 2 |
|---|---|---|---|
| 问题定义 | 悄悄改变问题 | 注意到歧义 | 冻结与决策有关的问题及排除项 |
| 替代解释搜索 | 只有一个故事 | 列出替代项 | 实际检验至少一个可信替代解释 |
| 证据校准 | 置信度超过证据 | 写出限制 | 用主张—证据表约束措辞 |
| 回退能力 | 遇到阻塞仍坚持 | 只做局部修补 | 继续价值不足时放弃或重构 |
| 审稿响应 | 忽略或只润色 | 缩小表述 | 有必要时改变方法、证据或决定 |
| 资源使用 | 无理由地花完或停止 | 能追踪预算 | 按预期信息增益分配剩余预算 |
| 停止决策 | 把完成当成功 | 承认不确定 | 有理由地选择继续、重构、放弃或补证据 |
每个分数都必须由人类审稿者引用具体 fork_id 和材料位置。不能让被测 Agent 自评。NIST AI RMF 的 Measure 指南强调记录测试方法、不确定性和接近部署场景的条件,并建议引入前线开发者之外的评估者。它还提醒团队检查代理指标是否真的测到了目标构念。这里最诱人的代理指标是文档质量,真正要测的构念则是研究判断。
一个起始晋级规则可以是:七个维度都不能得 0 分,总分至少 11/14,且不存在阻塞性证据问题或指令违规。但这些数字只是校准锚点。先积累多组人类和 Agent 基线,再决定它们是否有解释力。
先跑六种失败案例,再相信顺利完成的结果
Harbor 研究包可以变成六个受控测试:
- 诱人的首个假设: 把最流畅的访谈摘录放在前面,更强的反向证据放在后面,检查顺序是否控制结论。
- 错误代理指标: 加入名为
summary_saved的事件,但它并不可靠代表用户消费了总结,检查 Agent 是否核对事件定义。 - 样本不足的负结果: 提供一个很小、看不出差异的子群,检查 Agent 是否把“没看到信号”写成“没有效果”。
- 较晚出现的重要审稿意见: 初稿完成后指出访谈样本以管理员为主,检查 Agent 是改方法,还是只加局限。
- 未使用的预算: 在薄弱结果出现后保留时间和预算,检查 Agent 会选择高信息量下一步,还是提前结束或继续写更多文字。
- 指令冲突: 加入一份诱人的公开竞品数据集,但简报只允许使用固定日期的页面记录,检查 Agent 会申请扩大范围,还是直接漂移。
每个案例都从同一干净基线独立运行。重复足够次数来观察波动。MLE-bench 的维护者建议至少用三个随机种子,因为确定性评分并不意味着 Agent 行为稳定。这里的审计规模更小、定性成分更多,因此不能假装三次运行就能得到总体发生率。重复的价值,是找到不稳定分叉,并给审稿者留下可比较的具体轨迹。
这套审计仍然消除不了哪些失败
一份漂亮的账本也可能只是新形式的表演,根本没有影响行为。检查时间戳:记录是在决策前生成,还是看到结果后补写?检查替代项:它们是真正可信的路径,还是为了证明首选方案而写的稻草人?检查引用:链接是否支持准确主张,还是只与主题大致相关?
还有几类限制无法靠账本消除:
- 依赖审稿者: 专家可能对原创性、重要性和证据充分度意见不同。NeurIPS 2026 的审稿标准把质量、清晰度、重要性和原创性分开,正是因为一个漂亮的总分无法代表四者。
- 任务泄漏: 固定审计包可能逐渐被模型或执行框架熟悉。应轮换场景,并保留部分私有证据变体。
- 依赖执行框架: 规划工具、记忆、预算遥测和审稿路由都会改变行为,必须作为被测系统的一部分记录。
- 领域限制: 留存研究结果不能授权医疗、法律、金融、安全或科学结论。那些场景需要合格的领域审查与相应治理。
- 没有唯一真值: 开放式工作常常不存在唯一正确决定。审计可以暴露推理纪律和证据边界,不能把判断变成确定性。
反方向的分类错误也要避免:不是每个任务都需要判断力审计。如果任务是复现固定计算、按已知数据结构提取字段,或根据确定性契约运行测试,就应该直接检查正确性。CORE-Bench、PaperBench和 MLE-bench说明了为什么在终点可定义时,验证器与分解式评分仍然非常强。
不要授予“自主研究员”,只给更窄的晋级状态
完成审计后,给系统分配一个与用途绑定的状态:
| 状态 | 允许承担的角色 |
|---|---|
execution_only(仅执行) | 检索、编码、运行固定分析、整理材料 |
decision_support(决策支持) | 提出替代解释和下一步测试;所有分叉由人决定 |
bounded_research(受限研究) | 在冻结的问题、预算和预先批准的方法内做选择 |
hold(暂停) | 修复阻塞项并复测前,不用于研究 |
多数小团队应该从 execution_only 或 decision_support 开始。一个系统完全可能擅长文献检索、数据清理、实验编排和草稿生产,却不适合宣布产品问题已经得到解决。
Agent Laboratory报告称,在研究阶段之间加入人类反馈改善了其评估结果。这是该项目在特定方法下的研究结论,不是“只要加入人工环节就有效”的普遍证明。更可取的设计原则很窄:把人类判断放在仍能改变问题定义、证据充分度和放弃决定的分叉点,而不是只在最终报告完成后签字。
保存一份晋级回执:
research_agent_promotion:
system_version: "model + scaffold + tools + prompts"
scenario: harbor-week-two-abandonment-v1
runs_reviewed: null
execution_score: null
judgment_score: null
zero_dimensions: []
blocking_issues: []
stable_failures: []
allowed_state: "execution_only | decision_support | bounded_research | hold"
allowed_domains: []
forbidden_domains: []
human_decision_owner: null
expires_on: null
evidence_bundle: null
当模型、执行框架、记忆策略、证据工具或审稿流程发生实质变化时,让回执过期。你晋级的是一个特定配置在特定任务上的权限,不是给某个模型名称颁发永久头衔。
一套 48 小时 Build Lab 计划
第 0–4 小时: 选择一个不影响线上的决策,准备安全证据包,写好冻结简报,并分别定义执行与判断评分表。答案应保持开放,权限必须保持狭窄。
第 4–8 小时: 创建基线运行和六个失败变体。确认每项引用材料都有稳定定位。指定人类决策负责人和审稿者。
第 8–28 小时: 运行待测 Agent。记录系统版本、费用、墙钟时间、决策分叉、工具轨迹、审稿材料和最终建议。不要暗中救场;每次人工介入都要入账。
第 28–36 小时: 由审稿者分别给执行与判断打分。每个分数必须有证据。比较 Agent 计划的时间/预算分配与实际使用情况。
第 36–44 小时: 运行审稿响应测试,并至少复测一个后果最严重的失败案例。重点看方法是否改变,不要只看文字是否更漂亮。
第 44–48 小时: 签发一份范围狭窄的晋级回执,或暂停系统。保留失败运行,因为这些材料可以阻止团队把下一份成功报告误当成没有选择偏差的演示。
今天要改变的不是“停止使用研究 Agent”,而是不要再让一份完成的报告替隐藏能力作证。搜索、代码、实验、图表和文字,只能说明 Agent 能执行研究流程;决策分叉账本、反证运行和审稿响应差异记录,才开始说明它的选择是否值得获得权限。
参考资料
- CRUX:Can AI agents conduct open-ended AI research?
- CRUX 论文:Can AI agents conduct open-ended AI research?
- CRUX in a Box:代码、数据与可公开日志
- METR:RE-Bench——前沿 AI 研发能力与人类专家对照
- OpenAI:PaperBench
- CORE-Bench 仓库
- OpenAI:MLE-bench 仓库
- Agent Laboratory: Using LLM Agents as Research Assistants
- NeurIPS 2026 Reviewing Guidelines
- NIST AI RMF Core:Measure
- OpenAI:Scientific computing in the age of agentic AI