ALE专家质检任务
有更新的内容,待发布
WJ
企业微信 · 智能文档

ALE 专家质检流程

ALE(Agents’ Last Exam)是一项面向 Agent 的基准测试,旨在评估其在真实电脑沙箱中完成长程专业任务的能力,并通过程序化验证器(verifier)对最终交付物进行验收。公开任务覆盖工程、物理科学、生命科学、医疗健康、计算与数学、商业金融、法律、教育、农业环境、交通安全、社会科学、心理与神经科学、视觉媒体等 13 个专业领域。本项目需在修复ALE-bench已有题目的基础上生产一批高质量agent数据。该项目计划分两阶段进行,第一阶段质检并修复ALE-bench的150道题目;第二阶段生产一批(1000条)高质量的agent数据。

ALE-bench质检修复pipeline

流程图

ALE bench质检与修复流程:专家准入 → 专家质检修补 → 工程验收
ALE bench质检与修复流程:专家准入 → 专家质检修补 → 工程验收

专家准入

专家筛选

选择与原数据生产专家同专业背景、熟悉相应工作流和软件的专家,承担人工质检与数据修补。记录以下人数,并按专家去重:

  • 可触达:联系方式有效,专业背景符合需求。
  • 已签约:已完成参与项目所需的签约手续。
  • 已培训:已完成本项目培训。
  • 试标合格:试做质检通过,可以承接对应领域的质检任务。
  • 当周活跃:本周确认可投入时间,并实际参与质检、修补或复查。
  • 有效交付:本周至少交付一份已确认的质检结果或修补后通过复查的数据。无须修补的合格任务,其质检结果同样计入。

前三项及试标合格人数记录当前累计状态,当周活跃和有效交付按周统计。有效交付人数按质检与修补工作的实际交付记录,不与最终工程入库人数混用。

签约并确认可投入时间

确认每周可投入小时、固定在线时段、请假规则,以及至少连续参与多长时间。质检、修补与复查分别考虑所需时间,避免只安排初次检查而没有时间处理后续问题。

培训

培训内容包括项目背景、ALE 任务结构、优秀与失败样例、数据合规、提交工具和质检标准。通过样例讲清楚如何判断任务能否完成、参考结果是否有依据、rubrics 是否可执行,以及如何记录问题位置和修改要求。

试做质检与反馈

沿用已确认的准入安排:先检查一道标准题并获得逐项反馈,再完成第二题或复试。通过后,可承接该领域的质检任务。这里考查的是能否识别问题、提供依据并判断修补结果,不要求重新生产一整道任务。

本阶段交付可派单专家名单,记录每位专家可承接的领域和本周可投入时间。

专家质检修补

接收待检数据

以待检任务的现有版本为依据,核对任务说明、输入、软件环境、reference、rubrics,以及已有的任务代码与评分程序。每份报告注明任务 ID 和所检查的版本,避免报告与数据不对应。

自动化质检

由混元 AI Data 工程同学实现和维护,检查文件完整性、格式、可打开性、重复度和敏感信息。

报告列出检查结果、对应文件或字段、发现的问题及可复查的证据。缺少文件或文件损坏导致后续检查无法进行时,先补齐再继续。重复度或敏感信息扫描命中由人工确认,不能只凭自动报告直接判定任务不合格。

自动化检查负责发现文件和材料问题,不能替代领域专家对专业内容的判断。官网 FAQ 同样说明自动化 Agent 审查属于参考信号,不是必须通过的独立条件。官网 FAQ

人工 peer review

由与原数据生产专家同背景的另一位专家进行人工质检,检查以下内容:

  • 专业正确性:任务背景、专业概念、计算方法、参数、单位及结果是否正确。
  • 任务能否完成:题面、输入和软件是否提供足够信息,是否依赖未给出的材料或无法访问的系统。
  • 证据是否充分:结论能否对应到文件、数据、操作记录或运行日志。
  • 评分点是否合理:每项要求能否明确判断,单位、容差、通过与失败条件是否清楚。
  • reference 质量:参考结果是否来自真实运行,是否正确、完整,并与当前输入和题目版本对应。

对于多种正确解法,不因产物与 reference 外观或字节不同就判错,应检查是否满足题目规定的验收条件。无法判断时记录缺少的依据,由领域专家补齐后再复查。

ALE 论文的最终 QC 重点包括参考输出正确性、评分范围合理性和上下文充分性。本项目将这些检查用于现有数据的人工质检,并在工程验收时核对修补后的实现。论文附录 B.2

记录问题与修补要求

问题清单写明任务版本、具体位置、问题描述、判断依据、对任务的影响、需要修改的内容、修改人和复查结果。例如,不能只写“reference 有问题”,应说明是哪个文件、哪一项指标与哪份输入不一致。

未发现问题的任务直接交工程验收。发现问题的任务由领域专家修补;报告无法确认的内容不得按已通过处理。

领域专家修补数据

领域专家按问题清单修改相应 bench 数据:补齐题面信息、修正输入或参数、替换损坏文件、重新生成错误的 reference、完善 rubrics 或补充真实运行证据。

涉及 rubrics 时,Agent 辅助生产专家或负责修补的领域专家撰写,专家确认专业含义、允许误差及通过和失败样例。reference 的修补必须有实际运行或原始依据支持,不能为了通过评分而直接编造结果。

代码、运行环境或自动质检程序的问题交给对应工程人员处理。领域专家负责说明正确行为和验收依据,不要求其承担代码实现。

修补后复查

修补后重新执行相关自动检查,并由人工检查修改处及受影响部分。若改动题面、输入、reference 或评分条件,复查它们是否仍相互一致;仅看修改的文字不足以判断整题是否修好。

修改人不独自确认自己修补的数据通过,应由另一位同背景专家复查。问题仍存在则继续修改;材料缺失或真实性无法确认、暂时不能修好的任务,记录原因并暂缓验收。

本阶段交付修补后的数据版本、自动质检报告、人工质检结论、修改前后差异及复查记录。

工程验收

同步材料与工程文件

工程人员核对修补后的材料是否与 task_card.jsonmain.py、数据文件和评分程序一致。已有工程文件只更新受到修补影响的部分;尚未完成工程实现的任务先补齐可运行结构。

检查运行环境与评分

确认软件版本、依赖及输入文件可用;使用通过样例、失败样例及评分临界值检查评分程序,确认正确结果可以通过、明确错误结果不会误过。

任务运行期间隐藏参考答案,仅在评分时由评分程序读取。完整试运行覆盖输入部署、实际操作、产物生成、评分及日志收集。Agent 没有提交输出与环境故障分别记录,不能把环境错误当成任务低分。

官方任务文档要求 load()start()evaluate() 完成任务声明、准备和评分,并将 reference 与执行中的 Agent 隔离。官方新增任务文档

Data 验收

Data 侧核对专家质检与复查结论、修复记录和交付材料,确认问题已有对应处理结果、材料齐全且版本一致,核对工程测试记录,确认相应修改已落实到可运行任务和评分程序;同时核对模型与运行框架、工具权限、运行预算和评分程序版本等评测配置,确认分数与产物、日志相符,并判断修复对已有评测结果的影响。

Data 侧记录验收结论。发现材料或专业问题返回领域专家修补;发现代码或环境问题由工程修复;发现评测配置或结果问题由 Data 侧核查并组织重新评测。处理后重新检查受影响部分。

Data 侧确认通过后,保存修补后的数据、代码、环境配置、评测配置及验收记录,更新入库版本及验收 manifest。保留修改前后对应关系,便于解释历史评测结果。

如果修改涉及评分规则或会改变评测结果,旧分数不能直接当作新版本成绩;相应结果需要基于修补后的版本重新计算或运行。

质检和修补内容对应哪些 ALE 文件

任务说明

检查任务目标、约束和交付要求。修补对应公开卡片中的 taskPromptagentMustDo,以及 main.py 中实际交给 Agent 的任务 description,避免只改卡片而运行题面仍旧。

输入材料

检查文件是否完整、可读、与题面一致。修补对应 inputFiles[]、实际 input/ 文件,以及 start() 使用的路径和部署逻辑。

软件环境

检查精确版本、依赖和运行条件。修补对应 software、相关 vm 配置、环境文件及初始化逻辑。卡片列出软件名称不等于软件已经可以运行。

reference

检查真实来源、正确性和与输入的对应关系。修补对应参考资产、referenceFiles[] 描述和评分程序读取的参考路径;卡片中的路径不能直接当作 Agent 可访问的答案路径。

rubrics

检查判定条件、单位、容差及通过和失败样例。修补对应卡片 evaluation 摘要,以及 evaluate() 和相关评分脚本。没有统一必填的 rubrics 顶层字段,不能只更新自然语言说明而不核对实际评分逻辑。

质检与修补记录

任务版本、问题清单、修补差异、自动报告、人工复查结论和验收 manifest 用于本项目交付追溯,不将这些管理记录当作 ALE 统一要求的卡片字段。

ALE 数据生产 pipeline

流程图

ALE 数据生产 pipeline:专家准入 → 任务生产与质检 → 工程验收
ALE 数据生产 pipeline:专家准入 → 任务生产与质检 → 工程实现与联合验收

专家准入

谁参与:专家运营(AI data)与各领域专家。

专家筛选与人数记录

筛选具备真实专业经历、熟悉相关软件和工作流的专家,分别记录以下人数,并按专家去重。

  • 可触达:联系方式有效,专业背景符合需求。
  • 已签约:已完成项目签约与材料使用约定。
  • 已培训:已完成项目培训。
  • 试标合格:标准题及反馈后的第二题或复试通过,可承接对应领域的任务。
  • 当周活跃:本周确认可投入时间,并实际参与生产、提交或返修。
  • 有效交付:本周至少有一道任务通过内容验收。

前四项记录当前累计状态,后两项按周统计。有效交付人数与最终工程入库数量分开记录,避免把工程排队误算为专家未交付。

签约并确认时间

确认每周可投入小时、固定在线时段、请假规则和最小连续参与周期。安排任务时同时考虑生产与返修时间,人工质检也需有对应专家和时间安排。

培训

培训覆盖项目背景、ALE 任务结构、优秀与失败样例、数据合规、提交工具和质检标准。重点说明任务信息如何写完整、reference 如何提供真实依据、评分点如何明确判断。

试标与反馈

先完成一道标准题,收到逐项反馈后再完成第二题或复试。通过后,可承接该领域的任务,并确认本周可投入时间。

交给生产环节:可派单专家名单、可承接领域、可投入时间、培训与试标记录。

任务生产与质检

原文档保存页写到这一节标题后结束。更完整的生产、质检、工程验收步骤见上方第二张流程图。
评论