跳转至

GPT-6 Astra 项目协作指南

本项目通过根目录 AGENTS.md 约定编码助手的工作方式。选择 GPT-6 Astra 后,助手应根据已有上下文完成任务、保存研究证据,并按改动风险验证。无需为每篇论文重新粘贴整套流程。

官方依据与适配范围

依据 OpenAI GPT-6 Astra 官方指南(核查日期:2026-09-08),本项目重点调整持续执行、技能冲突处理、输出风格、并行边界和验证成本。以下细则是本项目的工程选择。

这次适配修改协作说明,不会切换实验使用的模型或 API provider。AGENTS.md 不能设置实际模型、启用异步工具或改变 reasoning effort;这些由运行助手的应用或 API 调用配置。需要修改运行时集成时,应单独核查接口兼容性并验证。

怎么交代任务

给出目标、范围和验收结果即可;具体实现路径由助手结合现有代码决定。例如:

扫描上次已审计窗口之后的新论文,覆盖现有研究领域,优先 Google 和 Meta。按已有证据门槛选文,把可实现项、文档和评测补齐,提交一个 PR。需要 CUDA 的实现用已有 A100/A30 验证,报告未完成项。

修复公开看板的表格溢出。桌面端应看到所有列,手机端保持可读。检查实际页面和文档构建。

审查这次 Agent 实现是否读取标准答案,列出文件位置、影响和修复建议。

前两个是实施任务;第三个是审查任务。后续说“继续”表示沿着尚未完成的目标推进;状态提问和新增约束应合并到当前任务中。重大范围或预算变化需要明确决定,普通实现细节由助手处理。

什么算完成

工作 可审查的完成证据
新论文 原文依据、准确元数据、实际算法、中文说明、对应实验和明确复现级别
Evolve 接入 候选能被控制器执行、产生可评估结果,且选择流程遵守数据切分
CUDA 路径 A100/A30 实测和绑定实现提交的脱敏 receipt
文档修改 链接与生成源一致;影响站点时通过相应构建或页面检查
提交 PR 可访问的 PR 链接、准确范围、已运行的检查及尚未通过的门禁

尤其注意:机制计数、模拟轨迹和使用 gold answer 的 fixture 只能证明对应诊断路径运行。即使成功率为 1、运行了三个 seed,也不能据此声称真实 Agent 能力提高。CPU shape 测试同样不能替代 CUDA 实测。

验证规模与中断恢复

文案调整检查文档和链接;算法调整检查公式、数据流和相关测试;共享执行器、registry 等广泛影响的改动再运行全量门禁。已有检查通过后,只有新改动或新发现才需要重跑。CI 的具体命令以仓库 workflow 为准。

长任务应保留已完成项、剩余项、当前分支与提交、实验产物及待处理检查。恢复时先核对实际状态,避免重新跑已完成实验。并行读取和独立检查可以节省时间;子代理还需满足当前环境的授权规则。

如何检查这些说明是否有效

后续真实任务用以下场景观察行为,记录实际结果;这张表是验收方案,不表示已经做过模型对照实验。

场景 期望行为
明确要求实现一批论文 完成整批范围或逐项说明真实阻塞,保留可审查代码与证据
途中问进展或说“继续” 回答当前状态后继续未完成项,保留已接受约束
Skill 建议额外确认 根据已有授权判断;若确实阻塞,说明具体文件与条款
只改说明文字 使用相关文档检查,避免无理由重复全量训练或测试
GPU 路径仅 CPU 测试通过 继续真机验证,或明确留下未完成门禁
Agent fixture 返回标准答案 保持诊断标记,暴露能力实现缺口

可以对比任务完成率、额外确认次数、重复检查次数和证据完整度,再调整规则。GPT-5.6 SOL 的 Superpowers 禁用约定保留在根指令中,适用范围仍由该条款决定。