文章摘要
本文译自GPT-6 Astra官方技术指南,介绍这款研发团队推出的当前智能程度最高的大模型,其多领域能力领先,单任务API调用成本低于前代,对齐性更优。文中说明了调用方式、新增核心功能与使用限制,提供了多场景提示词优化方案,以及旧模型迁移的配置调整指南。

本文译自官方发布的技术指南,下文中的“研发团队”指代该技术的出品方。

核心能力与基础使用

GPT-6 Astra是当前研发团队推出的智能程度最高的大模型,在电脑操作、网页浏览、软件工程、科学研究与专业工作等多个领域都具备领先水平。它能够高效执行跨越代码、浏览器和专业软件的多步骤复杂工作流。根据公开的评测数据,该模型在完成任务时所需的输出token数量显著少于前代模型,同时最终效果更出色;即便单token的定价高于早期版本,估算的单任务API调用成本依然低于此前的模型。

同时,GPT-6 Astra也是对齐程度最高的模型,它在运行时会审慎行事,严格尊重任务边界,并保持透明的沟通方式。当指令留有需要自行理解的空间时,它会利用已有上下文补齐常规细节;如果某个问题的答案可能改变任务结果,它会主动提出有针对性的询问。它能够灵活吸收新的要求,按照新的请求调整执行方向,也可以回答临时插入的问题,同时不会偏离整体任务目标。

如果需要使用该模型构建应用,只需在Responses API的请求中将model参数设置为gpt-6-astra即可。

新增核心功能

  • 异步工具调用:当应用正在执行某一工具时,GPT-6 Astra可以继续进行推理、调用其他工具,或是处理请求中相互独立的部分。开发者只需在函数工具或自定义工具上配置async: true,待结果准备完成后,通过原始的call_id返回结果即可,工具的执行与未完成工作的管理仍由应用自身负责。详细的基础用法与开发者自定义的等待工具模式可参考相关技术文档。
  • 执行中追加指令:在GPT-6 Astra运行的过程中,可以随时发送额外的用户指令,比如纠正当前的问题或是调整需求方向。通过WebSocket连接,Responses API会保留已经完成的工作内容,并在后续的执行过程中纳入更新的指令。具体的事件流程与工具结果处理方式可参考相关指南。
  • 对话中调整推理强度并保留缓存:通过添加configuration_update输入项,可以针对难度较高的任务提高推理强度,或是针对常规的后续任务降低推理强度,无需重写原始的提示词前缀。更新后的推理强度会持续生效,直到被另一个configuration_update输入项覆盖。相关示例与兼容性说明可参考对应技术文档。
  • 对齐偏离监测:作为GPT-6 Astra强化安全防护措施的一部分,研发团队的系统会异步监测对齐偏离情况,并在必要时触发告警。更多相关信息可参考安全监测相关文档。
  • 使用限制:GPT-6 Astra不支持none推理强度。当为该模型启用欧盟数据驻留功能时,无法使用快速模式。

此外,GPT-6 Astra还支持前代模型GPT-5.6已有的全部API能力,包括电脑操作、结构化输出、流式输出、程序化工具调用、多Agent编排、提示词缓存、跨调用保留推理状态、上下文压缩和Pro模式。

提示词优化实践

与GPT-5.6 Sol等早期模型相比,GPT-6 Astra的智能水平与综合能力更强,同时也表现出一些可以通过提示词进行优化的行为模式,以适配具体的使用场景。

模型的典型行为特点

  • 主动性与持续执行:该模型的设计目标是成为更高效的协作者,因此当额外信息可能实质性改变任务结果时,它更倾向于向用户提问确认。这可能导致它暂时停下任务,而部分用户原本期待它自行做出合理假设并继续执行。
  • 指令遵循:GPT-6 Astra的通用指令遵循能力强于此前的模型,因此开发者可以更好地控制它的行为。它也会对Skill文件及AGENTS.md等其他文件中的指令更加敏感,建议开发者检查模型能够访问的Skill和其他文件,找出其中可能影响模型行为的指令内容。
  • 个性与写作风格:模型倾向于使用列表、表格和Markdown格式来组织回答,方便用户快速浏览。如果应用需要格式更少的连贯文字,需要明确指定所需的写作风格和结构。
  • 子Agent委派:模型委派任务的频率可能低于部分工作流的需求,开发者需要明确指定它应当在什么情况下、以多大程度使用子Agent进行并行工作。
  • 测试与验证:对于编码任务,模型通常会在认定任务完成之前进行充分的测试。对于规模较小的任务,这可能导致测试范围超出任务的实际需要。

提升任务执行的自主性

在长时间任务的连贯性保持方面,GPT-6 Astra通常优于GPT-5.6 Sol及更早的模型。同时,在早期模型可能自行做出假设的场景中,它更倾向于请求用户澄清信息。

如果希望模型更自主地推进工作,可以使用以下提示词引导:

你应当根据指令和此前的对话上下文,推断用户意图及任务范围。你的职责是优先采取行动,把用户想完成的任务推进到完成。当用户表达了开展新工作或修复现有问题的意图时,持续执行,直到用户的预期目标完成。自主推进用户的目标,例如在需要时创建隔离的worktree或代码检出目录、解决合并冲突、执行只读操作、创建草稿PR等,除非这些操作具有明确的破坏性或不可逆性。

当用户的意图不够明确时,模型更可能先请求澄清再继续执行。如果用户的提示已经隐含了执行授权,可以使用以下提示词要求模型持续推进任务:

当用户的提示表达了行动请求,例如“你能不能……”“我想……”“帮我……”及类似说法时,将其视为要求你完成工作并采取行动的指令。不要只停留在确认自己有这个能力,例如回答“可以……”,也不要只提出计划或表示可以继续。不要为了节省时间、精力或token,就满足于未能完整实现用户任务的部分结果,或只是“已经有些帮助”的结果。如果任务需要持续推进,就完成全部必要工作,直到实现用户想要的结果。

也可以要求模型先准备出具体、可审阅的结果,再请求用户批准。这样能够避免它在尚未完成力所能及的工作之前就阻塞任务,通常也能更快完成整体工作。

在向用户提出澄清问题之前,先完成那些已经由上下文授权、且为使拟议行动具体可审阅所必需的工作。用户应当批准一个具体、可审阅的结果。例如,在部署变更、写入外部应用、合并PR或发布网站之前,先完成所有必要的准备工作,让用户批准成为最后一步。对于可逆的任务、只读操作、审查或修复,以及此前在会话中已经获得授权,或任务指令强烈暗示已获授权的事项,你不需要再次征求用户许可。不要因为假设性的风险,主动增加用户没有要求的警告、免责声明、审批流程或安全与合规检查清单。

模型默认也喜欢在工作过程中提出不阻塞任务的问题,因此开发者可以根据应用需要的自主程度调整这些提示词。

优化指令遵循效果

GPT-6 Astra更能遵循较长的指令,但也可能对上下文中的信息更加敏感。例如,Skill文件中不清晰或互相冲突的指导,可能让模型暂停并过早阻塞工作。建议开发者明确用户指令与Skill文件的优先级。

用户指令优先于Skill中提供的一般指导。如果用户的明确指令与Skill的指令冲突,优先遵循用户指令。

要求模型指出导致它暂停或改变方向的Skill及具体指令,也有助于让模型的行为更加透明。

如果某个Skill导致你请求许可或确认、暂停工作、未完成用户要求的任务,或偏离用户意图,请指出并链接到你实际读取的那个SKILL.md文件,引用相关指令,并简要说明它如何适用于当前情况。区分Skill的明确要求与你对一般指导的理解。

当应用加载了大量Skill和AGENTS.md等指令文件时,可以使用这段提示词找出那些隐含的、互相冲突的指导内容。

调整输出的写作风格

GPT-6 Astra倾向于使用列表、表格和Markdown格式来组织回答,方便快速浏览。如果应用需要格式更少的连贯文字,需要明确指定这一偏好。

默认使用清楚、简洁的段落,每段围绕一个主要观点展开。只有在信息确实具有并列关系、顺序关系,或适合通过列表进行比较时,才使用列表。除非层级关系无法用清晰的文字表达,否则避免嵌套列表。使用朴素、简单的语言:常见词语、具体例子和准确的动词。优先使用主动语态和直接陈述。确保尽早、清楚地表达主要观点,再展开读者所需的解释与细节。让每句话都承接前面的内容。充分展开重要的观点,并提供足够支撑,使其真正有用。

对于技术沟通场景,以下提示词有助于兼顾清晰连贯的表达与领域专业性:

优先使用普通语言,少用行话;只有技术细节有助于向用户说明一个观点或你的工作时,才引用这些细节。清楚、连贯地解释复杂概念,并根据用户提示及上下文所体现的背景知识水平调整表达。

如果希望减少写作中的行话和套话,可以使用以下提示词:

避免使用空泛的词语或套话,例如在结尾使用“Bottom Line:”(结论是),以及“delve”(深入探讨)、“foster”(促进)、“leverage”(利用)、“it's worth noting”(值得注意的是)、“importantly”(重要的是)、“Question? Answer.”(自问自答)、“This isn't about X. It's about Y.”(这不是关于X,而是关于Y)、“genuinely”(真正地),以及用连字符拼接的复合描述和形容词。不要使用“In short:…”(简而言之……)、“The simplest mental model is:…”(最简单的理解方式是……)之类的总结句。直接说清打算采取的行动。不要附加说明你不会做什么、哪些内容保持不变,或你会怎样拆分、归类结果。不要使用“X, not Y”或“X—not Y”这样的对比表述,引入用户并未提出的另一种方案。避免自造复合标签,例如“exact-head checks”和“editorial-row layouts”,也不要使用含糊的限定语和套式过渡;用普通动词和介词说清实际关系。

调整子Agent委派策略

GPT-6 Astra经过训练,能够拆分任务并委派给并行工作的子Agent。如果开发者正在自己的Agent运行框架中实现多Agent系统,可以使用以下提示词调整模型委派工作的程度:

无论你是主Agent还是子Agent,只要在任何时候可以把任务委派给另一个Agent来并行处理,并且这样能节省时间或提高质量,就应使用协作工具进行委派。

Agent之间的消息可能出现语法或空格错误,可以使用以下提示词让Agent间的消息更容易阅读:

你发给其他Agent的消息以及最终回答,都可能由人类阅读,因此请保证表达清楚。在单词之间以及数字与其他文字之间使用适当的空格。

模型通常能够很好地响应关于何时、如何委派任务的提示词,开发者可以根据自己的Agent运行框架和多Agent实现调整这一行为。

优化测试与验证流程

对于编码任务,开发者可以根据改动的规模校准所需的测试与验证程度,这样有助于避免针对小改动进行不必要的测试或重复检查。

对于可逆、影响较小的改动,不要编写只是照着实现重复一遍的测试。如果你选择通过测试来验证工作,请确保这些测试有意义,并且确实是验证实现所必需的。运行与改动相适应的测试,并完成必需的检查。检查通过后,只有出现新的改动、失败或尚未解决的问题,足以支持扩大或重复测试时,才继续测试;否则,应继续推进任务直至完成。

迁移快速入门指南

使用Codex工具迁移

Codex可以借助官方文档技能,快速应用本指南建议的修改内容。执行命令如下:

$openai-docs migrate this project to GPT-6 Astra

如果需要在其他Coding Agent中使用该技能,可以从官方技能仓库下载对应的工具。

更新API与模型参数

将API请求中的model参数设置为gpt-6-astra,然后检查以下几个关键配置项:

  • 推理强度:如果当前使用none或minimal推理强度,建议从low开始尝试,并对比不同强度下的结果。否则,可以保留当前实际生效的推理强度。在Responses API中使用reasoning.effort参数,在Chat Completions API中使用reasoning_effort参数。
  • 工具调用:建议使用Responses API进行工具调用。GPT-6 Astra虽然支持Chat Completions API,但工具调用功能需要通过Responses API实现。
  • 不支持的参数:需要移除temperature、top_p和top_logprobs参数。如果使用Chat Completions API,还需要移除logprobs参数;如果使用Responses API,需要从include参数中移除message.output_text.logprobs。
  • 快速模式:当启用欧盟数据驻留功能时,请选择Standard处理模式。GPT-6 Astra在欧盟数据驻留配置下,不支持service_tier: "fast"或service_tier: "priority",且快速模式不提供延迟SLA。详细的兼容性说明可参考相关文档。
  • 调整推理强度:如果应用需要在两次响应之间调整推理强度,可以在标准的单Agent请求中使用configuration_update输入项。保持请求级的reasoning.effort参数不变,以保留用于缓存的提示词前缀。使用该功能前,请检查对应的兼容性限制。
  • 提示词缓存:如果从GPT-5.5或更早版本迁移,需要将prompt_cache_retention参数替换为prompt_cache_options.ttl,并将其设置为"30m"。可以查看提示词缓存的相关变化,包括缓存边界和缓存写入计费规则。
  • 处理不必要的审批暂停:如果遇到模型不断请求批准才肯继续执行的问题,可以参考前文“提升任务执行的自主性”部分,使用对应的提示词引导模型更自主地完成任务。关于指令遵循、写作风格、子Agent委派以及测试的优化建议,可以参考提示词优化实践的其他章节。
以上内容不代表本平台立场,仅供读者参考