外观
GPT-5.6工具调用与Multi-agent指南:PTC、子智能体和Agent工作流
如果你条件有限,强烈推荐国内 API 站
这是站主自主搭建纯 GPT API 站,无需梯子,实时更新 GPT 最新模型(仅支持电脑端),价格是官方的 三分之一,操作简单,连接稳定,价格便宜,保证没有任何掺水、收集信息等低劣行为,保证爽用 GPT。
GPT-5.6 的重要变化不只在模型回答质量。OpenAI 官方指南加入了 Programmatic Tool Calling(PTC) 和 Multi-agent Beta:前者让模型在托管 JavaScript 运行环境中编排符合条件的工具,后者让一个 GPT-5.6 实例协调多个子智能体并行工作。
API功能不等于ChatGPT界面功能
本文依据 OpenAI 开发者文档讨论 Responses API 工作流。API 中的 PTC 或 Multi-agent 已有文档,不代表所有 ChatGPT 套餐、地区和账号出现同名开关。
一、Programmatic Tool Calling是什么?
传统工具调用通常是这样的:模型决定调用一个工具,应用执行工具,把结果返回模型;模型再判断下一步是否继续调用。这种方式灵活,但当任务需要读取许多结果、做去重、排序或聚合时,中间输出会不断进入上下文。
PTC 允许 GPT-5.6 编写 JavaScript,在托管运行环境中调用被允许的工具,并通过代码处理多个工具结果。最后只把压缩后的结构化结果交给模型继续判断。
mermaid
flowchart LR
A[用户任务] --> B[GPT-5.6编写受限程序]
B --> C[程序调用允许的工具]
C --> D[过滤、去重、排序、聚合]
D --> E[精简program_output]
E --> F[模型生成最终结论]它的价值不只是“并行调用”,而是减少大量可预测的中间数据在模型轮次之间反复搬运。
二、什么任务适合PTC?
OpenAI 的指导强调,PTC 更适合 边界明确、处理规则可写成代码的阶段:
- 从多个数据源筛选符合条件的记录;
- 合并、去重和排序搜索结果;
- 对大量结构化响应做统计和聚合;
- 校验字段、格式、范围和完整性;
- 从大批工具输出中只保留最终需要的证据;
- 对相互独立的查询并行执行后汇总。
例如,研究 50 个产品的价格时,可以让程序并发读取数据,再统一货币、过滤无效记录、按价格排序,最后把前十名及来源交给模型。模型不需要逐条阅读全部原始响应。
三、什么情况不要使用PTC?
并不是工具越多越应该使用 PTC。以下情况通常更适合直接工具调用:
- 只需要调用一次工具;
- 每个结果都可能改变下一步的语义判断;
- 中间输出本来就很小;
- 操作涉及付款、发送消息、删除数据或人工审批;
- 最终回答必须保留工具的原生引用或不可压缩证据;
- 模型在写程序前无法知道工具返回字段和错误结构。
| 任务 | 建议方式 | 原因 |
|---|---|---|
| 查询一次订单状态 | 直接调用 | 单次结果很小 |
| 汇总100家门店库存 | PTC | 可并发、过滤和聚合 |
| 与客户谈判并决定下一封邮件 | 直接调用+人工审批 | 每轮结果改变判断且有外部影响 |
| 合并多批日志并统计错误码 | PTC | 规则明确、数据量大 |
| 选择法律意见并发送通知 | 直接判断,发送前审批 | 高风险且需要语义判断 |
四、PTC工作流需要定义哪些边界?
只把工具开放给模型并说“高效调用”是不够的。一个可测试的 PTC 说明至少包含:
- 哪个阶段允许使用 PTC;
- 可以调用哪些工具;
- 工具输入、返回字段与错误格式;
- 期望的
program_output结构; - 并发数、重试次数和停止条件;
- 哪些操作有副作用,禁止由程序执行;
- 缺少必要结果时如何明确失败;
- 哪些步骤仍需模型直接判断或人工批准。
示例:
text
使用 Programmatic Tool Calling 完成“候选记录筛选”阶段。
仅允许调用 inventory_lookup 和 supplier_profile。
最多并发 8 个请求;瞬时错误最多重试 2 次。
输出 JSON 数组,每项必须包含:supplier_id、stock、price、
source_time、validation_errors。剔除缺少时间戳的记录。
不要下单、发邮件或修改库存。若有效供应商少于 3 家,
返回 structured_failure,不要用猜测补齐。
最终供应商选择由模型直接比较,并等待人工批准。五、程序输出和最终回答要分别验收
PTC 会产生 program_output,最终助手消息则是另一个输出。程序可能找到正确记录,但最终回答仍可能漏掉字段、证据或限制。因此测试不能只看工具调用有没有成功。
至少分别检查:
| 层级 | 检查内容 |
|---|---|
| 工具层 | 输入是否合法、权限是否最小化、错误是否可重试 |
| 程序层 | 去重、排序、过滤、统计是否正确 |
| program_output | 是否符合结构、是否保留必要证据 |
| 最终回答 | 是否完整引用结果、是否越过批准边界 |
| 业务结果 | 任务是否真正完成,质量是否优于直接调用 |
调用次数更少、Token 更低或速度更快,只有在最终任务仍然通过验收时才算优化。
六、GPT-5.6 Multi-agent是什么?
OpenAI 将 GPT-5.6 的 Multi-agent 标记为 Beta。它允许一个 GPT-5.6 实例协调多个子智能体并行处理独立工作流,再综合结果。
适合拆分的任务通常具有三个特点:
- 子任务相互独立,可以同时开始;
- 每个子任务有明确交付物;
- 主智能体能够验证和综合结果。
例如,做一次上线审查时,可以分为:
- 子智能体 A:检查代码和测试;
- 子智能体 B:检查数据库迁移与回滚;
- 子智能体 C:检查安全、权限和密钥;
- 子智能体 D:检查文档与监控;
- 主智能体:去重、按严重度排序并输出上线结论。
七、哪些任务不应该拆成多智能体?
- 子任务高度依赖,后一步必须等待前一步判断;
- 任务非常小,协调成本大于节省时间;
- 所有子智能体会重复读取同一份巨大上下文;
- 没有统一事实源和输出结构,结果难以合并;
- 任务需要一个连续、一致的谈判或创作声音;
- 最终操作具有外部副作用,却没有审批关口。
多智能体不是“让多个模型随便讨论”。如果每个子智能体没有范围和停止条件,常见结果是重复研究、成本上涨、结论互相矛盾。
八、如何设计一个可控的Multi-agent任务?
1. 按交付物拆分,而不是按角色名称拆分
“让三个专家研究”太模糊。更好的方式是要求每个子智能体交付不同证据:代码风险、性能数据、权限配置或用户影响。
2. 给每个子任务独立输入
只发送它真正需要的文件和工具。不要把全部代码库、全部数据库和全部客户资料复制给每个子智能体。
3. 统一输出格式
json
{
"finding": "...",
"severity": "high",
"evidence": ["file:line", "tool_result_id"],
"impact": "...",
"recommendation": "...",
"uncertainty": "..."
}统一结构便于主智能体去重、交叉验证和识别冲突。
4. 限制并发、预算和重试
为子智能体设置最大数量、工具调用次数、Token 或时间预算。瞬时错误可有限重试,事实缺失则应明确返回阻塞,不要无限搜索。
5. 主智能体必须做验证
主智能体不能直接拼接所有子答案。它应检查证据是否存在、发现是否重复、严重度是否一致,以及建议是否互相冲突。
九、PTC与Multi-agent怎样组合?
两者解决的是不同层级的问题:
- Multi-agent:把复杂任务拆成多个需要独立判断的工作流;
- PTC:在某个边界明确的工作流里高效调用和处理多个工具结果。
例如,竞品研究可以分成产品、价格、安全三个子智能体;价格子智能体再使用 PTC 批量读取和标准化价格记录。不要让所有子智能体都无差别使用 PTC,否则工具流量、缓存和失败处理会迅速复杂化。
十、Agent工作流如何评测?
OpenAI 的官方建议是比较任务结果,而不是只看模型似乎“更聪明”。可以记录:
- 任务成功率和答案完整性;
- 必要证据是否保留;
- 总 Token、缓存 Token 和工具费用;
- 首次响应与完整任务延迟;
- 工具调用、程序执行和子智能体数量;
- 重试率、超时率和结构化失败率;
- 人工介入次数;
- 副作用操作是否都经过批准。
建议使用同一批代表性任务比较三组基线:直接工具调用、PTC、Multi-agent/组合方案。只有质量至少持平时,速度和成本优势才有意义。
十一、安全与生产边界
- 工具使用最小权限,读取和写入工具分开;
- PTC 不执行付款、删除、发信或生产变更;
- 外部写操作必须有明确人工确认;
- 工具结果视为不可信输入,防止提示注入;
- 限制并发、运行时间、返回大小和重试;
- 日志记录调用者、
call_id、参数和结果摘要; - 对敏感字段脱敏,不把私钥放进模型上下文;
- Beta 功能预留行为变化和降级路线;
- 出错时停止并返回结构化失败,不以猜测继续。
十二、常见问题 FAQ
PTC就是让GPT-5.6运行任意JavaScript吗?
不是。它是在托管运行环境中执行程序,并只能调用被配置为符合条件、允许程序调用的工具。生产系统仍需定义权限、参数、超时和副作用边界。
多个工具可以并行,就一定要用PTC吗?
不一定。单次调用、结果很小或每个结果都需要新语义判断时,直接工具调用通常更清楚。PTC 更适合可预测的数据处理阶段。
Multi-agent能保证结果更好吗?
不能。只有任务能合理拆分、子任务交付物明确、主智能体能验证结果时,它才可能减少墙钟时间或提高覆盖率。小任务反而可能更慢、更贵。
GPT-5.6 Multi-agent已经稳定可用于所有生产系统吗?
官方文档目前标记为 Beta。可以做受控评测,但关键生产流程应保留单智能体或人工降级方案,并关注官方更新。
PTC与函数调用有什么区别?
直接函数调用通常由模型逐次决定工具和下一步;PTC 让模型生成程序,在一个受限阶段中调用并处理多个符合条件的工具,再返回压缩结果。两者可以在同一系统中各自服务不同任务。
十三、官方来源与相关阅读
官方资料:
相关阅读:
- GPT-5.6发布:新功能、API价格与国内使用
- GPT-5.6 vs GPT-5.5全面对比
- GPT-5.6 Sol、Terra、Luna模型选型
- GPT-5.6提示词最佳实践
- ChatGPT官网与中文版使用终极指南
本站为独立第三方中文教程网站,与 OpenAI 无隶属关系。API 功能、Beta 状态和参数可能变化,上线前请复核 OpenAI 官方文档并通过自己的评测验证。