Skip to content

GPT-5.6工具调用与Multi-agent指南:PTC、子智能体和Agent工作流 ​

如果你条件有限,强烈推荐国内 API 站

这是站主自主搭建纯 GPT API 站,无需梯子,实时更新 GPT 最新模型(仅支持电脑端),价格是官方的 三分之一,操作简单,连接稳定,价格便宜,保证没有任何掺水、收集信息等低劣行为,保证爽用 GPT。

GPT-5.6 的重要变化不只在模型回答质量。OpenAI 官方指南加入了 Programmatic Tool Calling(PTC) 和 Multi-agent Beta:前者让模型在托管 JavaScript 运行环境中编排符合条件的工具,后者让一个 GPT-5.6 实例协调多个子智能体并行工作。

API功能不等于ChatGPT界面功能

本文依据 OpenAI 开发者文档讨论 Responses API 工作流。API 中的 PTC 或 Multi-agent 已有文档,不代表所有 ChatGPT 套餐、地区和账号出现同名开关。

一、Programmatic Tool Calling是什么? ​

传统工具调用通常是这样的:模型决定调用一个工具,应用执行工具,把结果返回模型;模型再判断下一步是否继续调用。这种方式灵活,但当任务需要读取许多结果、做去重、排序或聚合时,中间输出会不断进入上下文。

PTC 允许 GPT-5.6 编写 JavaScript,在托管运行环境中调用被允许的工具,并通过代码处理多个工具结果。最后只把压缩后的结构化结果交给模型继续判断。

mermaid
flowchart LR
  A[用户任务] --> B[GPT-5.6编写受限程序]
  B --> C[程序调用允许的工具]
  C --> D[过滤、去重、排序、聚合]
  D --> E[精简program_output]
  E --> F[模型生成最终结论]

它的价值不只是“并行调用”,而是减少大量可预测的中间数据在模型轮次之间反复搬运。

二、什么任务适合PTC? ​

OpenAI 的指导强调,PTC 更适合 边界明确、处理规则可写成代码的阶段:

  • 从多个数据源筛选符合条件的记录;
  • 合并、去重和排序搜索结果;
  • 对大量结构化响应做统计和聚合;
  • 校验字段、格式、范围和完整性;
  • 从大批工具输出中只保留最终需要的证据;
  • 对相互独立的查询并行执行后汇总。

例如,研究 50 个产品的价格时,可以让程序并发读取数据,再统一货币、过滤无效记录、按价格排序,最后把前十名及来源交给模型。模型不需要逐条阅读全部原始响应。

三、什么情况不要使用PTC? ​

并不是工具越多越应该使用 PTC。以下情况通常更适合直接工具调用:

  1. 只需要调用一次工具;
  2. 每个结果都可能改变下一步的语义判断;
  3. 中间输出本来就很小;
  4. 操作涉及付款、发送消息、删除数据或人工审批;
  5. 最终回答必须保留工具的原生引用或不可压缩证据;
  6. 模型在写程序前无法知道工具返回字段和错误结构。
任务建议方式原因
查询一次订单状态直接调用单次结果很小
汇总100家门店库存PTC可并发、过滤和聚合
与客户谈判并决定下一封邮件直接调用+人工审批每轮结果改变判断且有外部影响
合并多批日志并统计错误码PTC规则明确、数据量大
选择法律意见并发送通知直接判断,发送前审批高风险且需要语义判断

四、PTC工作流需要定义哪些边界? ​

只把工具开放给模型并说“高效调用”是不够的。一个可测试的 PTC 说明至少包含:

  • 哪个阶段允许使用 PTC;
  • 可以调用哪些工具;
  • 工具输入、返回字段与错误格式;
  • 期望的 program_output 结构;
  • 并发数、重试次数和停止条件;
  • 哪些操作有副作用,禁止由程序执行;
  • 缺少必要结果时如何明确失败;
  • 哪些步骤仍需模型直接判断或人工批准。

示例:

text
使用 Programmatic Tool Calling 完成“候选记录筛选”阶段。
仅允许调用 inventory_lookup 和 supplier_profile。
最多并发 8 个请求;瞬时错误最多重试 2 次。

输出 JSON 数组,每项必须包含:supplier_id、stock、price、
source_time、validation_errors。剔除缺少时间戳的记录。

不要下单、发邮件或修改库存。若有效供应商少于 3 家,
返回 structured_failure,不要用猜测补齐。
最终供应商选择由模型直接比较,并等待人工批准。

五、程序输出和最终回答要分别验收 ​

PTC 会产生 program_output,最终助手消息则是另一个输出。程序可能找到正确记录,但最终回答仍可能漏掉字段、证据或限制。因此测试不能只看工具调用有没有成功。

至少分别检查:

层级检查内容
工具层输入是否合法、权限是否最小化、错误是否可重试
程序层去重、排序、过滤、统计是否正确
program_output是否符合结构、是否保留必要证据
最终回答是否完整引用结果、是否越过批准边界
业务结果任务是否真正完成,质量是否优于直接调用

调用次数更少、Token 更低或速度更快,只有在最终任务仍然通过验收时才算优化。

六、GPT-5.6 Multi-agent是什么? ​

OpenAI 将 GPT-5.6 的 Multi-agent 标记为 Beta。它允许一个 GPT-5.6 实例协调多个子智能体并行处理独立工作流,再综合结果。

适合拆分的任务通常具有三个特点:

  1. 子任务相互独立,可以同时开始;
  2. 每个子任务有明确交付物;
  3. 主智能体能够验证和综合结果。

例如,做一次上线审查时,可以分为:

  • 子智能体 A:检查代码和测试;
  • 子智能体 B:检查数据库迁移与回滚;
  • 子智能体 C:检查安全、权限和密钥;
  • 子智能体 D:检查文档与监控;
  • 主智能体:去重、按严重度排序并输出上线结论。

七、哪些任务不应该拆成多智能体? ​

  • 子任务高度依赖,后一步必须等待前一步判断;
  • 任务非常小,协调成本大于节省时间;
  • 所有子智能体会重复读取同一份巨大上下文;
  • 没有统一事实源和输出结构,结果难以合并;
  • 任务需要一个连续、一致的谈判或创作声音;
  • 最终操作具有外部副作用,却没有审批关口。

多智能体不是“让多个模型随便讨论”。如果每个子智能体没有范围和停止条件,常见结果是重复研究、成本上涨、结论互相矛盾。

八、如何设计一个可控的Multi-agent任务? ​

1. 按交付物拆分,而不是按角色名称拆分 ​

“让三个专家研究”太模糊。更好的方式是要求每个子智能体交付不同证据:代码风险、性能数据、权限配置或用户影响。

2. 给每个子任务独立输入 ​

只发送它真正需要的文件和工具。不要把全部代码库、全部数据库和全部客户资料复制给每个子智能体。

3. 统一输出格式 ​

json
{
  "finding": "...",
  "severity": "high",
  "evidence": ["file:line", "tool_result_id"],
  "impact": "...",
  "recommendation": "...",
  "uncertainty": "..."
}

统一结构便于主智能体去重、交叉验证和识别冲突。

4. 限制并发、预算和重试 ​

为子智能体设置最大数量、工具调用次数、Token 或时间预算。瞬时错误可有限重试,事实缺失则应明确返回阻塞,不要无限搜索。

5. 主智能体必须做验证 ​

主智能体不能直接拼接所有子答案。它应检查证据是否存在、发现是否重复、严重度是否一致,以及建议是否互相冲突。

九、PTC与Multi-agent怎样组合? ​

两者解决的是不同层级的问题:

  • Multi-agent:把复杂任务拆成多个需要独立判断的工作流;
  • PTC:在某个边界明确的工作流里高效调用和处理多个工具结果。

例如,竞品研究可以分成产品、价格、安全三个子智能体;价格子智能体再使用 PTC 批量读取和标准化价格记录。不要让所有子智能体都无差别使用 PTC,否则工具流量、缓存和失败处理会迅速复杂化。

十、Agent工作流如何评测? ​

OpenAI 的官方建议是比较任务结果,而不是只看模型似乎“更聪明”。可以记录:

  • 任务成功率和答案完整性;
  • 必要证据是否保留;
  • 总 Token、缓存 Token 和工具费用;
  • 首次响应与完整任务延迟;
  • 工具调用、程序执行和子智能体数量;
  • 重试率、超时率和结构化失败率;
  • 人工介入次数;
  • 副作用操作是否都经过批准。

建议使用同一批代表性任务比较三组基线:直接工具调用、PTC、Multi-agent/组合方案。只有质量至少持平时,速度和成本优势才有意义。

十一、安全与生产边界 ​

  • 工具使用最小权限,读取和写入工具分开;
  • PTC 不执行付款、删除、发信或生产变更;
  • 外部写操作必须有明确人工确认;
  • 工具结果视为不可信输入,防止提示注入;
  • 限制并发、运行时间、返回大小和重试;
  • 日志记录调用者、call_id、参数和结果摘要;
  • 对敏感字段脱敏,不把私钥放进模型上下文;
  • Beta 功能预留行为变化和降级路线;
  • 出错时停止并返回结构化失败,不以猜测继续。

十二、常见问题 FAQ ​

PTC就是让GPT-5.6运行任意JavaScript吗? ​

不是。它是在托管运行环境中执行程序,并只能调用被配置为符合条件、允许程序调用的工具。生产系统仍需定义权限、参数、超时和副作用边界。

多个工具可以并行,就一定要用PTC吗? ​

不一定。单次调用、结果很小或每个结果都需要新语义判断时,直接工具调用通常更清楚。PTC 更适合可预测的数据处理阶段。

Multi-agent能保证结果更好吗? ​

不能。只有任务能合理拆分、子任务交付物明确、主智能体能验证结果时,它才可能减少墙钟时间或提高覆盖率。小任务反而可能更慢、更贵。

GPT-5.6 Multi-agent已经稳定可用于所有生产系统吗? ​

官方文档目前标记为 Beta。可以做受控评测,但关键生产流程应保留单智能体或人工降级方案,并关注官方更新。

PTC与函数调用有什么区别? ​

直接函数调用通常由模型逐次决定工具和下一步;PTC 让模型生成程序,在一个受限阶段中调用并处理多个符合条件的工具,再返回压缩结果。两者可以在同一系统中各自服务不同任务。

十三、官方来源与相关阅读 ​

官方资料:

相关阅读:

本站为独立第三方中文教程网站,与 OpenAI 无隶属关系。API 功能、Beta 状态和参数可能变化,上线前请复核 OpenAI 官方文档并通过自己的评测验证。