当智能体要在几毫秒内决定一个内容是否违规、一封邮件归入哪个队列、一个客服工单打几分,让大语言模型写一篇小作文再解析答案,显然是一种浪费。10月7日前后,OpenAI上线了Decisions API,一个只回答判断题的专用接口,把评估类工作负载从生成式接口里拆了出来。
Decisions API的输出形态被刻意做窄,只有三种:是或否的概率判断、从预设类别里挑一个、以及按量表打分。官方给出的性能数字是,速度约为现有Responses API的十倍,定价则低到每百万输入词元0.1美元。三种输出形态覆盖了企业里最高频的机器判断场景:内容审核要的是违规与否,工单路由要的是类别归拣,质量评估要的是分数刻度。接口不做长文本生成,不做复杂推理链条,把全部算力花在最短路径上给出可信判断。
同一批调整里,OpenAI还把付费API档位从五档精简为三档。此前按用量的分级体系被开发者抱怨过于繁琐,档位收敛后,小团队与大型企业之间的定价阶梯更清晰。档位精简加判断接口独立定价,两条线合起来传递的信号很一致:OpenAI开始按工作负载类型重塑API产品线,而不是按模型型号一刀切。
从开发者的第一轮反馈看,接口的响应模式也做了适配:输入是任务描述加选项定义,输出直接是结构化的判断结果,中间不再有自然语言的包装层。对于每天要跑百万级判断的业务,省掉的那一层解析,既是延迟的节省,也是出错概率的削减。
理解这个产品的价值,要看清企业AI负载的真实构成。在一套典型的智能体系统里,真正需要长推理的决策只占少数,大量调用是琐碎的二元与多元判断:这段文本是否包含敏感信息、这个地址是否在配送范围、这张票据属于哪个科目。过去这些判断要么交给传统机器学习分类器,精度够但泛化差、每换一种规则就要重新标注训练;要么交给大模型,泛化好但按生成式价格计费,还要从自然语言输出里解析结构化答案,成本与延迟都吃亏。
Decisions API卡进的就是这个缝隙:用大模型的理解力做判断,用专用接口的路径把成本与延迟压到分类器量级。每百万输入词元0.1美元的定价,意味着高频场景的单位判断成本可以压到忽略不计的程度,审核、风控、路由、质检这类每动辄百万次调用的业务,第一次有了大模型品质加分类器价格的选项。
这个接口对智能体开发者的意义可能比对企业IT更大。智能体在执行任务时,每一步都嵌着微决策:这个搜索结果相关吗、这个页面是目标页吗、这个操作需要用户确认吗。用旗舰模型做这些微决策,等于开着卡车送外卖;用Decisions API做前置过滤,智能体的总体延迟与成本结构都会显著改善。可以预期的典型架构是,主智能体由旗舰模型驱动,负责规划与生成;海量微判断下沉到Decisions API,两者通过工具调用协议衔接。
放在行业背景里看,这一步与OpenAI近期的产品节奏连贯。其智能体产品线从通用助手延伸到开发者工具,判断接口的独立化意味着智能体基础设施的分层在加速:生成有一代价、检索有一代价、判断有一代价,每层都按自身经济学定价。对竞品来说,这是一个必须跟进的产品形态,专用判断通道大概率会成为智能体API的标配组件。
实际工程里还有个细节值得注意:微决策下沉后,主模型与判断接口之间的分工边界要写清楚,哪些判断属于可自动执行的低风险类,哪些需要回传主模型甚至人工确认,这张清单决定整套系统的安全下限。
判断类负载的专用化并不是OpenAI独有的方向。近期开发者生态里已经出现把自然语言政策直接编译成审核判断的开源轻量模型,一七十亿参数级别即可在50毫秒内完成二元内容判定,政策变更无需重新训练。创业公司也在做类似的窄域判断模型,用极小参数量换极低延迟。OpenAI的入局等于给这个方向背书:不是所有AI负载都需要通用大模型,可组合的专业化判断模块正在成为应用架构的标准件。
差异点在于生态位。开源轻量模型赢在可控与极低成本,适合有工程能力的团队自部署;Decisions API赢在开箱即用、随旗舰模型的理解力同步升级,适合不想维护模型基础设施的企业。两者会长期共存,就像自建数据库与云数据库的关系。
对选型团队,一个务实的做法是双轨跑一段:高频简单判断走专用通道,长尾复杂判断留在生成式模型,积累两周数据后再按准确率与成本曲线逐步收窄边界。
打算接入的团队建议分三步走。第一步,盘点现有系统里的高频判断点,把规则引擎、人工审核与大模型调用里重复出现的二元与多元判断列出来;第二步,用真实历史数据做离线对比,重点看两个指标,与大模型全量方案的判断一致率、与人工标注金标准的准确率;第三步,灰度上线并保留人工抽检通道,把误判成本高的类目先留在人工侧。风险端要留意两点:一是接口输出窄化后,超出三种形态的复杂评估仍需回到生成式接口,不要硬套;二是判断接口的输出同样需要纳入审计与回归测试,判断模型换代时行为可能漂移。判断题做成基础设施,是这个10月智能体赛道最实在的产品化进展。
另外建议把判断接口的版本号纳入变更管理,厂商迭代判断模型后,历史灰度结论未必直接可迁移,重大版本更新时安排一轮回归测试,是保持判断质量稳定的必要动作。