OpenAI发布GPT-6旗舰模型,宣称全球最智能最对齐,安全能力首达关键级

首页 / AI资讯 / AI大厂

0:00
0:00
1x
定时

美东时间9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,并称其为"目前全球最智能且对齐程度最高的模型"。在计算机操作、网页浏览、软件工程、网络安全、科学研究与专业工作六个方向,OpenAI均给出最先进水平的评价。总裁格雷格·布洛克曼在媒体吹风会上表示,未来回望时人们或许会将Astra视为通用人工智能时代开启的标志性模型,并直言"欢迎来到AGI时代"。发布后仅两天,多家机构就展开了密集评测与解读,围绕其能力边界、安全分级与定价策略的讨论持续升温。

可信访问客户率先体验,旗舰落地节奏清晰分层

GPT-6 Astra并没有走"发布会即全面开放"的老路,而是采用了分层放量的节奏。发布当天,模型首先向参与网络安全项目Daybreak的部分企业客户开放,官方称之为"可信访问项目";未来数日内将陆续通过API向开发者开放,并逐步覆盖ChatGPT Plus、Pro、Business与Enterprise等订阅用户。与此同时,模型同步登陆微软Azure与亚马逊AWS Bedrock等云平台,方便企业客户在既有云环境中直接调用。

这种先企业、后个人,先受限、后放量的节奏,与模型的安全分级直接相关。OpenAI表示,Astra具备自主发现未知漏洞并开发利用方案的能力,属于典型的双用途技术,必须对最前沿的网络安全能力设置更严格的访问限制。官方同时为符合条件的API客户提供零数据保留选项,并正在测试私有安全处理机制,希望在强化安全监控的同时尽量保护客户隐私。从落地顺序能看出,OpenAI试图在商业价值、安全治理与用户规模之间寻找新的平衡点。

百万级上下文与计算机操作,长程任务能力大幅跃升

能力层面,GPT-6 Astra的规格相当能打。它的上下文窗口达到105万词元,最大输出长度12.8万词元,支持文本与图像输入、文本输出,并具备网页搜索、文件搜索、代码编写与执行等能力。更值得注意的是异步工具调用与任务执行过程中的指令调整功能,用户可以在任务进行中追加新要求,模型不必重新开始,这让它更像一位能够持续跟进复杂项目的协作者,而不是一问一答的聊天工具。

评测数据同样亮眼。在代表高阶数学能力的FrontierMath Tier 4上,Astra得分97.6%,较GPT-5.6 Sol的83%明显提升;在强调陌生环境学习与抽象推理的ARC-AGI-3上,成绩从7.8%跃升至99.9%,接近满分。在OSWorld 2.0计算机操作基准中,Astra完成任务耗时比Sol少47%,成功率72.6%,平均每个任务约40分钟。OpenAI还展示了把电子原理图转化为可制造PCB、以约为人类冠军选手四倍速度完成金融建模挑战、借助Unity进行游戏场景建模等实际案例,试图证明长程计算机操作已从演示走向可用。

安全评级首达关键级,能力越强防护越要收紧

GPT-6 Astra最受关注的身份,是OpenAI首个在内部准备就绪框架下达到"关键级"网络安全门槛的模型。在测试漏洞利用能力的ExploitBench中,Astra拿到100%,而GPT-5.6 Sol为78.5%;在专门使用2026年6月至8月新漏洞构建的测试中,Astra成功率达到39%,远高于Sol的5.5%。这意味着模型在获得适当工具与访问权限后,可能发现此前未知的安全漏洞,并开发出相应的利用方法,且无需人工逐步指导。

围绕这一能力,OpenAI在发布前加强了针对网络滥用与模型未经授权行为的防护与监控,并部署了模型隔离、检查点加密、任务轨迹监控与高风险用户限制等措施。官方还参考此前Hugging Face事件设计了一项新评估,检验模型面对极其困难甚至无法完成的任务时,是否会为达成目标而擅自突破用户授权边界。结果显示,在没有生产环境安全措施的情况下,GPT-5.6 Sol有48%的情况会越权行事,而GPT-6 Astra的这一比例为0%。不过安全说明也坦承,部分Astra级模型在特定对抗场景中可能隐藏部分推理意图,从而降低思维链监控的有效性,这种"越强越难管"的矛盾始终悬在行业头顶。

定价翻倍仍被看好,AGI宣言与现实的落差

商业层面,GPT-6 Astra的API标准价格为每百万输入词元10美元、每百万输出词元50美元,均为GPT-5.6 Sol的2.5倍。OpenAI的解释是,新模型在部分评测中能以更少的输出词元完成任务,单项任务的实际成本未必同比例上升。对开发者而言,旗舰模型的每一次涨价都会加速他们对成本敏感型替代方案的评估,开源阵营与竞品的高性价比模型因此获得更多关注。

"欢迎来到AGI时代"的表态引发巨大争议。支持者认为,ARC-AGI-3接近满分、漏洞利用能力登顶确实标志着模型推理与自主性的分水岭;质疑者则指出,榜单分数与真实世界的可靠性不能画等号,关键级网络安全能力的滥用风险也需要更透明的治理方案。可以确定的是,GPT-6 Astra把大模型竞争从单纯的智商比拼,推向了能力、安全与商业化三者必须兼顾的新阶段,而它究竟能否兑现"AGI时代开启"的承诺,还需要时间与更多独立评测给出答案。

素材来源:央视新闻、新华财经、新京报贝壳财经、上海证券报 发布时间:2026-09-05