2026年9月3日,OpenAI发布新一代旗舰模型GPT-6 Astra。与以往强调 benchmark 分数不同,这次发布把重点放在“端到端复杂工作流”的自主执行上:模型不再只是回答问题,而是被设计成能够操作软件、调用工具、连续处理多步骤任务的数字劳动力。
根据OpenAI披露的信息,GPT-6 Astra在多个面向真实工作场景的评测中取得明显进步。在考察长程编程与终端任务能力的Terminal-Bench 4.0上,Astra得分57.9%,高于前代GPT-5.6 Sol的37.3%以及Anthropic Claude Fable 5.1的55.8%。在电脑操作测试OSWorld 2.0离线子集中,Astra得分72.6%,较前代的65.7%提升约七个百分点,OpenAI模拟的任务报告耗时从约75分钟缩短到约40分钟。这些数字表明,模型的能力边界正从文本推理扩展到图形界面、三维空间和连续工作流。
在商业化层面,OpenAI把Astra包装成面向专业工作场景的高端服务:标准API定价为输入每百万token 10美元、输出每百万token 50美元,上下文窗口105万token,最大输出12.8万token。首批开放对象包括部分机构客户,随后逐步覆盖ChatGPT Plus/Pro/Business/Enterprise及Azure、AWS Bedrock等渠道。
能力升级伴随安全等级上调。Astra是OpenAI首个网络安全能力达到内部Preparedness Framework“Critical”等级的模型,意味着在具备合适工具时可能自主发现未知漏洞并生成利用方式。OpenAI同步强化了隔离、监控与高风险行为拦截,但也承认该模型的可监控性较前代有所下降。这提示,Agent进入生产环境时,权限边界与可控性将成为比性能更关键的部署前提。
【AICOR 点评】GPT-6 Astra的发布进一步验证了“模型竞争单位从单次回答转向完整工作流”的趋势。对企业而言,这意味着AI应用重心将从“辅助写作/检索”快速迁移到“流程代理”。AICOR一直强调:企业AI重构不是买更强大的模型,而是围绕岗位、流程与决策重新设计人机协同界面。Astra类模型提供了更长的自主执行链,但也对企业的权限治理、审计追踪和人在回路机制提出更高要求。未来半年,能否把模型的自主能力封装成可解释、可回滚、可度量的“数字员工”,将决定Agent能否真正产生经营回报。
Aviso de Copyright Este artículo está asistido por IA, reescrito a partir de reportajes públicos. El copyright de la información pertenece a los autores y medios originales; el contenido es solo para compartir información del sector y no constituye asesoramiento de inversión ni comercial.
Por cuestiones de copyright, contacte a AICOR (400-601-8080 / WeChat: aicor-ai); lo gestionaremos con prontitud al recibir la notificación.