OpenAI新模型:能自己操作电脑,完成任务快近一倍
OpenAI 发布 GPT‑6 Astra,自称“世界上最智能、最对齐的模型”。计算机使用、网页浏览、软件工程、网络安全、科学研究和专业工作,它都做到当前最先进水平。多步骤工作流可以自主推进,最后交出成型的文档、电子表格和演示文稿。
OpenAI 还放出一批成绩:FrontierMath Tier 4 拿了 98%,ARC‑AGI‑3 是 99.9%,网络安全测试 ExploitBench 直接满分。Astra 已经帮着解决了一些长期悬而未决的数学问题。
能自己干活,也能交出成品
模型能力里最不一样的部分,是“计算机使用”。ChatGPT 可以在后台操作一台 Mac 或其他桌面电脑。以前那些需要人一步步点击、切换窗口、反复确认的任务,现在能拆成一段自动跑的流程。你给出目标,等它结束就行。
体验也实打实变了。OpenAI 给的数字是,Astra 操作电脑的速度比之前快了接近两倍。复杂任务提交之后可以放着不管,它自己跑完多步流程,再把结果带回来。
速度提升不全是新模型的功劳。OpenAI 优化了执行层的工具链,旧模型也跟着受益——同样的优化让 GPT‑5.6 Sol 的任务速度提高了约 60%。底层框架的改进,会传导到同一体系里不同代际的模型上。
Codex 先学会不“失忆”
长任务最容易出的问题,是干到一半忘记前面发生过什么。过去 Codex 在上下文窗口填满时,会把历史压成一份摘要再继续。Astra 换了做法:把积累下来的细节写成笔记,跨窗口保留,不再反复压缩。
更早的上下文窗口也保持可搜索。哪怕某条信息没被写进笔记——比如某个旧要求,或某次工具输出的测试结果——Astra 也能回去翻原文。跑长任务时,一次运行失败后它能回头找到原因,不用重新问一遍。
这项功能目前在 Codex 里是个实验开关,想用的人可以打开。未来几周会成为 Astra 的默认设置。旧窗口的存留时长、笔记数据怎么管理,OpenAI 都没说——这是升级后还没回答的隐私问题。
文章作者自己也说,Codex 对他的改变比主聊天界面更深。他已经把大量不需要批判性思考的工作交给它,甚至能在 Mac 上拼出以前做不来的自动化小工具。
走到 Astra 之前的密集发布
GPT‑6 Astra 不是一次孤立发布。往前数,GPT‑5 在 2025 年 8 月 7 日上线。它取代 GPT‑4o 和几个推理模型,成了 ChatGPT 的默认模型。它靠自动路由区分请求:简单的快速应答,复杂的自动引入更深层推理。OpenAI 当时说,它的事实错误比 GPT‑4o 更少。
此后发布节奏明显加快。11 月的 GPT‑5.1 主打更自然、更有人情味的回答。12 月,顶着“code red”内部代号的 GPT‑5.2 冲专业工作场景,目标是回应 Gemini 的追赶。再往后,GPT‑5.3 Instant 修正聊天里的尴尬语气。两天后,GPT‑5.4 Thinking 带来百万级 token 上下文窗口,把计算机使用内置了进去。
模型家族也在这时开始分化。先是一批迷你版和 nano 版,还有受限发布的网络安全版 GPT‑5.4‑Cyber。之后是面向更高自主性的 GPT‑5.5、GPT‑5.5 Instant,再到 7 月的 GPT‑5.6 Sol、Terra、Luna。
产品形态也同步在变。2 月,OpenAI 推出独立的 Codex Mac 应用,用来运行多个编码代理、审查改动、调度工作。到 7 月,Codex 事实上成了新的 ChatGPT 桌面应用,把 Chat、Work、Codex 合并到一起。原来的客户端改名 ChatGPT Classic。编码代理和日常助手之间的界线就此消失,任务执行成了产品主线。
能力变强,推出节奏反而放缓
在所有这些能力里,网络安全最敏感。OpenAI 说,Astra 在网络安全上是“显著的能力跃升”。这个水平达到了自家 Preparedness Framework 下的“关键阈值”。正因为这个,它没有像过去那样一次性放开。
首发名单很窄:只给网络安全研究项目 Daybreak 的成员。这跟 GPT‑5.6 发布时的节奏一样。一天后,月费 100 美元或 200 美元的 Business 和 Pro 客户拿到访问权限。几小时后,20 美元月费的 Plus 订阅者也进来了。接下来几天会覆盖所有 Plus、Pro、Business、Enterprise 用户,也会通过 OpenAI API 和 AWS 提供。
Astra 的使用量算在现有订阅额度里,需要更多算力的人或企业可以另买额度。Pro、Business 和 Enterprise 用户还会拿到 GPT‑6 Astra Pro 的访问权限。Pro 版和标准版功能、性能差在哪,OpenAI 没说。
企业端的设置最谨慎:Astra 在 Enterprise 工作区默认关闭,管理员可以手动打开。也就是说,一个组织用不用这个模型,管理员说了算。对风险的控制,OpenAI 靠的是调整开放顺序,以及留一个手动开关。