OpenAI于9月3日推出新模型GPT-6 Astra。根据早期用户反馈,Astra在3D空间重建、游戏开发和桌面任务等场景中表现突出,但在写作能力方面的评价不及前代产品。
据区块链媒体Decrypt 9月6日报道(以下时间均为当地时间),Astra的API价格为每百万Token输入10美元、输出50美元,较上一代模型GPT-5.6 Sol高出2.5倍。OpenAI将Astra定位为面向电脑操作、编程、研究以及复杂多步骤任务的专用模型。
3D制作与游戏开发表现亮眼
Astra的一项核心能力是所谓“计算机使用”,即不仅能够提供操作建议,还可以在真实桌面环境中直接控制鼠标和键盘执行任务。OpenAI表示,在OSWorld 2.0测试中,Astra平均用时约40分钟,常见桌面任务完成率达到72.6%;相比之下,GPT-5.6 Sol的完成率为65.7%,平均用时约75分钟。
从早期案例来看,Astra在空间感知和视觉理解方面尤其受到关注。HyperWrite前CEO、投资人Matt Shumer表示,Astra能够在Unreal Engine中以街区级精度复现曼哈顿。Max Weinbach则展示了基于Apple Park照片、在Blender中重建3D模型的结果。
匿名开发者SuSu称,自己利用Astra在网页浏览器中耗时24分钟完成了中国杭州及周边区域的3D呈现,其中包括西湖、雷峰塔、茶园和湿地,并加入了可点击地标和昼夜切换功能。
早期案例还显示,Astra在游戏开发方面也具备较强能力。Rishi Prasad表示,他在一天内完成了一款基于浏览器的射击游戏《Astral War》,支持12人大厅、多人服务器、手柄操作和语音聊天。他称,与一个月前借助其他模型实现的效果相比,这次作品的视觉完成度明显更高。
在绘图场景中,日本插画师Taiyaki Sun将自己绘制的线稿交由Astra上色。Astra在Clip Studio Paint中通过鼠标完成了图层生成、缩放、画笔选择和上色等操作。该过程基于每月100美元的Pro套餐“最大算力模式”完成,共消耗其当月额度的21%。
在音乐相关测试中,Astra也展现出一定能力。通讯《Augmented Fifth》主理人Auggie表示,在一项非官方测试中,Astra完成了巴赫风格四部合唱写作并获得最高分,声部进行没有错误,且包含那不勒斯六和弦。OpenAI内部评估也显示,Astra在古典乐谱识读方面较GPT-5.6 Sol有明显提升。
(引自推文)GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect.
写作场景评价不及GPT-5.6 Sol
不过,在写作相关场景中,Astra的评价明显分化。Louis-François Bouchard表示,在其自建的作者文风基准测试中,Astra仅以1995 Elo位列第11,而GPT-5.6 Sol则以2156 Elo排名第6。他形容Astra的表现“令人意外地失望”。
量化投资组合管理作者Giuseppe Paleologo表示,他曾要求Astra给出最优分散化思路,但其回答显得程式化且略显夸饰,与真正的创造性仍有差距。Ingar Haaland也提到,他让Astra模仿自己的写作风格并尝试通过AI检测工具,结果仍未能避开识别。
外部评测同样较为谨慎。Artificial Analysis统计显示,在用于衡量具备经济价值的专业工作能力的GDPval-AA v2测试中,Astra成绩较此前水平回落约80 Elo;在客户支持和长上下文推理方面也出现小幅下滑。不过,在整体智能指数方面,Astra得分为61.2,略高于GPT-5.6 Sol的60.9。
安全能力则明显增强。OpenAI将Astra列为其首个达到网络安全“重大”阈值的模型,这意味着即使没有人为指定漏洞,该模型也可能发现未知软件漏洞并开发相应攻击方法。基于这一风险,OpenAI已将其高级网络安全能力纳入“Daybreak”项目下加以限制。
OpenAI表示,Astra正面向ChatGPT Plus、Pro、Business和Enterprise用户,以及API渠道逐步开放,同时也将通过Microsoft Azure、AWS Bedrock等平台提供。在企业环境中,相关访问权限需要由管理员手动开启。
综合目前披露的早期反馈,GPT-6 Astra在答案更容易验证的3D制作、游戏开发和桌面任务中优势明显;但在更依赖文风、偏好与创意的写作场景里,整体评价仍低于GPT-5.6 Sol。