SpaceXAI推出新一代AI模型Grok 4.6。图片来源:SpaceXAI

SpaceXAI推出了新一代人工智能模型Grok 4.6。

据ITmedia等外媒12日 报道,Grok 4.6在综合性能评测中的得分与OpenAI的GPT-5.6 Sol Max持平。该模型主要面向需要多步骤连续执行的Agent场景,同时强化了对话交互中的可视化生成能力。SpaceXAI为SpaceX旗下AI机构。

Grok 4.6基于上一代Grok 4.5开发。SpaceXAI表示,新模型针对多步骤任务的连续执行能力进行了优化,并提升了与用户对话过程中生成可视化结果的能力。

根据SpaceXAI公布的基准评测结果,Grok 4.6在Artificial Analysis的“Intelligence Index(AAII)”9项指标中合计得分61分,与GPT-5.6 Sol Max持平,但较Anthropic的Fable5 Max低1分。相比上一代Grok 4.5 High的56分,提升了5分。

从细分评测看,各模型表现各有侧重。在衡量具备经济价值任务执行能力的“GDPVal-AA v2”中,GPT-5.6 Sol Max得分1753;在评估知识工作场景的“AA-Briefcase”中得分1577;在法律领域评测“Harvey Lab(Vals)”中得分15.8%,均为对比模型中的最高成绩。

相比之下,Grok 4.6在软件工程评测“DeepSWE v1.1”中得分65.9%,在衡量终端操作能力的“Terminal Bench v3.0”中得分26%,两项成绩均领先Fable5 Max和Grok 4.5 High。SpaceXAI表示,其他模型的相关数据引自各开发者公开发布的模型卡和排行榜。

SpaceXAI称,Grok 4.6尤其擅长仅根据粗略的产品设想搭建出首个可运行版本,包括先研究不熟悉的领域,再完成应用框架搭建,并结合反馈持续迭代优化。该公司还表示,在长时任务中,模型已能够在进入下一步前自行校验结果。

在训练方式上,SpaceXAI称,相比Grok 4.5,新模型进行了更长时间的预训练,并使用由Grok 4.5生成的数据进行监督微调(SFT),同时叠加强化学习,覆盖内核优化、Web开发和计算机辅助设计(CAD)等场景。

安全方面也同步加强。SpaceXAI表示,随着模型性能提升,公司已对安全防护措施进行了改进和校准,并在发布前开展了迄今规模最大的性能评估和安全调试测试。

与此同时,Grok 4.6的上线渠道也进一步扩展。自发布日起,用户可通过Grok Build、Cursor、Grok Bot和API使用该模型,同时也可在OpenRouter、Vercel、Cloudflare等合作渠道接入。其中,Grok Bot Beta是SpaceXAI前一日发布的服务,是一款常驻云端虚拟计算机运行的AI Agent,可在iPhone、Mac等设备上使用。SpaceXAI此前已于6月收购Cursor。

价格方面,Grok 4.6输入价格低至每百万token 2美元,输出价格低至每百万token 6美元;高速版本价格为上述标准的两倍。SpaceXAI还表示,发布后一周内将针对Cursor和Grok Build推出促销活动,把套餐额度提升至原来的两倍。

关键词

#SpaceXAI #Grok 4.6 #OpenAI #GPT-5.6 Sol Max #Anthropic #Fable5 Max #AI Agent #基准评测 #Cursor #API
版权所有 © DigitalToday。未经授权禁止转载或传播。