搜索关键词 Terminal Bench 2.1
AI & Enterprise
Meta发布AI编程代理Muse Code,主打长时间运行与故障恢复
Meta推出面向终端的AI编程代理Muse Code测试版。该产品基于Muse Spark 1.2,可面向大型代码库完成任务规划、代码编写和结果验证,并通过本地事件日志支持故障后恢复执行。尽管其基准测试成绩仍落后于Anthropic的Opus 5,Meta仍将长时间自主运行能力和工具调用场景下的稳定性作为核心卖点。
AI & Enterprise
WSJ:美国开放权重AI初创公司兴起,能否撼动中国优势仍待观察
在中国AI公司凭借开放权重模型,以更低成本和接近头部模型的性能迅速扩大影响力之际,美国也出现一批主打开放权重的AI初创公司,Arcee、Reflection AI、Poolside等受到关注,NVIDIA也推出了自有开源模型以加码相关生态。报道称,尽管美国市场对开放权重模型的兴趣升温,但相关公司在融资、模型发布进度和性能竞争力上仍面临不确定性。
AI & Enterprise
Poolside推出代码智能体开源模型Laguna S 2.1
AI编码初创公司Poolside于当地时间21日发布面向代码智能体的模型Laguna S 2.1,并开放模型权重。该模型参数规模为1180亿,在Terminal-Bench 2.1和SWE-Bench Pro两项测试中,表现接近DeepSeek-V4-Flash等更大模型,部分指标领先。模型权重已通过Hugging Face在OpenMDW-1.1许可证下公开。