Upstage于14日发布商用大语言模型Solar Pro 4,进一步强化AI Agent能力。
据介绍,Solar Pro 4在Solar Pro 3基础上提升了推理与Agent表现,并加强了文档理解与信息抽取、长上下文推理、连续决策等能力,更贴近实际业务场景需求。
Upstage表示,Solar Pro 4已接入美国Nous Research推出的AI代理Hermes Agent,以及API路由平台OpenRouter,成为首个进入上述两个平台的韩国模型。上线OpenRouter仅3天,累计Token 调用量已突破800亿。
与此同时,Solar Pro 4也成为首个进入Agent Arena榜单的韩国模型。该榜单主要对比全球主流模型的代理能力。Upstage称,Solar Pro 4在该榜单上的表现接近NVIDIA的Nemotron 3 Ultra。
从细分基准测试来看,Solar Pro 4在评估终端多步骤任务能力的Terminal-Bench v2.1中获得57分,较Solar Pro 3提升4.8倍;在评估对话过程中工具调用能力的τ³-Banking中获得23分,较前代提升2.6倍。
在长文理解基准AA-LCR中,Solar Pro 4获得71分。该测试主要评估模型从长文档中抽取信息并据此进行推理的能力,其成绩较前代提升超过2.3倍。
目前,Solar Pro 4也已被应用于Upstage的Agent型文档处理解决方案Upstage Studio,可从包括韩文文档在内的多类文档中抽取信息,并完成摘要、分析、翻译等任务。
在全球AI模型评测机构Artificial Analysis的综合评测中,Solar Pro 4获得42分。Upstage表示,这一成绩高于NVIDIA的Nemotron 3 Ultra(38分)、Google的Gemini 3.5 Flash-Lite(37分)、Mistral的Medium 3.5(30分)以及Cohere的Command A+(23分)。
Upstage CEO Kim Seonghun表示,AI在实际工作中需要的不是“擅长考试”,而是“能够把交付的任务可靠完成”。公司将持续提升可在一线业务场景中落地应用的AI模型性能。