生成式AI解决方案公司Xenon于18日宣布,正式开源AI模型“Hunmin VLM 397B”。该模型可识别屏幕内容,并直接执行电脑操作任务。
Hunmin VLM 397B基于3970亿参数的开源模型Qwen3.5-397B打造,重点补强了屏幕识别和电脑操作能力。
在用于评估屏幕可交互目标定位能力的ScreenSpot-Pro测试中,Hunmin VLM 397B获得75.6分,位列Hugging Face榜单第2位。在衡量Linux环境下真实电脑任务执行能力的OSWorld测试中,该模型得分70.5分,较基座模型提升22.3分。
Xenon表示,在对这一3970亿参数模型进行后训练时,公司使用了8块NVIDIA B200 GPU,并采用FP8量化进行监督微调(SFT)和强化学习(RL),以在有限算力条件下提升电脑操作能力。
在8项韩语基准测试中,Hunmin VLM 397B与基座模型的分差控制在2分以内。
Xenon此次还同步公开了原版模型和体量约为原版一半的FP8版本,采用Apache 2.0许可证,并提供配套的开发与评测方法。
Xenon副总裁兼CTO Myung Dae-woo表示,AI模型竞争的重心正从单纯扩大参数规模,转向以更高效率补齐大模型所需能力,并将其提升到可落地应用的水平。
记者信息