韩国研究团队凭借可理解自然语言指令并自主寻找目标位置的机器人AI技术,在国际赛事中拿下第一。
ETRI 16日表示,该机构与KAIST组成的联合团队在瑞典马尔默举行的计算机视觉学术会议“ECCV 2026”VLNVerse挑战赛中,从112支参赛队伍中脱颖而出,获得冠军。
视觉-语言导航(VLN)是一项让机器人理解人类自然语言指令、通过摄像头感知周边环境并自主移动至目标位置的技术。即便不依赖精密地图,也无需人工预先输入行进路径,机器人仍可结合空间信息与指令完成导航。
此次比赛中,ETRI现场机器人研究室与KAIST教授Myung Hyun研究团队以“URL-FRRS”联合队参赛。在目标物搜索和精细导航两项任务的综合评估中,团队平均成功率达到90.7%。虽然与第二名成绩相同,但根据赛事规则,因提交时间更早而最终夺冠。
研究团队此次重点攻克了机器人在非目标位置误判“已到达”的问题。为此,团队面向机器人导航场景训练了约80亿参数的视觉-语言模型(VLM),提升了对目标地点的判定能力。
团队同时开发了“CoRe-VLN”技术机制。当机器人因误判而停下时,系统可自主复核是否真正到达目标点,并重新搜索路径。具体而言,机器人停止后会采集周边图像,再由多模态AI对位置、目标物和距离等信息进行综合判断;若确认并非目的地,则重新规划路线并继续搜索。
本次研究共使用32块Nvidia H200 GPU,相关算力由韩国科学技术信息通信部和韩国信息通信产业振兴院(NIPA)的“先进GPU应用支持项目”提供。
ETRI计划将相关技术应用于面向视障人士的导引机器人“Guide Dog”,以及基于韩国国产AI芯片的端侧机器人移动智能。
此外,ETRI还将推进相关研发,目标到2029年实现视觉-语言模型在韩国国产神经网络处理器(NPU)上的运行,使人形机器人等自主行动体在不依赖精密地图的情况下,也能在制造和物流现场完成移动作业。