“在庆尚道的造船厂里,‘tank(槽/箱体)’常被念成‘tengke’,但通用引擎却经常把它听成‘thank you’。现场明明说的是tank,大家就会问,机器为什么听不懂。”
9月21日,Flitto联合创始人兼CTO Kang Donghan在位于首尔江南区的Flitto企业附属研究所接受采访时,用这一例子解释了通用AI为何难以直接复制到工业现场。
在他看来,尽管OpenAI、Google等全球科技巨头推动前沿AI快速迭代,但真正进入制造一线后,地区口音与方言、工人惯用说法和专业术语、机械噪声等因素都会显著影响识别和翻译效果。相比通用模型,围绕现场需求进行定制和适配的模型,往往在响应速度和准确率上更具优势。决定通译质量的关键,在于能否快速完成面向现场的“本地化”。
Kang Donghan表示,如果说“我们聚集了全球20个最懂AI的人,做出了最强模型”,市场不会相信,他自己也不会相信。与其正面挑战前沿基础模型,不如基于现有前沿模型,结合具体场景进行微调,并叠加术语库等能力,以定制化方案交付客户,这才是Flitto更擅长的方向。
Flitto近期与Hanwha Ocean、Hanwha Systems共同打造的AI通译服务“Otalk”,正是这一策略在造船场景中的落地案例。该服务支持包括韩语在内的44种语言,提供一对一对话、群聊对话,以及文本和图片翻译等功能。
在开发过程中,首先遇到的就是现场发音和方言问题。Kang Donghan举例说,一句“清理tank”,通用引擎可能会直接翻成“thank you clinic”。他还提到,在LG Electronics相关案例中,类似“pump”这样的词,也会因工人发音差异被错误识别成“ppombbu”等结果。
为解决这一问题,Flitto采集了与实际工人年龄层和地域背景相近的说话人语音数据,并围绕目标词构造句子,用于模型训练。为避免模型过度偏向特定口音、反而削弱对标准语的识别能力,团队并行采用“回放”训练方式,让现场专属数据与通用数据共同参与训练,同时配合模型微调和术语库应用。
Kang Donghan解释称,如果长期只训练方言或某一种特定发音,模型原本能够识别的标准表达反而可能“漏听”。“只靠一种方法是不够的。”
除发音问题外,团队还针对造船厂特有的噪声环境进行了适配。Otalk加入了5档收音调节功能,可根据作业区、休息室、办公室、面谈空间等不同环境,调整语音采集强度。
从实际使用情况看,Otalk在现场的活跃度较高。试点运营期间,Hanwha Ocean外籍员工的使用率约为96%。随着合作企业持续提出使用需求,Otalk在完成工号系统对接后,适用范围也扩大至合作企业员工。
谈及一线反馈时,Kang Donghan表示,有用户甚至直言“没有它就干不了活”。他还提到,船厂通常下午5点下班,但到了晚间,系统仍有大量使用记录。与不少仅停留在交付阶段的企业方案不同,Otalk已经持续嵌入实际工作流程。
除了口音和噪声,现场惯用说法与专业术语也是通用模型难以及时覆盖的部分。由于Hanwha Ocean原有术语储备不足,团队在现场测试过程中每发现新的表达,都会持续补充术语库。Flitto的专业翻译团队会给出符合实际使用习惯的译法,同时也建设了管理功能,支持客户自行新增术语。
对于在特定企业项目中获取的数据,Flitto会依据合同条款进行单独管理。Kang Donghan表示,造船业共性的内容可以沉淀为通用知识,但与单一企业深度绑定的数据,对其他项目并不具备通用性。根据合同要求,禁止外带的数据将被严格管控,项目交付后需销毁的数据也会按要求销毁。
Kang Donghan认为,Flitto的竞争力并不在某一个模型本身,而在于从数据采集、数据清洗、模型训练到术语库建设的全链路能力。他强调,当前AI落地已不是“只要STT强”或“只要翻译强”或“术语库够多”就能解决问题,真正的优势在于能否快速获取高质量数据,把前沿模型训练到适配现场需求,并最终转化为可持续使用的真实服务。
基于上述能力,Flitto也在加快拓展企业定制通译解决方案业务。公司约两年前开始推进解决方案业务,随后将产品线扩展至会议场景的“Live Translation”、个人场景的“Chat Translation”以及企业部署方案,并于今年拿下Hanwha Ocean项目,作为代表性落地案例。
Flitto方面还表示,企业通译解决方案业务今年有望实现扭亏为盈。公司计划以Hanwha Ocean等现场部署案例为基础,进一步扩大客户群,并从明年起全面加码企业定制通译解决方案业务。