由Diogo Almeida创立的TypeSafeAI近日推出新AI模型Jev,在技术圈引发关注。由于Almeida曾参与GPT-4、InstructGPT和ChatGPT的研发,这款新模型也受到开发者社区广泛讨论。
与主流大语言模型(LLM)不同,Jev并不以生成文本为核心,而是直接输出决策结果及其概率。Foundation Capital合伙人Jaya Gupta表示,Jev可以被视为一种“只输出判断结果”的模型:面对复杂场景、边界清晰的问题以及候选答案明确的任务时,它不会生成完整句子,而是返回决策及概率值。
Almeida认为,软件系统真正需要的往往不是一段文字,而是“是否紧急”“继续还是停止”“允许还是拦截”这类可执行判断。按照他的说法,如今不少流程仍是先由语言模型生成文本,再由系统将文本解析为决策,但对于许多在代理系统内部反复执行的任务而言,生成文本本身并无必要。
基于这一判断,TypeSafeAI正将Jev定位为突破现有大语言模型局限的替代方案。
在创立TypeSafeAI之前,Almeida曾在OpenAI工作4年多,参与GPT-4、InstructGPT、ChatGPT以及基于人类反馈的强化学习(RLHF)相关工作。
他表示,围绕AI能力的讨论中,长期存在两种相互矛盾的看法:一方面,AI在部分工作上显得异常强大;另一方面,在另一些任务中又几乎派不上用场。
Almeida在近期一场活动中指出,媒体上常见的成功案例,大多属于“人参与其中”的辅助型任务;而那些效果不尽如人意的场景,往往是希望AI独立完成的自动化工作。以客户服务为例,外界通常认为自动化更容易落地,但现实情况恰恰相反。
在他看来,多数客服聊天机器人至今仍无法直接执行具体操作,通常只停留在检索文档和提供指引的层面。根本原因在于模型仍可能出错,企业因此不会轻易赋予其实际执行权限。
Almeida还将编码代理归类为辅助工具。他认为,代码本质上更像是写给人看的语言,而不是纯粹的机器语言。为说明这一点,他抛出了一个问题:“如果没有版本管理,你会信任编码代理吗?”
在Almeida看来,这类现象的根源之一在于RLHF。RLHF的目标,是让模型生成更符合人类偏好的回答。但他认为,经过RLHF训练的模型,往往更倾向于给出看起来更稳妥、更合理的答案,即便答案本身未必正确。他同时表示,随着精度要求不断提高,大语言模型的可用性反而会下降;而传统机器学习系统则相反,精度越高,实际效用提升越明显。
他还对“AI既能胜任人类参与的辅助任务,又能同时做好自动化”这一判断持保留态度。按照他的解释,这两项目标会将模型拉向不同方向,最终形成一种性能起伏不定的智能。
Almeida强调,若要实现真正可信的自动化,模型准确率必须达到“9后面还有很多个9”的水平。
他表示,TypeSafeAI当前将重点放在自动化,而不是辅助功能。对于希望构建“人参与其中”型辅助服务的企业来说,Jev未必是合适方案。
此外,Almeida还建议企业,不要将“决策本身存在风险”的事务直接交给AI处理。在考虑使用OpenAI产品开展新用户引导之前,企业应先评估其中是否存在风险点,以及是否具备足以防止损害发生的安全护栏。