前OpenAI研究员Diogo Almeida推出的Jev(System1模型),对当前主流AI发展路径提出反思。他认为Codex、Claude Code这类产品依旧停留在以人为中心的辅助阶段,RLHF训练模式带来模式坍缩、概率校准失真等固有缺陷,AI拥有强大的智能能力,却缺少适配软件流程调用的接口,难以真正落地自动化业务,Jev正是为解决这一痛点诞生的全新模型品类。

传统大模型依靠**RLHF(基于人类反馈的强化学习)**完成后训练,优化目标是迎合人类用户偏好,输出让人满意的文本回答。但这套训练方式会造成模型概率分布失真,为生成安全通顺的回答,模型会舍弃部分真实可能性,出现模式坍缩问题。模型输出的内容偏向用户希望看到的答案,而非自身真实置信判断。当这类模型被当作后台软件组件调用时,会出现不可控的拒答、输出波动,无法满足程序运行对稳定性的硬性要求,这也是很多业务不敢把关键决策交给AI的核心原因。

Jev采用RLCD(面向校准决策的强化学习)作为核心训练框架,它的核心定位不是聊天机器人,而是机器原生、可供代码直接消费的智能能力,追求每美元智能的极致性价比。它不追求生成大段文本,对外提供Choice、Noul、Score三类基础输出原语,分别对应程序的分支选择、概率判断、评分排序,输出附带概率与置信度,开发者可以自定义阈值:模型置信度达标就自动执行任务,置信度不足则转交人工处理,实现人机分工。

在安全对齐的设计理念上,Jev做出了和主流模型截然不同的取舍。它不反对安全本身,但拒绝把平台方的价值判断固化写入模型底层。面向人的聊天产品内置拒答逻辑具备合理性,可当模型作为API被程序调用,运行在后台业务链路中,无预期的拒答等同于程序发生类型错误,直接造成业务流程中断。Jev将价值判断、使用风险交给下游开发者,如同数据库不会自行判断查询用途好坏,平台划定技术能力与业务责任的边界,把决策权限交还开发者,适配多样化的业务场景需求。

在可靠性层面,Jev优先看重稳健性,而非简单的输入输出完全确定性。即便提示词混入无关冗余字符,只要语义不变,模型判断结果就不应发生剧烈偏移。对于已经上线的模型版本,不会在后台偷偷改动模型行为,保障API作为程序依赖的稳定性;同时会持续迭代新版本,但无法承诺永久维护全部旧版本,平衡迭代速度与开发者的使用安全感。团队并不迷信公开评测榜单,认为榜单极易出现针对性刷分,更看重内部评测与真实业务落地效果,主张开发者应当把模型嵌入自身业务流程,以实际任务表现作为评判标准,而非单纯参考公开分数。

在落地实践上,Diogo Almeida给出开发者实操思路:不要把复杂任务一次性全部丢给模型,而是拆解为最小可独立判断的语义单元,使用结构化的输入传递状态、评判标准,由代码掌控整体业务逻辑。拆分之后每一项判断都可以独立评估、调试阈值,当模型能力不足以完成任务时,就选择暂不部署或者交由人工介入。

目前Jev主要落地四大方向:挖掘企业海量暗数据,处理过去因成本过高无法分析的数据;支撑业务流程的实时快速判断;充当校验器,核查其他大模型的输出结果;将智能判断嵌入软件核心逻辑,改造原有程序。编程Agent领域是它的重点场景,现有Agent大多基于Claude Code、Codex这类生成式模型构建,而Jev可以承担大量细碎判断任务,优化Agent整体成本与稳定性。

Diogo Almeida坦言,在Jev诞生之前,AI明明具备解决高难度问题的实力,大量基础重复工作却无法自动化,这是行业的一大遗憾。AI的未来不一定是让模型变得更像人类助手,更有可能退居软件后台,成为类似数据库一样无处不在的基础设施。它不需要被用户感知,默默完成各类智能判断,以此推动软件能力升级,拉动实际经济价值增长。当然Jev尚处在早期,System1模型更擅长直觉式单步判断,长链条多步推理依旧存在短板,行业仍需要更多不同路线的探索,形成百花齐放的AI研发格局。