跳到主内容
今年会网站

"哑巴模型"Jev火了,会给AI产业带来什么改变?

2026-09-30 · 周海燕

Jev模型的热度已持续超过一周。从多样化的应用方式到底层逻辑,围绕它的探讨仍在延续。

Jev不参与对话,也无法协助撰写文章或编写代码,它的功能单一:当开发者提供一组选项和当前状态时,它负责输出判断结果。

开发Jev的Diogo Almeida曾担任OpenAI研究员,参与过InstructGPT、ChatGPT及GPT-4的相关研究。他过去教大型模型学习交流,如今却反其道而行,打造了一个拒绝沟通的模型。

Almeida为何转变方向?Jev反映了当前大型模型行业的哪些担忧?将能力极限压缩,是否会成为模型行业未来的趋势?

部分任务无需动用最强模型

Jev的走红,首先契合了Agent时代最迫切的议题:模型调用必须更快、更经济。

开源项目Browser Use的创始人利用Jev构建了一个浏览器Agent,在真实的Google Flights页面上查询从苏黎世到伦敦的航班,整个流程耗时7.1秒,单次成本为0.0039美元,Jev在循环中的中位延迟约为178毫秒。

Jev的定价也相当低廉,目前Vercel AI Gateway上Jev的输入价格约为每百万token 0.04美元,输出免费,因此开发者可以无负担地频繁调用。

慢与贵已成为行业共同焦虑,这与Agent从代码场景向更广泛的办公场景扩展有关。

OpenAI数据显示,从今年2月到6月,企业每周活跃Codex用户数在法律、销售和招聘、以及市场营销领域增长至原来的108倍、41倍和26倍。

当模型成为持续执行任务的基础设施,调用频率和Token消耗也随之增加。模型厂商一方面提升旗舰模型的能力上限,另一方面面对Agent大规模调用的新需求,也必须思考如何降低模型调用的成本和延迟。

因此,模型层已出现分化趋势。 如今,同一家厂商也推出不同档位、不同价格的模型,导致flash模型扎堆的现象。

Google在5月推出Gemini 3.5 Flash,瞄准日常开发和工作场景。7月31日,DeepSeek发布V4 Flash。8月下旬,Qwen3.8-Flash-Next 和 GLM-5.3-Flash接连亮相。

这些模型未必追求在所有benchmark上达到最高,但也不是能力被削减的“阉割版”。 它们是为高频、简单任务专门优化的新档位,且价格更具优势。

以DeepSeek为例,它最近将V4 Flash更新至V4.1 Flash,并宣布在下一代Pro模型上线前,将V4 Pro的API请求路由到V4.1 Flash,并按Flash的价格计费。

过去,用户遇到任务时,第一反应是寻找最强的通用模型,能力越强越好。厂商的主线也是将一款旗舰模型打造得尽可能全能。

但现在,模型厂商开始根据任务的复杂度、调用频率、响应速度和成本等因素重新划分能力,推出不同档位,让不同模型承担不同工作。

这种分化仍在持续。 从使用场景来看,代码、图像、语音等方向早已出现专门优化的模型。办公、游戏等场景也在逐渐出现更贴合自身需求的模型。

毕竟,不同场景的任务结构、上下文以及对速度和成本的要求各不相同,模型因此有了针对具体环节进行取舍的空间。

Jev是分化趋势中的一个极端案例

当其他模型仍在通用框架内调整能力和价格时,Jev干脆将一类能力从通用模型中剥离,单独制成一个模型。

开发者向Jev提供一段当前状态和一组预设问题,它返回的是Choice、Score或Boolean,并附带相应的概率。Jev不解释为何如此选择,程序获取结果后可直接继续执行。

这对Agent至关重要。在Agent中,模型的输出通常直接决定下一步行动。此时,系统需要的可能不是一段完整的自然语言回答,而只是一个明确的信号。

这一设计背后,是Almeida对大型模型训练方式RLHF的反思。他认为,人类反馈会促使模型生成更符合人类偏好的回答,但也容易让模型养成另一种习惯:面对把握不大的问题时,仍倾向于给出流畅、完整、笃定的答案。

Jev试图让模型将不确定性写入输出结果。如果模型判断某件事有八成把握,那么从长期统计来看,它的判断结果应接近八成正确。系统获取这个概率后,可自行设定阈值,把握高的任务自动执行,把握不足的任务转交给人或更强的模型。

不过,让模型实现可靠的自动化决策,是Almeida希望达到的方向,目前Jev尚未做到。

有开发者测试发现,同一个判断,正着问一遍、再反着问一遍,Jev给出的两组概率加起来有时会超过1。一个校准得当的概率系统不应如此。Jev不写自然语言,避免了编造像样答案的风险,但它给出的概率仍可能出错。

调用不同模型的Agent入口更加重要

尽管Jev还存在不少问题,它仍让行业看到了另一种可能性:Agent中的智能也可以被拆解,一项复杂任务不一定由一个通用大模型包办。

例如,需要复杂推理时可调用强模型,而大量简单的判断和筛选则可交给Jev这样更快、更便宜的模型。

Jev的名字也蕴含深意。经济学中有“杰文斯悖论”(Jevons Paradox)的概念,即一种技术变得更高效、更便宜后,使用量反而会增加。那么,当Jev让“判断”这一动作变得更快、更便宜后,Agent就越有可能在执行任务时频繁调用它,从而优化整体任务的效率和成本。

也就是说,任务本身逐渐成为Agent的核心。按任务调用不同模型,Agent执行的效率和性价比可能会更高。

模型之间的关系也因此多了一种可能。过去,模型比拼的是谁更强,一个模型能力提升后,就替换掉上一个。现在,以任务为核心,不同模型可以各自承担自己更擅长的部分,在同一个Agent中协作。

如果这种分工继续发展,一个能根据任务调用多个模型的Agent入口将变得更加重要。

已有Agent产品朝这个方向推进。国内来看,腾讯WorkBuddy已支持在不同主流模型之间切换。WorkBuddy还有Auto模式,系统会根据用户任务的类型、复杂度与上下文特征,自动选择当前最适合的模型进行响应。 用户在不知道该选择何种模型,或面对混合型任务时,可交由系统决定。

海外的Cursor也在进行类似尝试。它在今年8月推出的Cursor Router,会在每个请求交给模型之前,先根据任务类型、复杂度、上下文等信息进行判断,再从多个模型中选择最合适的一个。基本原则是,简单任务交给快速、便宜的模型。困难、长周期的任务则交给前沿模型。

这些产品的思路一致,就是将调度模型这件事交给系统按任务自动完成。用户只需提出任务,至于该派哪个模型上场,交给入口去安排,从而提高Agent使用的效率和降低成本。

长此以往,当模型逐渐走向各司其职,一个能灵活调配它们的Agent入口将越来越重要。

本文来自微信公众号“深流研究所”,作者:萧樱,36氪经授权发布。

更多文章