跳到主内容
米兰娱乐平台

撬开Jev黑箱,对话全球首批复现者:9B小模型跑通79毫秒“快决策”

2026-09-22 · 米兰娱乐平台 · 更新于 2026-09-23

在经济学领域,杰文斯悖论指出:某项资源的使用效率提升、单位成本下降后,其总体消耗量反而可能上升。目前,大模型行业正完美诠释这一规律——模型价格越低、响应速度越快,调用量便呈现爆发式增长。

近期在硅谷引发热潮的新物种Jev,一个与杰文斯悖论同名的“大模型”,正将这一趋势推向新高度。

它拒绝创作诗歌、拒绝探讨人生哲理,甚至不愿生成一句多余的废话。然而,正是这样一个“沉默寡言”的模型,在发布不到48小时内,于X平台上吸引了超过3000万次的热烈关注,并促使2.5万名开发者申请内测;上线大模型托管平台Vercel仅24小时后,近13%的付费团队迅速接入——这一渗透速度,是当年GPT-4的两倍。

天下武功,唯快不破。Jev的核心优势同样在于此:极速且成本极低。作为前OpenAI核心研究员、RLHF技术的共同发明者,Jev创始人Diogo Almeida甚至宣称:“下一个时代并非属于Claude Code这类辅助工具,Jev才是未来!它比通用模型快200倍,便宜400倍,且零幻觉。这将是继RLHF之后的又一重大突破。”

从毫秒级响应的浏览器插件,到高频执行的链上交易决策,再到每秒10次决策、击败人类玩家的《毁灭战士》通关外挂,开发者围绕Jev打造的应用案例呈现井喷态势。

然而,面对这样一个估值一夜飙升至2亿美元、却至今未公开训练方案与底层权重的“黑箱”,业界的好奇与质疑也达到顶峰:它究竟是模型架构的革命,还是被营销包装的“分类器”?

就在昨日上午,国内人工智能企业APUS旗下AI实验室,公开了全球首批针对Jev的独立开源复现成果,并将其封装为即开即用的Agent Skill fast-browser-use。该项目支持纯本地模型离线运行,横跨macOS、Linux、Windows三大桌面与服务器操作系统,甚至无需独立GPU,在普通Mac和PC上也能本地运行。

目前,该项目完整代码已通过MIT协议向社区开放(https://github.com/APUS-AI-Lab/fast-browser-use)。

笔者第一时间联系到该项目负责人——APUS AI首席科学家张旭博士。我们围绕Jev的底层技术逻辑与路线、APUS的复现与改造逻辑、这类快速决策模型的应用潜力,以及Agent未来的“快慢分工”趋势等话题,进行了深入探讨。

准确地说,张旭团队并未获取Jev的模型权重、完整架构和训练方法;而是通过公开资料和实际输入输出反推其工作机制,基于Qwen3.5系列、Google Gemma系列等开源模型还原了Jev最核心的工作流,并在推理速度上实现了对标。

开源当天(9月20日)上午,APUS公布首轮结果:在真实浏览器任务中,维基百科检索约18秒完成,表单填写、站内跳转等更短链任务则在数秒内完成,全程无需调用云端模型;下午采访中,张旭团队将测试迁移至RTX PRO 6000,单次决策时间压缩至79毫秒,与Jev响应时间70~500毫秒成功看齐。

他还透露,其内部自研模型可实现更小9B、4B参数规模复现Jev的性能,并将于近期开源。(截至发稿前,已开源https://huggingface.co/apus-ailab/APUS-OpenJev-v1)

以下为笔者与张旭博士的访谈精要。为便于阅读,本文对原始对话进行了提炼与整合。

拆解Jev的底层逻辑

AI前线:如果抛开官方的概念话术,您能否用更直观的方式解释,Jev与常见大模型有何区别?它本质是什么?

张旭: 理解这个问题的关键在于看清大模型工作的两个基本步骤。第一步是Prefill,即输入处理;第二步是Decode,即自回归生成。

当大模型完成第一步Prefill时,其神经网络内部的“隐状态”实际上已理解了你输入的文本和图像细节。

第二步的Decode,是一个字一个字地生成Token,纯粹是为了“翻译给人看”。

但人类语言的带宽很窄,存在极高的信息损耗。例如,一张包含猫、树枝纹理和复杂光影的图片,无论你用多少文字描述,都无法毫无遗漏地还原给他人。

Jev的核心本质在于:它砍掉了第二步(Decode),只保留第一步。它不再为了迎合人类而逐字生成文本,而是直接在模型理解信息的“隐空间”里计算结果。

AI前线:那它最终输出什么?就是Choice、Score/概率这类东西吗?

张旭:对。普通大模型每生成一个Token,本质上是在十几、二十万词汇的词表中计算全量概率,再选择一个输出。

Jev则是将这个过程极度收敛,变为对有限选项的概率测算。例如,你问“这份提纲完整了吗”,只给“完整”和“不完整”两个选项,它只返回这两个选项的概率得分。

这也是为什么它自称不会出现幻觉。并非它不会判断错误,而是你只给它A、B、C,它不会凭空编出一个D。

但不出幻觉与不出错是两回事。

AI前线:既然只是给出固定选项的概率,业界有人质疑它只是被包装过的“动作分类器”,您怎么看?它究竟新在哪里?

张旭:这么说也没错。但我认为还应看到它背后更大的研究趋势。

例如,一张图片包含非常丰富的信息,无论你用多长的文字描述,都难以还原全部细节。语言本身就会造成信息损失。

因此,当前一个前沿方向是:既然模型内部已有这些信息,我们是否必须先将它转化为人类语言,再用语言继续处理?

Jev可视为这个方向中的一个具体特例。它省去后续的语言生成,直接从模型内部状态完成判断。

AI前线:所以您说的这个更大方向,具体是什么?就是将“理解”和“生成”进一步解耦吗?

张旭:这是其中一个方面。行业里会将更大的一类思路称为隐空间计算。

例如,两个Agent之间通信,它们都不是人,为何一定要将第一个Agent脑海中的信息翻译成人类语言,再让第二个Agent读取?理论上可以直接在模型内部状态之间处理。

模型路由、Agent之间通信、模型内部思考,都可沿此方向进行。Jev只是用这个思路去做了一件具体的事:有限选项的概率判断和决策。

AI前线:作为行业共识,目前头部大厂在这方面的探索进展如何?Jev的做法与他们有何不同?

张旭:是的,例如DeepSeek-v4.1 Flash版本,已尝试将Prefill和Decode的能力解耦。更典型的代表是目前最新的GPT-6(Astra),业界探讨的Loop Transformer机制,其本质是让模型的思维链和思考过程,在“隐空间”内部循环计算,而不再转化为低效的人类文字输出。

相比之下,Jev则是将隐空间计算的成果巧妙地“产品化”了,它表明,将隐空间的中间结果直接拿来使用,已足以颠覆当下的应用形态。

AI前线:Jev最显著的特点是快。除了省去长文本生成,它为何还能快这么多?

张旭:不生成文本是最大原因,因为相当于“只吐第一个Token”,只做判断。但除此之外,还有计算维度的降级。

第二,原来是开放式生成,现在你给它的可能只有几个、几十个候选,计算范围更小。

第三,这些候选之间相互独立,可以更多地并行判断;而传统的自回归生成前后有依赖,每个Token都要等前一个。

我们自己的实现中也做了类似KV Cache广播的处理。因此总结下来就是:少生成、候选范围更小、还能并行。

AI前线:除了速度,它还有其他本质上的性能优势吗?

张旭:其他方面在我们看来,它与大模型没有本质区别。它其实也就是一个大模型,只是只用了一半。

效果好不好,最终取决于模型本身训练得好不好。

如何复现Jev

AI前线:Jev没有开源权重、完整架构和训练方案。在这种情况下,你们所谓的“复现”,严谨来说复现的是什么?

张旭:严谨来说,我们复现的是它的功能。

我阅读了他们所有公开资料,研究了创始人的背景,再自己实际调用Jev,观察它的输入和输出。

可以理解为将其视为一个黑盒。如果我能实现相同类型的输入、相同类型的输出,那么我们认为基本复现出了其公开的功能。

AI前线:那你们在千问上具体做了什么改动?

张旭:原版的Qwen3.5就可以。

模型本身无需改动,主要是在外部工作方式上处理。这次开源的内容,也是从我们公司已有的Agent Harness中抽取一部分,再精简后放出。

AI前线:那是否随便拿一个小模型也能运行?对底座模型能力、参数规模有无要求?

张旭:实际测试后还是有要求。

我看到开源社区有人拿五六亿参数模型复现,确实能运行,“能用两下”,但你会发现它很傻,无法真正实用。

因此我自己从千问的小模型一路往上试。最后发现,9B基本上是最低的可用门槛,再小就很难实用;35B效果会更好。选择9B也是希望普通用户自己的电脑就能运行,无需特别好的设备。此外,我们也在训练自己的模型,很快也会开源,初步看已超过Jev的效果。

AI前线:这次复现有无超出你预期的结果?例如原本以为很难,做完后发现其实没那么复杂?

张旭:没有特别意外。

反而我们之所以能这么快完成,是因为过去在这个方向已有积累,直接将已有的东西拿来使用。

AI前线:所以反过来说,你们这么快就复现出来,是否说明Jev目前公开的内容本身并没有特别高的技术门槛?

张旭:更客观地说,它背后是否还有别的东西我不清楚。

但至少目前拿出来的部分,在我们看来,就是这个研究领域中的一个特例,没有什么特别神秘之处。

“79毫秒”能用在哪

AI前线:你们为何第一时间将复现做成一个Browser Agent?

张旭:我们第一天先观察行业里大家用Jev做什么,发现最多的是操作浏览器。

而且我们希望开源出去的东西是有实际用途的,而非一个技术Demo或玩具,因此先将浏览器这个场景实现。

以前许多Agent操作浏览器,需要让大模型先生成操作代码,再去执行。我们现在是将网页上可交互的元素先列出,例如输入框、链接、上下翻页,再让模型直接做选择:现在应输入、点哪个链接,还是翻页。

后来模型本身已做到毫秒级后,我们统计发现,完整任务中大部分时间反而花在等待网页加载、等待网页刷新。

AI前线:那你们为何长期会向本地模型、CPU、小算力、模型路由这些方向走?这些看似是许多单点技术,背后的逻辑是什么?

张旭:核心还是AI普惠。

我们一直在思考,模型能否无需昂贵GPU,依靠CPU也能有可接受的速度和效果。因为绝大多数普通用户不会在电脑里装5090,更不可能购买H100、B200。

如果AI最终要进入大规模C端产品,全部推理都依赖中心化大算力,本身会是一个限制。因此我们希望将一部分计算分散出去,分配到CPU服务器,甚至分配到用户手机上。

这也是我们做模型解耦、路由、本地推理这些事情背后的共同逻辑:用更高的性价比,让AI真正能够大规模普及。

AI前线:如果不只看浏览器,这种模型还能用在哪里?

张旭:其实能落地的场景很多。

例如,我们常访问的网站上显示大量广告、欺诈信息、杂乱内容,浏览器有了这个能力加持,就可以快速筛选和过滤。

推荐系统也是很典型的场景。A文章用户感兴趣的概率是多少,B是多少,再将概率高的内容推荐出来。

我还看到有人用它批量审阅文档,因为许多判断可并行,所以一次处理上千份文档,速度和成本有优势。

AI前线:现在也有人拿Jev做炒股、交易。它因决策快,是否特别适合这类场景?

张旭:快不代表它炒股水平高。

炒股最终还是看模型本身的智力水平,以及是否针对金融方向做了优化。Jev目前应未专门针对此方向优化。

因此不能因为它能快速做决策,就认为它一定能赚钱。

AI前线:那再长远看,还有什么你觉得值得关注的应用?

张旭:更长期可能会涉及工业自动化、智能家居等领域,因为它们都需要快速行动。

现在已有人拿Jev玩游戏了。

它能玩游戏,实际上就能操控机器人。

Agent走向快慢分工

AI前线:决策变得这么快后,下一个挑战会在哪里?

张旭:一个很明显的问题是智力。

过去为何大模型会生成很长的思维链?因为它要靠这些过程提升数学、编程、推理等复杂能力。

现在你砍掉这部分,它就更依赖模型的“直觉”、第一反应。如果问题本身较复杂,需要多步思考,那么Jev当前的智力水平可能不够。

AI前线:也就是说,它更适合规则清晰、候选明确的任务;若需要真正复杂推理,就会出现准确率问题?

张旭:对。复杂问题本身就可能超出它当前的能力。

AI前线:为何Jev一出来,开发者会如此兴奋?快思考、慢思考这套思想并不新鲜,去年OpenAI、DeepSeek、Qwen都尝试在基座模型里融入这套逻辑。

张旭:对,快思考和慢思考本身不是新东西。

以前许多模型也说自己有快模式、慢模式,但所谓“快”,本质上仍是大模型一个Token一个Token生成,只是思维链短一些。从普通用户体验看,它其实并未真正快到像“本能”。

Jev为何火爆,我觉得一个原因是,它真的快到足够实用了。以前那个“快思考”,其实也不快。

AI前线:但这是否意味着它无法单独完成一个长链条Agent任务,仍需与完整的大模型配合?

张旭:我认为是两个类型互相需要。

例如机器人,若所有操作都让大模型慢慢思考,很难实用化。它一定需要一些非常快的模型去执行动作。

复杂任务规划、逻辑推演可交给慢模型,而高频、原子化、环境交互类动作,则适合交给这种受限决策模型。

AI前线:那快思考和慢思考,最终有无可能重新融进同一个模型?

张旭:完全有可能。

系统一、系统二首先是一种架构设计思想。可以是两个模型,也可以是一个模型承担两个角色。

通用模型厂商以后完全可能将长生成部分屏蔽掉,提供一个快速决策模式。

但分成不同模型后,每个模型可以更专注,也可能效率更高。最终取决于是否有一家公司能将整个生态都吃下来。

AI前线:长远看,Agent和模型到底是什么关系?模型越来越强,会不会最终将外部的Harness都吃掉?

张旭:我认为不会。

可以打个比方:模型是发动机,Harness是汽车的控制系统,Agent是整辆汽车。

发动机可以越来越强,但你不会因为发动机越来越强,就不要轮子、方向盘和控制系统。因此大模型会越来越强,但它本质上仍是Agent中的驱动系统。

声明:本文为AI前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

本文来自微信公众号“AI前线”(ID:ai-front),作者:四月,36氪经授权发布。

更多文章