Jev 之后,中国团队开始深挖 AI 的“直觉层”
9 月 15 日,由前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 推出了 Jev。这款模型不生成任何文字,仅执行判断任务。
两周后,整个行业都在跟进同一方向。OpenAI 在开发者日发布了 Decisions API,Cloudflare 于 10 月 1 日开源了 Clef,亚马逊也推出了 Strands Decider。
国内也没有停滞,上海人工智能实验室开源了多模态决策模型 Intern-Decision。
9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并声称在公开评测中超越了 Jev。
一个新品类在两周内从“首发”演变为“混战”,这种速度在大模型领域同样罕见。
而 StartLux 背后的领导者,是盛大网络联合创始人陈大年。
被 Jev 点燃的“直觉”
要理解这波热潮,首先需要厘清决策模型的具体作用。
TypeSafe 将 Jev 称为“System One 模型”,这一命名源自卡尼曼的《思考,快与慢》。系统一代表人类快速、直觉的思维模式,系统二则负责缓慢思考。过去两年,大模型几乎都聚焦于系统二的提升,追求更长的推理链和更深的思考。
然而,当 Agent 实际运行时,情况有所不同。一个 Agent 任务中,频繁发生的并非深度推理,而是大量琐碎的判断:这张工单应分配给哪个团队,这条指令能否执行,页面上下一步该点击哪个按钮,任务是否已完成。
过去,这些判断要么依赖大模型“顺带”处理,生成一段文字后再解析;要么通过写死规则来应对,但无法覆盖长尾场景。前者既慢又昂贵,后者缺乏灵活性。
Jev 的做法是仅回答带有预设选项的问题,如单选、打分或是否题,直接返回带概率的结构化结果。其定价为每百万输入 token 0.042 美元,输出免费。
可以说,Jev 将“判断”从“生成”中分离出来,打造成了一种廉价、高频的基础设施。
市场反应迅速。Vercel 披露,Jev 上线 24 小时内,其 AI Gateway 上 13% 的付费用户已使用该模型,这是此前任何模型发布时的两倍。TypeSafe 以经济学家杰文斯的名字命名模型,暗指那条著名的悖论:某样东西越便宜,需求反而越大。
不过,Jev 存在一个明显短板。它是闭源托管模型,未公开权重,也无法本地部署,只能通过 TypeSafe 自身的 API 调用。
这个短板恰好成为了后来者的突破口。
中国团队迅速跟进
国内团队也在快速跟进类似 Jev 的模型。
上海人工智能实验室的 Intern-Decision 开源了 0.8B、2B 和 4B 三个版本,专注于多模态能力,能够理解图像和界面后再做决策。团队提供的数据显示,其推理速度比 Jev 快 2 到 3 倍。
像 StartLux 这样的创业公司,则一口气推出了 0.8B 到 27B 五个规格,并配备了量化文件,直接瞄准本地部署。
StartLux 模型分数超过 Jev|图片来源:Github
根据 StartLux 公布的数据,27B 版本在 Decision Index 0.2.1 的 38 项测试中,有 31 项高于 Jev 1.13,综合得分为 63.88 对 57.91。团队还展示了一组国际象棋对弈,36 局中赢了 35 局。
这些数字需要放在适当背景下看待。它们是团队基于公开工具、参照 9 月 28 日榜单快照进行的自测。更重要的是,“第一”在这个赛道的保质期极短。StartLux 发布次日,Cloudflare 就声称自家 Clef 在同一榜单上领先。至于下棋,这并非决策模型的主要应用场景,更像一个吸引注意力的演示。
比起谁暂时领先,更值得关注的是,中国团队几乎一致选择了开源和本地化。
这并非偶然。Jev 闭源且仅能通过云端调用,对数据敏感或对跨境调用有顾虑的国内开发者而言,这本身就是一道障碍。开源权重并能在本地运行,正好填补了 Jev 留下的空白。
还有一个细节值得注意。Cloudflare 的 Clef 基于 Qwen 后训练,亚马逊的 Strands Decider 也以 Qwen 为底座,APUS 的方案同样跑在 Qwen 上。这一轮决策模型热潮中,中国开源基座已成为全球玩家共同使用的“骨架”。
为什么押注“本地”
回到 StartLux 本身。
这家公司今年刚刚成立,CEO 是陈大年,CTO 是郭权玮博士。陈大年的履历对中国互联网从业者来说并不陌生:1998 年编写了上网计费软件 ENCounter,次年与陈天桥共同创办盛大,后来又推出了 WiFi 万能钥匙。
StartLux 的自我定位是“主打本地模型”,让模型能力和数据保留在用户自己的设备上。上一次引起关注,是以 Qwen3.6-27B 为基座后训练的 StartLux-27B,在中国信通院的 MCP 专项测试中得分为 39.25,超过了 284B 参数的 DeepSeek-V4-Flash。需要说明的是,这是一项聚焦工具调用的专项测试,不代表通用能力的全面领先。
在 StartLux 的规划中,“本地 AI”并非一个可下载到电脑的小模型,而是一套完整的个人 AI 系统。27B 模型负责通用能力,决策模型处理高频判断,上层是 Agent 和记忆,底层是量化与推理系统。
从这张图来看,决策模型对本地场景的意义比云端更大。云端算力可以无限堆叠,但个人电脑的显存、内存和功耗有硬性上限。如果每个小判断都要调用 27B 模型,本地 Agent 根本无法运行。根据 StartLux 公布的数据,4B 版本在量化到 Q4 后约 2.71GB,与原始权重的决策一致率仍达 98.3%。
对于一家押注本地的公司来说,决策模型并非追逐热点的品类,而是本地系统能否顺畅运行的关键部件。
这也是 Jev 对 StartLux 的真正意义。准确地说,Jev 并未为 StartLux 指明方向。从时间线看,StartLux 的决策模型立项明显晚于 Jev。Jev 证明的是另一件事:“将智能拆分为不同层级、各司其职”这条路,已获得市场的真金白银投票,而这正是 StartLux 一直在倡导的本地架构逻辑。
那个“3 天”的数字也值得一提。StartLux 将其归功于自身的 Auto Research 体系,让 AI 参与数据构造、训练、评测和失败分析。这套方法是否能在不同模型品类之间反复复用,比任何榜单都更能说明这家公司的成色。
判断层会不会变成“白菜价”
不过,决策模型的护城河有多深,现在下结论还为时过早。
Jev 号称在隐身状态下研究了两年,OpenAI 用两周基于自家小模型做出了 Decisions API,StartLux 用了 3 天,Cloudflare 和亚马逊也都在半个月内跟进。Jev 发布时就有分析人士预判,大厂会很快推出自己的决策模型,Jev 最终要与“前沿版本的自己”打价格战。
一个两周就能被复制的品类,本身很难形成壁垒。
对 StartLux 来说,真正的考验也不在决策模型这一层。郭权玮自己也承认,长任务稳定性、异常恢复、上下文管理和整体体验,比单纯将模型跑起来要困难得多。
按计划,StartLux 首个面向公众的本地智能体验版本有望在今年内推出。
从按时计费的上网工具到 WiFi 万能钥匙,陈大年过去打造的不少产品,都是高频、底层、依赖规模取胜的生意。决策模型同样是一件高频、底层的事情。
问题在于,当“判断”便宜到人人都能实现时,价值最终会落在模型本身,还是落在那些将这些模型组装成产品的人手中?
本文来自微信公众号 “极客公园”(ID:geekpark),作者:桦林舞王,36氪经授权发布。