资讯详情

资讯详情

爆火决策模型刚被 Ollama 0.35 收编:91ms 出判断、零 API 成本,本地玩转 Jev 同款

爆火决策模型刚被 Ollama 0.35 收编91ms 出判断、零 API 成本本地玩转 Jev 同款【免费下载链接】Bespoke-Nimble-9B项目地址: https://ai.gitcode.com/hf_mirrors/bespokelabs/Bespoke-Nimble-9B2026 年 9 月 29 日Ollama 0.35 的发布在 AI 工程圈激起不小波澜它不再只是又一个支持更多模型的本地推理器而是首次把 Jev 风格的决策模型正式收编进本地运行时——新增/v1/systemone端点首日即上线三款轻量级决策模型单次决策中位延迟低至 33ms、典型值 91msAPI 成本直接归零。而这场路线切换的主角之一正是 Bespoke Labs 开源的 Nimble 决策模型一个基于 Qwen3.5-9B 的 LoRA 适配器本体只有约 165 MiB。本文将结合社区实测数据与 Bespoke-Nimble-9B 仓库源码回答三个问题Ollama 0.35 到底新增了什么33ms 和 91ms 是怎么测出来、又为什么能这么快以及零 API 成本对 AI 决策工程究竟意味着什么。一、先看背景Jev 为什么能火出圈要理解这次更新的分量得先理解 Jev 引发的范式争论。Jev 由 OpenAI 前研究员创立的 TypeSafe AI 推出定位是System One Model——摒弃生成能力专精于多选项概率化判断。它不写作文、不解释、不编故事只对给定的一组选项输出带置信度的判断。社区基准显示Jev 端到端响应仅 70–500ms相比常规大模型推理速度提升约 193.6 倍输入成本低至每百万 token 0.042 美元输出 token 永久免费。它用强化学习校准决策RLCD来提升概率可信度支持并行判断、LLM 验收与模型路由。这套设计戳中了工程界的痛点大量 AI 决策根本不需要写作文。客服工单进来系统只需要三个答案——这是账单问题还是技术问题要不要升级紧急度多高用前沿大模型回答每次调用要花钱、延迟可能到秒级返回的还是一段自由文本代码还得解析、校验、重试。Jev 及其开源复刻们则把判断本身做成了有类型、可直接编程消费的接口。开源生态跟进极快Laya421M、ModernBERT 编码器、单次前向输出多选项概率分布、Verdict118M、CPU 亚毫秒级、ECE 校准强等 8 个开源复刻项目陆续出现。Nimble 是其中基于 Qwen 路线的一员——它不做编码器改造而是直接微调 Qwen3.5-9B判断准确率达到 90.12%。而 Ollama 0.35 的收编相当于给这条路线补上了最后一公里把决策模型变成任何人都能本地一键运行的软件。二、Ollama 0.35 新增了什么Choice / Noul / Score 三类结构化输出Ollama 0.35 的核心变化是通过新的/v1/systemone端点支持 Jev 风格决策模型底层基于 TypeSafe 的 Jev API 语义。与发 prompt 等生成不同它让你发送一个状态对象 一组命名问题模型在单次请求里返回带类型的答案。首日上线三款模型NimbleBespoke Labs 开源的 9B 决策模型也是这次的主力在 Apple M5 Max 本地平均每次决策 91mstev1Together AI 的 4B 实验模型从 Qwen3.5 微调而来tev1:0.8b0.8B 参数的最小版本面向边缘与极低算力环境。三个模型除了主决策结果还会返回每个选项的概率与置信度——应用层直接读取类型化字段无需解析、无需校验 schema、也不会遇到模型想解释一下导致的边界情况。API 支持三种问题类型恰好对应决策任务的三种基本形态Choice从你定义的条件映射里选一个选项离散分类 / 路由Noul即 Bernoulli 问题对一个是非陈述返回 0 到 1 之间的概率布尔判断Score把状态放到 2 到 10 级的有序评分标准上分级打分。多个问题可以针对同一状态并行评估——社区文章里明确提到问五个问题和问一个问题耗时差不多。这一设计与 Nimble 的架构同源查看 schema_config.json 的训练契约训练数据中三类任务恰好就是 choice8080 条、noul2412 条、score1534 条三种 kind评测注册了 bespoke-eval324 条与 jevbench-eval534 条两套基准。也就是说Ollama 接口的三类问题类型与模型训练时对齐的任务形态是一一对应的不是临时包装。在 inference.py 的参考实现里这种映射看得更清楚字段类型为boolean时标记kindnoul命中score_fields的整数值枚举字段标记kindscore其余为普通 choice。noul结果返回probability_truescore结果返回概率加权期望分数if row.get(kind) score: result[prediction] int(choices[index]) result[expected_score] sum(int(v) * p for v, p in zip(choices, probs.tolist()))三、33ms 与 91ms 是怎么测出来的从源码看不生成、只打分社区传播最广的两个数字是 33ms 与 91ms它们其实来自不同环境91ms典型值Ollama 官方在 Apple M5 Max 上本地运行 Nimble9B单次决策的平均耗时33ms中位数独立测试在 RTX 5060 Ti 上对多个决策模型实测中位延迟区间为 33ms–73ms其中表现最好的模型也是准确率最高的 Nimble中位延迟约 33ms。作为对照TypeSafe 托管版 Jev API 端到端需要 236–276ms已含网络时间。也就是说本地方案对托管 API 有 3–8 倍的往返时间优势——而且还没算上 API 计费。为什么能这么快答案藏在源码的推理路径里。打开 inference.py核心函数candidate_logits揭示了一切def candidate_logits(model, inputs): logits model(input_idsinputs[input_ids], attention_maskinputs[attention_mask], use_cacheFalse, logits_to_keep1).logits[:, -1, :].float() selected logits.gather(1, inputs[candidate_ids]) return selected.masked_fill(~inputs[candidate_mask], -torch.inf)这里有三层关键设计不做自回归解码。logits_to_keep1表示只计算最后一个位置的 logits——模型把整个上下文一次前向传播读完直接得到答案位置的输出分布不需要逐步生成 token。生成式 LLM 的延迟随输出长度线性增长而决策模型的延迟基本只由输入长度决定这是 91ms 级延迟的根本原因。候选 token 打分而非全词表采样。candidate_ids是预先算好的候选答案 token ID在 parallel_schema.py / extended_schema.py 中通过在答案边界追加候选码并校验其确为单个普通 token的方式获得gather只取这些位置的 logits非候选位置用-inf屏蔽。整个推断空间被收窄到选项集合这一个点上。一次 softmax 出全部分布。decision_result中probs scaled_logits.softmax(-1)温度默认 T1.0见 temperature_config.jsontemperature_fitted: false官方特别提示不要沿用旧版 checkpoint 的 2.179 校准值。一次前向即得到所有选项的概率、argmax 预测以及 logits结果直接是类型化 JSON。此外提示词构造也刻意优化了并行性。parallel_schema.py 用__PARALLEL_FIELD_TARGET__占位符渲染整个 chat 模板后 rsplit得到公共前缀start与后缀end每个字段的 prompt 只是start 字段名 end——多个字段共享同一段上下文前缀这对 KV cache 与 prompt cache 极其友好也正是多问题并行评估、耗时几乎不增加的工程基础。每个字段最多支持 255 个选项≤26 个用 A–Z 单字母编码更多时用 AA–JT 这类在词表中确为单 token 的大写码见 serving_schema.py 与 schema_config.json 中的candidate_codes/candidate_token_ids完整码本输入超过 8192 token 时直接拒绝而非截断保证有界判断的契约不被悄悄破坏。四、零 API 成本对 AI 决策工程意味着什么零 API 成本不是一个营销话术而是一笔可以算清的账单价层面Jev 托管 API 收费约每百万输入 token 0.042 美元、输出免费——已经比主流大模型便宜两个数量级但本地跑成本仍是绝对的零业务层面一个每月处理 4 万张客服工单的创业公司用前沿大模型做路由判断按 OpenRouter 基准约 115 美元/月换成本地决策模型是 0 美元。这不是小幅优化而是成本结构从线性增长变成固定成本延迟税层面每一次托管 API 往返都是用户可感知的延迟成本。单次 236ms 的 API 调用叠加到高并发决策链路上意味着排队、超时、重试与降级逻辑本地 33ms 的决策则把判断压到了与正则表达式同一量级的心智模型里。更深一层零成本让决策能力的使用方式发生了质变当单次判断便宜到可以忽略你就不必再省着用 AI。客服工单路由、AI Agent 的模型路由与工具调用安全校验、内容审核的大规模分类打标、意图识别与安全护栏——这些高并发、有边界的判断场景过去只能靠正则或 prompt 分类器将就现在可以直接上带概率的模型化判断且数据完全不出内网隐私与合规团队的压力也随之释放。同时也要诚实划出边界。决策模型不是万能钥匙社区实测与官方文档都指出了它的限制不生成文本它做分类、路由、评分、判断但不会帮你写回复文案。顺的模式是决策模型做判断LLM 写回复的分工只吃文本图片、音频、PDF 不能作为输入状态必须是字符串、字符串数组或键值对算术与日期是弱项数字比较、日期判断、对抗性内容上并不可靠需要靠任务设计规避选项顺序敏感独立基准显示重排选项可能改变答案Jev 翻转率 0–1.9%部分本地模型更易受影响——有界判断的稳定性需要在实际部署中验证。知道边界才知道该把它放在技术栈的哪一层。五、把 Nimble 跑起来的工程姿势最后落到实际开发。从 README.md 与 inference.py 看Nimble 的加载和打分极简下载适配器、装依赖、导入NimbleModel一个score(context, schema)调用即完成判断from inference import NimbleModel model NimbleModel(nimble-model) result model.score( contextThe store accepts returns within 30 days. This item was bought 12 days ago., schema{ eligible: { type: boolean, description: Is this item within the store return window? } }, ) print(result[output]) print(result[fields][eligible][probabilities])返回结构里既有output每个字段的最终预测也有每个字段的完整probabilities逐选项概率与logits——score字段额外带概率加权期望分数boolean字段带probability_true。定义选择类字段用typeenumchoices列表 description可选的choice_descriptions用于给每个选项补充语义说明打分字段用整数值枚举如[0, 1, 2]并放进score_fields参数。值得称道的是这个仓库的工程严谨性schema_config.json 中通过prompt_source_sha256对candidate_schema.py、parallel_schema.py、extended_schema.py逐一哈希锁定serving_config.json 同样校验服务端源码与训练码本的一致性加载时任何 prompt 构造或候选编码的漂移都会直接报错——保证训练时怎么问推理时还怎么问。训练侧还有完整数据审计12026 条训练行、8468 个训练组、5370 个训练家族组件覆盖 contrastive-addition、safety-local、retrieval-classification-local 以及 Banking77、MultiNLI、BoolQ、AG News、DBpedia、TREC 等公开数据集provenance.json明确标注weights_unchanged_from_evaluated_checkpoint: true发布即评测权重杜绝榜单权重和发布权重不一致的行业陋习。结语这次更新发的是信号Ollama 0.35 表面上新增了一个端点、三款模型实际上传递了一个更强的信号AI 技术栈里最有价值的部分可能什么都不生成只告诉你的代码下一步该做什么——毫秒级带一个可置信的概率。过去两年行业追逐的是更大的模型、更长的上下文、更惊艳的生成而决策模型这条支线证明有界判断可以且应该被做成像数据库索引一样的基础设施小模型、简单 API、几乎可忽略的延迟、零边际成本、数据不出内网。当判断从每次都要花钱的奢侈调用变成本地随手可用的系统组件路由、审核、护栏、评分这些工程动作的架构假设都会被重写——这就是 91ms 与零成本背后真正的工程意义。【免费下载链接】Bespoke-Nimble-9B项目地址: https://ai.gitcode.com/hf_mirrors/bespokelabs/Bespoke-Nimble-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →