CLM路线图与生态展望:多模态支持、更大规模实验,以及如何接入你的Agent
发布时间:2026/10/10 12:01:04 锦皓数字建站

CLM路线图与生态展望多模态支持、更大规模实验以及如何接入你的Agent【免费下载链接】CLM项目地址: https://gitcode.com/gh_mirrors/clm2/CLMCLMContrastive Language Models对比式语言模型是一款基于对比学习的System One 决策模型它把当前状态与候选动作的向量做对齐打分毫秒级完成决策。本文梳理官方路线图的三大方向——多模态支持、更大规模的扩展实验、数据配方扩展并手把手讲清如何把 CLM 接入你自己的 Agent以及它的验证器verifier能力为何值得关注。30 秒认识 CLM为什么它这么快先讲清楚 CLM 的定位后面的路线图才看得懂它不是聊天模型而是决策引擎。训练目标是 InfoNCE 对比损失把状态拉近到真正被执行的那个动作同时推离所有其他动作。部署时CLM 只需要给候选动作打一个分数softmax 就是答案分布。状态和动作解耦因此又快又便宜。每个编码器都是冻结的 Qwen3-8B 骨干 2000 万参数可训练投影头见 src/clm/heads.py推理时新文本只需算一次嵌入缓存命中的候选动作只需一次点积。成绩如何在计算机使用、游戏、工具调用任务上CLM-8B 与 TypeSafe 的 Jev 打平延迟最多低9×经过轻量微调后作为 best-of-N 验证器在 Terminal-Bench 2.1 达到87.6%、DeepSWE 达到81.6%双双创下 SOTA。路线图一更大规模实验——验证能力还能扩多大官方路线图的第一条README.md就是Scaling experiments更大的骨干网络以及验证性能能持续扩展到多远。CLM 最有意思的发现是验证任务也有扩展定律测试 InfoNCE 损失随训练算力、数据量、投影头大小、编码器大小按幂律下降且扩大编码器带来的收益最强。在固定算力预算下最优投影头大小几乎与训练 token 数线性增长——大约每 310 个 token 配 1 个参数。这意味着数据翻倍头就该变大一圈而不是白烧算力想提升验证精度优先换更大的编码器骨干。这条路线直接指向更大规模实验更大的骨干 更多的数据预算验证性能还会继续涨。对使用者来说这也意味着现在的 CLM-8B 只是起点。顺带一提仓库已内置完整微调链路训练脚本 train/finetune.py、统一 best-of-N 评测 evaluation/bon_eval.py、微调指南 docs/FINETUNING.md。你不需要等官方放出更大模型也可以先用小数据验证扩展趋势。路线图二多模态支持——让模型看懂状态路线图第二条Vision and multimodal support——为机器人与计算机使用任务引入图像、视频及其他模态。为什么这条路线是顺理成章的而不是推倒重来架构上天然留了口子。CLM 的状态编码器state encoder和动作编码器action encoder是相互独立的两个头。今天状态编码器是纯文本的 Qwen3-8B换成视觉-语言编码器后截图、视频帧就能作为状态进入同一个对比打分框架下游 API 一行不用改。训练配方可以平移到图像。预训练 → 困难负样本中间训练 → 智能体轨迹后训练三阶段数据配方约 6000 万 QA 对 3000 万合成困难负样本 100 万智能体轨迹同样可以扩展到视觉问答与操作轨迹数据。场景是现成的。计算机使用Computer Use与机器人任务里状态本来就是屏幕和相机画面。T-Rex 示例examples/t_rex/README.md现在用的是文字描述的游戏状态未来最自然的形态就是直接喂游戏截图。路线图三扩展数据配方——把状态-动作对齐做到更深路线图第三条Scaling the data recipe——更多预训练、更多困难负样本挖掘hard-negative mining、更多智能体后训练。几个数字能说明这套配方的讲究阶段数据作用预训练~6000 万 Nemotron QA 对学习宽泛的语义表征中间训练~3000 万合成困难负样本学会区分很像但不对的动作后训练~100 万智能体轨迹40% QA 回放对齐真实 Agent 决策不遗忘通用能力回放replay是关键技巧只用智能体数据训练难题 top-1 精度会从 69% 掉到 56.2%加入回放后只从 69% 微降到 68.5%。数据配方的扩展本质就是继续加深这三层的厚度。如何把 CLM 接入你的 Agent3 步上手CLM 的 HTTP API 与 TypeSafe 兼容也就是说现有 agent 框架往往只需换个 base URL。三步走第 1 步起服务pip install contrastive-lm # GPU 上起 Qwen3-8B 嵌入编码器参考 serve_qwen3_8b.sh再起 CLM API clm-serve # 默认监听 :8700首次运行自动下载 75MB 参考头第 2 步对状态提出类型化问题system_one一次请求可同时回答Noul是/否、Choice多选一、Score量表打分三类问题返回完整的概率分布——客户端封装在 src/clm/client.pyfrom clm import CLMClient, Choice client CLMClient() # 读 CLM_BASE_URL默认 http://127.0.0.1:8700 r client.system_one( stateCustomer: my invoice was charged twice and nobody answers the phone!, questions{department: Choice( instructionsWhich team should handle this?, criteria{billing: Charges, invoices, refunds, technical: Bugs and outages})}, ) print(r.answers[department].choice) # billing第 3 步用rank给你的候选方案排序system_one的底层原语是给候选动作打分。你的 Agent 采样出 N 个候选答案best-of-N、N 个工具调用或 N 条轨迹丢给POST /v1/rank或进程内的 Engine.rank取概率最高的即可——这正是它作为验证器的标准用法。想先肉眼看看效果clm-serve自带 Web Playgroundsrc/clm/static/左侧写状态、右侧看答案分布每个请求还自动给出可复制的 JSON / curl / Python 代码没有 GPU 也能用 tools/playground_mock.py 跑起来。一个现成的接入范例是T-Rex 实时对战examples/t_rex/ 用同一个未改动的 CLM 头实时玩 Chrome 恐龙游戏与 Jev 走完全相同的 TypeSafe 请求格式。5 局 60 秒全部存活、0 次死亡模型侧 p50 延迟仅2.6msexamples/t_rex/results/clm_realtime.json——这就是System One该有的速度。生态资源清单 资源路径说明主文档 / API 参考README.md安装、快速上手、API 全字段说明路线图原文README.md官方三大方向微调指南docs/FINETUNING.md用自有数据微调投影头推理引擎src/clm/engine.py进程内answer/rank不依赖 HTTPPython 客户端src/clm/client.pyCLMClient 问题/答案类型向量缓存src/clm/cache.py预留式向量缓存命中即跳过编码器T-Rex 实时示例examples/t_rex/README.mdCLM vs Jev 实时对战完整复盘无 GPU Playgroundtools/playground_mock.py假编码器纯前端体验常见问题 FAQQCLM 和 ChatGPT 这类模型有什么区别CLM 是 System One快思考模型不做自回归生成只对一个给定状态下的候选集打分排序单次决策毫秒级大模型更像 System Two慢思考两者在 Agent 里通常是慢模型出方案、CLM 快验证的组合。Q一定要 GPU 吗完整服务需要 GPU 承载 Qwen3-8B 编码器但投影头本身可跑 CPU且 Playground 有 tools/playground_mock.py 纯 CPU 演示入门体验无门槛。Q多模态能力什么时候能用官方 Roadmap 已把图像、视频等模态用于机器人和计算机使用列为明确方向架构上编码器解耦也已铺好路。建议关注仓库更新届时你只需替换状态编码器现有 Agent 接入代码基本不变。写在最后CLM 的路线图逻辑非常清晰先把验证这件小事做到极致快和准再沿规模、模态、数据三个维度放大。而对社区最友好的地方在于——它现在就可以用一个 75MB 的头文件、一个兼容 TypeSafe 的 API、一套跑通微调与评测的脚本。如果你的 Agent 正在为 best-of-N 挑选、工具路由或动作打分发愁不妨今天就把它接进来试试。【免费下载链接】CLM项目地址: https://gitcode.com/gh_mirrors/clm2/CLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。