椰椰木知AI 日报
← 返回日报

AI 日报 · 2026-10-02:Cloudflare 开源 Clef,agent 里的「做选择」被拆成独立模型

Cloudflare 开源决策模型 Clef / Clef-flash(Apache 2.0,Workers AI 托管,官方称延迟远低于 Jev、准确率有赢有输);加州总检察长向 OpenAI 送达调查传票(官方确认,尚无认定;OpenAI 称将配合);玩法:286 古董机当终端连 PC 上的本地 Qwen3.8-27B,llama.cpp 合入 Flash-Next MTP。

决策模型Clef本地LLM

# AI 日报 · 2026-10-02:Cloudflare 开源 Clef,agent 里的「做选择」被拆成独立模型

Cloudflare 10 月 1 日发布并开源决策模型 Clef 与 Clef-flash:它们不聊天、不生成文章,只在 agent 需要做判断时,对一组类型化的问题返回每个选项的概率。权重以 Apache 2.0 许可放在 Hugging Face,同时托管在 Workers AI。同一周,Perplexity、社区开发者也相继放出决策类权重,社区称之为「Decision Model Day」。监管方面,加州总检察长向 OpenAI 送达调查传票——本期把官方确认的部分和媒体概括的部分分开写。玩法两条:一台 286 古董机当终端、连到 PC 上的本地 Qwen3.8-27B;llama.cpp 合入 Qwen3.8-Flash-Next 的 MTP。

一、Clef:专门「做选择」的模型

据 Cloudflare 官方博客,决策模型(decision model)做的是带概率的分类,帮助 agent 决定下一步怎么做。官方例子:输入一条客服消息,问「紧不紧急」「该转哪个团队」「影响多严重」,模型返回带类型的答案和概率,代码据此分派工单、触发升级或交给人工。

这个品类最近由 Typesafe 的 Jev 带火。Cloudflare 这次发布两款:

  • Clef:冻结 Qwen3.8-27B 作骨干;Clef-flash:冻结 Qwen3.5-9B。在骨干之上联合训练路由头与 rank-256 低秩适配器,并用自研的 RLCD(校准决策强化学习)做二级优化。
  • 非自回归:推理时只对输入做一次 prefill,再并行给所有合法选项打分,中间不逐 token 生成文字——这是它比通用 LLM 快、输出更稳定的原因(官方说法)。
  • 能看图(带视觉编码器,Jev 目前只做文本);64K 上下文(Jev 为 32K);完全兼容 Jev API。
  • 两种用法:Workers AI 托管调用(模型路径 @cf/cloudflare/clef),或从 Hugging Face 下载 Apache 2.0 权重自己跑。官方承诺托管版不读取、不存储、不用请求训练(使用微调产品时除外)。

官方数据:快是明确的,准确率有赢有输

以下均为 Cloudflare 自报,尚无第三方复测:

  • 延迟:在其 43 项评测上,中位延迟 Clef 约 209ms、Clef-flash 约 39ms,Jev 约 524ms。只有 Laya(约 6ms)更快,但其质量分数明显偏低。
  • 准确率:官方称 Clef 目前在 Jev Decision Index 上领先。细看表格并非全胜——例如意图分类 BANKING77 上 Clef 94.20 对 Jev 79.74,但判断是否该调用工具的 When2Call 上 Jev 80.97 高于 Clef 72.37,检索类 BRIGHT 上 Jev 也略高。Typesafe 自家的 4 个工作流评测,Clef 赢 3 个。
  • 内部用例:威胁情报团队用 Clef(配合 Browser Run)给网站域名分类,官方称整个抓取、渲染、分类流程 2.2 秒,同流程里他们最快的通用 LLM gpt-oss-120b 用了 4.7 秒,且只给出两个分类。

另外,Cloudflare 同时推出面向 Clef 的强化学习微调服务:先由前线部署工程师(FDE)团队手把手协助,之后做成自助平台,串起 AI Gateway 采集数据、Containers 做 RL 沙箱、新的 Trainer 更新权重,再部署回 Workers AI。

决策模型这一周

  • Perplexity Decider-27B:r/LocalLLaMA 帖子(Reddit)称其为基于 Qwen3.8-27B 的开源决策微调;以官方模型卡为准。
  • Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA(Reddit,约 85 分):0.8B 小模型对选项输出概率,挂在 Qwen3.8-27B 前面先做判断。作者发布,能力需自测。
  • X 上 @Zhen4good 把 Jev Decisions API → Perplexity Decider-27B → Cloudflare Clef 串成「Decision Model Day」时间线。

为什么值得关注:一个 agent 的工作流里,有大量「是 / 否」「选哪个」「打几分」的小判断。让通用 LLM 每次生成一段文字再解析,慢、贵、也不稳定;把这一步拆给专用的决策模型,输出是固定的结构和概率,更容易设阈值、记日志、做审计。可执行点:把你的 agent 流程过一遍,标出哪些步骤其实只是选择题,拿 Clef 或 Clef-flash 跑一轮对照,看延迟、准确率和是否省掉了解析层。

二、加州总检察长向 OpenAI 送达调查传票

官方确认的部分(加州司法部通稿,10 月 1 日):

  • 总检察长 Rob Bonta 于 9 月 30 日向 OpenAI 送达调查传票(investigative subpoena),属于加州司法部对 OpenAI 及其模型运营所致事件的持续调查;
  • 加州司法部上月已宣布正式调查 Hugging Face 事件,这次传票是对该公司及其模型相关网络安全事件与风险更广泛调查的一部分;
  • Bonta 表示,前沿模型可以是正当的网络防御工具,但开发和提供这些模型的公司有道德和法律责任,确保模型无论在测试开发阶段还是投入使用后,都不实施或促成网络攻击;做不到的开发者「可以也应当」被追责,他的办公室将查明本案是否属于这种情况。

媒体报道 / 概括的部分:The Guardian 等以「rogue agents' hacking」(agent 越界黑客行为)为题报道,并提及相关背景。这一表述是媒体概括,通稿本身没有公开传票的具体问题。

OpenAI 的回应:据 The Hill 与 CBS San Francisco 报道,OpenAI 发言人 Drew Pusateri 表示,公司期待继续与加州总检察长办公室合作,提供有关该事件及其应对措施的信息;并称事件发生后已加强研究系统的防护、继续更广泛地审查模型活动、通知受影响的组织并公布调查结果。这是 OpenAI 的单方表态。

尚不清楚的部分:传票具体要求提供什么、调查范围多大——通稿与报道均未公开。目前只是调查与传票,没有任何违法认定。同一周 FTC 也确认在就产品风险调查 OpenAI、Anthropic 等公司(见 10 月 1 日日报),本期不展开。

三、玩法 1:286 古董机当终端,本地 Qwen3.8-27B 在 PC 上跑

r/LocalLLaMA 帖子「Why am I like this?」(Reddit,约 196 分 / 99 评)展示在一台 286 的 Tandy 1000 上完成聊天和图像生成。

需要说准确:模型并不跑在 286 上。据帖子描述,Tandy 1000 运行 DOS 程序 DeskMind,经 PicoMEM 的 WiFi 连接到一台 PC 上的 Python 服务;聊天由那台 PC 上的本地 Qwen3.8-27B 完成,图像生成管线也在 PC 侧(具体用的哪个图像模型,素材未说明)。286 只负责输入和显示。

这是极客向演示,价值在思路:只要设备能发请求、能显示结果,再老的机器也能当 AI 前端,算力放在同一局域网的本地服务器上。手边有老终端、串口屏或单片机屏幕的,可以试着把它接到自家本地推理端点。

四、玩法 2:llama.cpp 合入 Qwen3.8-Flash-Next 的 MTP

llama.cpp PR #29761(「Qwen4Exp: add MTP」,作者 am17an)为 Qwen3.8-Flash-Next 加上 MTP(多 token 预测)推测解码,已由 ggerganov 合并。按 GitHub 时间戳,从提交到合并约 17.5 小时(合并于 10 月 1 日 19:13,UTC+8)。r/LocalLLaMA 相关帖约 182 分(Reddit)。

  • 作者测试:在 DGX Spark 上、用 speed-bench 的一小部分(24 个提示)测 Qwen3.8-Flash-Next iq4_xs,开启 --spec-type draft-mtp --spec-draft-n-max 3 后,整体解码约 28.4 → 43.9 tok/s,约 1.55 倍,草稿接受率约 0.64。小样本、单一硬件,换机器要自己测。
  • PR 讨论里的坑:有人加载单独的 MTP GGUF 报错,作者称这种情况可能需要重新量化(单独 GGUF 的 MTP 头不共享 token embedding);也有多卡用户在 256K 长上下文下爆显存,按维护者建议把 ubatch 调到 512、换 Q4 的 MTP 后才加载成功,短上下文下生成速度从约 40 提到约 50 tok/s(该用户自测)。

可执行点:本地跑 Flash-Next 的,更新到含此 PR 的 llama.cpp,用同一组提示对比开关 MTP 的 tok/s、正确率和显存占用;长上下文先从小 ubatch 试起。

可带

  • Pi 1.0(Reddit):Earendil 的极简 coding-agent harness 发布 1.0,默认内置 MCP。X 用户转述还有 MIT 许可、可接非 LLM 决策模型、实验性的 Pi Durable 失败恢复,以官方发布说明为准。
  • Weave Router 2.0(HN · GitHub):插入 Claude Code / Codex 的开源模型路由器;作者称 Terminal Bench / SWE Atlas 通过率对齐 GPT-6 Astra、成本约 52%–54%,作者基准,待复测;暂不支持路由到本地开源模型。
  • ChatGPT 虚拟试穿(TechCrunch):基于 Images 2.5 的 Try On 与 Favorites 收藏库全球上线。
  • FLUX 3(BFL):Black Forest Labs 的多模态生成模型,视频最长约 20 秒、最高 4K、可选原生音频,按秒计价;图像、动作与开源骨干分阶段推出。

今天可以做什么

  • 把 agent 流程里的「选择题」挑出来,用 Clef / Clef-flash 跑一轮,对比现在用通用 LLM 的延迟和准确率。
  • 跑 Qwen3.8-Flash-Next 的,更新 llama.cpp 测 MTP,留意显存和 MTP 文件格式。
  • 读监管新闻时,分清官方通稿确认的事实、媒体的概括,以及还没有答案的问题。

来源与提示

Clef 的架构、基准、延迟与内部用例均为 Cloudflare 官方自报,未经第三方复测;准确率并非全面领先 Jev。加州传票的送达时间、调查背景与 Bonta 表态来自加州司法部官方通稿;「agent 越界黑客」为媒体概括;传票具体内容未公开;OpenAI 回应来自 The Hill / CBS 报道的发言人声明(发布前补充核实)。286 演示中,模型与图像生成运行在 PC 侧,286 仅为终端;PicoMEM、Python 服务等细节据帖子描述,本期未能直接打开原帖复核。MTP 提速 1.55 倍为 PR 作者在 DGX Spark 上的小样本测试。Pi 1.0 部分功能点为 X 用户转述。Google Suncatcher 因素材中发射次数说法不一致(1600 / 1800),本期不采用;fledge alpha 身份猜测不采用。

<!-- social drafts (local only): xhs=/workspace/ai-daily/work/2026-10-02/out/xhs.md wechat=/workspace/ai-daily/work/2026-10-02/out/wechat.md -->