AI 日报 · 2026-09-23:别急着换更大模型,先把 Harness 与 MCP 跑稳
Harness、MCP 上下文与可验证修复把同一模型跑稳;Opus 5.5 与 GPT-6 Sol/Luna 同日开价。另有 Muse 热修与数学宣称治理讨论。
收听
节目文稿
木知:今天最值得关注的 AI 新闻是什么? 椰壳:如果只看名字,是 Claude Opus 5.5 和 GPT-6 的 Sol、Luna。但把玩法放在一起,真正有意思的是:同一模型换 harness、补 MCP 上下文、做可验证修复,比换更大模型更急。 木知:先说价格牌桌。 椰壳:Anthropic 发布 Opus 5.5,称它是 Claude 5.5 家族首款,多数工作对标 Fable 5.1 级,典型负载比 Opus 5 约便宜四成。 木知:OpenAI 呢? 椰壳:同日推出 Sol 和 Luna。Sol 偏编码和复杂工作,Luna 偏高吞吐文书;官方宣称相对 GPT-5.6 同档,API 大约半价,还强调更长的 agent 任务。 木知:能直接换默认写码模型吗? 椰壳:不建议只看价签。实际单价看 API 计价页,效果拿自己的真实仓库跑长任务再定。 木知:那今天的主线不是模型? 椰壳:对。主线是 Harness、MCP 上下文、可验证修复——把现有模型跑稳。 木知:Harness Engineering 是什么? 椰壳:有人推 walkinglabs 的 awesome-harness-engineering。它把上下文、记忆、评测、护栏、运行时、可观测、编排串成工程清单。 木知:核心主张呢? 椰壳:Agent 能力不等于模型能力。同一模型换运行环境,可靠性可以像换了物种。 木知:我能立刻做什么? 椰壳:先别急着换更大模型。给现有 coding agent 补清单:上下文怎么路由、工具怎么屏蔽、可观测和回归怎么落。仓库可点开复核,效果自己测。 木知:neuromcp 呢? 椰壳:一条 npx,给 Claude、Cursor、Ollama 装本地长期记忆。本地 embedding、知识图谱、无遥测。本地优先、不想从零搭向量库的人可以先试。版本以仓库说明为准,属作者推广,待复核。 木知:MCP 连不上怎么办? 椰壳:有人写了 Inspector 排错手册。先分清是「连不上」还是「tools 有问题」。推荐顺序:协议握手,再列出工具,再调用工具。Server 挂了先走这三步,再改业务代码。 木知:Genie One 是什么? 椰壳:Databricks 官宣 Genie One 的 MCP 服务全面可用。受治理的业务问答、查询结果和引用,能接到 Claude、Cursor 这些客户端。 木知:一句话总结? 椰壳:别再造又一个 Agent,把业务上下文喂给现有 Agent。有数仓或语义层的团队,优先接上下文。 木知:Claude Code 今天也有玩法? 椰壳:有人展示可验证修复流水线:拿报告、读代码、定位、写回归,真实终端前后对比,再审 diff、端到端验证。默认禁止无验证合并,比只让模型吐补丁稳。 木知:Muse 又出什么事了? 椰壳:安全研究员披露,本地进程能改未文档化的听写端点,劫持 Muse;Meta 已热修。另有报道称产品负责人承认 Muse 重度借鉴 OpenClaw,但是自研实现。桌面 Agent 的本地攻击面值得重视。 木知:OpenAI 数学结果呢?别说已解决。 椰壳:对,千万别说已解决。媒体报道有九人无偿顾问组,会就公开发布的 AI 数学结果提供建议。Scientific American 则质疑 Navier–Stokes 相关宣称,是不是落在错误或非物理有趣的问题表述上。今天进入的是对外宣称的治理讨论,不是已证实突破。 木知:本地玩家还有什么信号? 椰壳:有人用 Ornith 和 Qwen,在八 G 和三十二 G 显存上坚持本地真开发;还有人修 MiMo 在 vLLM 上空响应,并点出隐藏两千零四十八 token 输出帽。教训是:先查配置,再怪模型。 木知:几条消息连起来说什么? 椰壳:价格战在动,但更可执行的是:换 harness、喂 MCP 上下文、修完要验证。模型只是牌桌价签。 木知:如果今天只做三件事? 椰壳:第一,给现有 agent 列 harness 清单。第二,MCP 挂了走 Inspector 三步;有业务语义就试「喂上下文」。第三,修复模板强制前后对比和回归,新模型用真实仓库再换默认。 木知:最后一句? 椰壳:别急着换更大模型。先让同一模型在可控环境里跑稳、看得见、验得过。