椰椰木知AI 日报
← 返回日报

AI 日报 · 2026-09-30:Sol 降到约五分之一价,大模型做规划、本地模型写代码怎么分

OpenAI DevDay 发布 GPT-6.1 Sol(官方称近 Astra、约五分之一价)、常驻 agent Dots 与 Pro 500;社区玩法 Sol 规划 + 本地 27B 写代码(作者自称省 77%),配 DeepSeek Harness、GSQ-RCO 量化 GGUF;另有 Anthropic 的 GLM-5.3 研究与白宫自愿协定。

GPT6.1Sol本地LLM模型分工

# AI 日报 · 2026-09-30:Sol 降到约五分之一价,大模型做规划、本地模型写代码怎么分

OpenAI DevDay 把前沿档价格往下拉了一大截:GPT-6.1 Sol 官方称在 agentic coding、电脑操作和专业工作上接近 GPT-6 Astra,标准 token 价格约为 Astra 的五分之一。同一天,它又推出常驻后台的 Dots 和每月 500 美元的 Pro 500。一边是更便宜的前沿模型,一边是更贵的顶配订阅,摆在用户面前的问题变成:哪些活值得花前沿模型的钱,哪些可以交给本地模型?社区已经有人给出一个答案——Sol 只做规划、本地 27B 写代码,作者自称 API 账单降了 77%。本期把 DevDay 三件套、这套分工玩法和可用的本地零件放在一起看,最后附上 Anthropic 关于 GLM-5.3 的研究与白宫自愿协定两条安全 / 政策信号。

一、DevDay:GPT-6.1 Sol,近 Astra、约五分之一价

据 TechCrunch 报道(原始公告见 OpenAI 发布页),OpenAI 在 9 月 29 日 DevDay 上推出 GPT-6.1 Sol,距 GPT-6 Sol 只隔一周。官方口径:

  • 在 agentic coding、computer use、专业工作上接近 GPT-6 Astra,标准输入 / 输出价格约为 Astra 的五分之一;
  • 相比 GPT-6 Sol,事实错误率降幅最大的是低推理强度档(11.4% → 7.7%);在各种设置下与 Astra 的差距保持在 1.9 个百分点以内;
  • 更坦诚地说明自身局限,在标记坏掉的工具、遵守限制、避免未授权的 agent 结果上比 GPT-6 Sol 失败更少;
  • 已上 ChatGPT Work 与 Codex(Plus / Pro / Business / Enterprise / Edu),普通 Chat 暂未开放。

具体价格方面,X · @oikon48 转述为每百万 token 输入 2 美元、输出 10 美元、缓存输入 0.10 美元,并称 API 可用。这是 X 用户转述,本期未能直接核对 OpenAI 价目页,请以官方为准。HN 讨论(约 770 分)

以上跑分与错误率都是 OpenAI 自报。GPT-6.1 Astra 仍处于取消状态(见 9 月 29 日日报),本期不展开。

二、Dots 与 Pro 500:OpenAI 同时在卖「更多大模型」

Dots:据 TechCrunch 报道(原始公告见 OpenAI),Dots 是常驻后台、自己追着目标跑的个人 agent,带自己的云电脑,可连接数千个应用;通过 Slack / Teams 对话,短信「即将支持」。TechCrunch 称它由 GPT-6 Astra 驱动,面向合格市场的 Pro 与 Business Premium 推出,Enterprise / Edu / Healthcare 需管理员开启。X 上「连续跑 24 小时、连 4000+ 应用」的说法为用户转述,本期不作为事实采用。HN

Pro 500 与 Ultrafast:据 The Verge,新增每月 500 美元的 Pro 500,给最高用量,并可用 Ultrafast 模式在 ChatGPT Work 与 Codex 里获得更快的 GPT-6 Astra 响应。同时重新开放 200 美元的 Pro,但新订户用量上限下调;老 Pro 用户的保留期,二手报道称到 10 月下旬。精确额度以 OpenAI 帮助中心 为准。HN

放在一起看:OpenAI 同一天给了两条路——要么多付钱,让最强模型常驻、更快、用量更大;要么用降价后的 Sol,把能下放的工作交出去。前者适合「时间比钱贵」的场景,后者是今天的重点。

三、玩法主线:Sol 当规划师,本地 27B 当执行者

r/ChatGPT 帖子(Reddit,约 20 分 / 10 评)标题写道:只让 GPT-6.1 Sol 做 planner,代码交给本地 27B 模型写,API 账单降了 77%。

先说清楚:77% 是作者自述,帖子热度不高,未经独立复核;我们也看不到作者的任务类型、本地模型具体是哪个、返工和人工修补的成本。它更像一个值得复现的思路,而不是结论。

思路本身的逻辑是成立的:

  • 规划(拆任务、定接口、写验收标准)需要判断力,但输出短、调用次数少——值得用前沿模型;
  • 执行(按计划写代码、改文件、补测试)输出长、来回多,token 的大头在这里——交给本地模型,边际成本主要是电费和显卡折旧;
  • 升级规则决定省下来的钱会不会被返工吃掉:测试不过、同一步连续失败、涉及安全或架构决策时,把任务交回前沿模型。

一个可执行的起步方式:挑 10 个你真实做过的任务,分别用「全程前沿模型」和「Sol 规划 + 本地执行」各跑一遍,记录三样东西——API 账单、测试通过率、人工返工时间。只看账单,很容易得出过于乐观的结论。

四、本地这一侧:三件可以直接拿来的零件

DeepSeek Harness:给本地 coder 一个编排壳

r/LocalLLaMA 热帖(Reddit,约 175 分 / 52 评)称 DeepSeek Harness 应用已放出,是面向 agentic coding / 工作流执行的可运行 harness。在上面的分工里,它可以充当「执行层」的壳:接收计划、调用本地模型、跑命令和测试。帖子信息有限,是否为官方出品、支持哪些模型与后端,以应用内说明为准;建议先跑通一条端到端任务,再和现有 Claude Code / Codex 流程对照。

GSQ-RCO GGUF:显存吃紧时的激进量化

r/LocalLLaMA 发布帖(Reddit,约 92 分 / 68 评)放出 GSQ-RCO 版 Qwen3.8-Flash-Next GGUF,另附一个剪掉约 50% 专家的 Coder 构建,约 1.89 bpw,面向低显存本地推理。量化到这个程度,质量损失因任务而异;按帖内档位拉下来后,先用自己的代码任务比速度和测试通过率,再决定要不要用剪枝版当执行者。

16GB 卡跑 27B:两份社区配置

  • r/LocalLLaMA 指南(Reddit,约 36 分):在 16GB Radeon RX 7800 XT 上跑 Qwen 3.8 27B Q4,开到约 100K 上下文。
  • X · @murasametech:两张 RTX 5060 Ti 16GB 跑 Qwen3.8-27B Q3_K_M,GGUF 约 12.48 GiB,llama.cpp 按 1:1 分层。
  • 单卡装不下时,可参考 r/LocalLLaMA 关于 vLLM RAM offloading 的经验帖,代价是延迟。

这些都是社区实测,吞吐与驱动、内核版本强相关,需要本机复测。长上下文对执行层很重要——本地 coder 要能一次看到计划和相关文件。

五、安全与政策:两条值得记住的信号

Anthropic:GLM-5.3 的网络能力与护栏缺口

Anthropic 研究文(9 月 29 日)称,智谱 / Z.ai 的开源权重模型 GLM-5.3 展现出接近 Claude Mythos Preview 的端到端漏洞利用开发能力(如 ExploitBench 50/410,对比 Mythos Preview 56/410),但发布时缺乏有效的防滥用保护;在其测试中,几类常见手段绕过防护的比例为 64%–100%,同样手段对带防护的 Claude 未能成功。文中提到,NIST CAISI 此前称 GLM-5.3 是迄今网络能力最强的开源权重模型,约落后美国前沿 4 个月。HN

需要注意:这是 Anthropic 一方的研究与测试,而 Anthropic 本身是商业竞争方;结论需要更多独立评估,本期不视为定论,也不转述任何利用细节。对跑本地模型的人,现实含义是:开源权重的安全边界更多落在部署者自己身上。

白宫:自愿《超级智能》协定

据 PBS / AP,白宫与多家 AI / 科技公司负责人午宴后,宣布自愿性质的「White House Accord on Super Intelligence」,内容包括内部 / 外部审查与自我监管,同时拒绝硬性限制。这是自愿、非约束性的承诺,不是立法。同日白宫还推出 AI 政府信息门户 America.gov(CNN),据 CNBC 引述官员称技术栈包含 Gemini 与 Grok,路线图包括护照、福利等办事流程上线。

另一种声音:Mistral CEO Arthur Mensch 对 CNBC 表示,美国的 AI 安全辩论在掩盖部分竞争对手的「疏忽」(negligence),同时强调企业需要能约束 agent 的系统和监控,并称 Mistral 无意放缓。

可带

  • TIRx Harness(MLC 博客):让 coding agent 写 GPU kernel 的开放编译器 harness,带远程基准服务器,保证计时可比。官方报告在 Blackwell 上各族几何平均加速约 1.33×–6.84×。
  • RRSI(项目页):Google Cloud AI Research 等开源,冻结权重、在编辑预算与泄漏检查等正则下让 agent 改自己的 harness;报告留出集约 +3.4 分、策略 token 少约 30%–36%。研究结果,待复现。
  • SFTMill(Reddit):用 OpenAI 兼容端点做 off-policy 蒸馏,把行为目标变成数据集——想让本地执行者学会前沿模型的某种写法,可以关注。
  • Radeon 核显提速(Reddit):帖子标题称 Linux 7.4 可让 Radeon iGPU 的 AI / LLM 性能提升 18%–23%,社区转述,以自测为准。

今天可以做什么

  • 挑 10 个真实任务,对比「全程前沿模型」与「Sol 规划 + 本地执行」,同时记账单、测试通过率和返工时间。
  • 先写好升级规则:什么情况下本地执行者把任务交回前沿模型。
  • 激进量化和剪枝版先在自己的任务上测,再决定是否进入执行层;本地 agent 的权限与防护要自己配。

来源与提示

Sol 的能力、错误率与「约五分之一价」为 OpenAI 官方口径(经 TechCrunch 报道);每百万 token 具体价格为 X 用户转述,未直接核对官方价目。Dots 的「24 小时 / 4000+ 应用」为 X 转述,未采用。Pro 200 新订户额度具体倍数、老用户保留期的确切日期未经一手核实,本期仅写「下调」与「据二手报道至 10 月下旬」。「Sol 规划 + 本地 27B 省 77%」为 Reddit 作者自述,未独立复核。DeepSeek Harness、GSQ-RCO、16GB 配置均为社区帖,需自测。GLM-5.3 为 Anthropic 研究与自测,非定论。白宫协定为自愿承诺,非立法。

<!-- social drafts (local only): xhs=/workspace/ai-daily/work/2026-09-30/out/xhs.md wechat=/workspace/ai-daily/work/2026-09-30/out/wechat.md -->