椰木知AI 日报
← 返回播客
· 时长 4:14

AI 日报 · 2026-09-22:Grok 4.7 落地后,Agent 开始拼“可控执行”

Grok 4.7 已进入开发工具链,Jev Skill 路由与 ffmpeg-skill 展示 Agent 的可控执行路径;Muse 遇到 Amazon 平台墙,Plugin4Shell 则提醒插件供应链与自动更新风险。

收听

节目文稿

木知:今天最值得关注的 AI 新闻是什么? 椰壳:如果只看一个名字,是 Grok 4.7。但把几条消息放在一起,真正有意思的是 Agent 正从“会回答”走向“可控执行”。 木知:先说 Grok 4.7。 椰壳:xAI 发布 Grok 4.7,官方称它在与 4.6 同价同速下有所提升,重点提到长任务自检和 Grok Bot harness。 木知:已经能直接用了? 椰壳:从素材看,它已进入 Cursor、Grok Build 和 xAI API,GitHub Copilot 也在渐进开放。它开始成为可切换、可测试的开发选项。 木知:能直接换成默认写码模型吗? 椰壳:不建议只看发布稿。素材也提到延期和榜单位次争议,应该拿自己的真实仓库跑长任务、多文件修改或修复任务。 木知:第二条主线是 Skill? 椰壳:对。Skill 多起来以后,问题变成 Agent 怎么知道该调用哪个。 木知:Jev 做什么? 椰壳:@dani_avila7 发布 Jev Skill Suggestion for Claude Code。它先把 Skill 列表交给 TypeSafe Jev,由 Jev 分类匹配,再只把命中的 Skill 注入 Claude 上下文。 木知:也就是决策层选 Skill,主 Agent 执行? 椰壳:可以这样理解。但效果是否更快、更省上下文,仍以自己的仓库实测为准。 木知:ffmpeg-skill 又是什么? 椰壳:@DanKornas 把本地 FFmpeg 封装成 Agent Skill。它不让 Agent 直接猜长命令,而是先 probe 媒体,再决定参数、执行,最后检查输出。 木知:固定流程呢? 椰壳:ffprobe → 参数表 → 执行 → 校验输出。这属于作者自述方向,仓库和安装细节待核对。 木知:Muse 今天也很有意思? 椰壳:有两个相反案例。一边,@the_davey 演示 Muse 读取 Announcr.fm 说明、添加 MCP Server、引导登录并发出测试播报。这是作者演示,站点说明可能变化。 木知:另一边是 Amazon? 椰壳:对。媒体报道 Muse 用户访问 Amazon 出现“unauthorized AI agent”。Amazon 称未获授权、没有标识自身并担忧凭据和账户数据;Meta 称密码与支付信息对模型不可见。 木知:我们该站哪一边? 椰壳:不必替双方下结论。Agent 能读网页,不等于平台允许它替用户行动。涉及登录、购买、写入时,ToS、身份、凭据和权限都是边界。 木知:读文档装 MCP 还能试吗? 椰壳:可以测试,但生产环境要给外链写权限和凭据保管设置门禁。 木知:Plugin4Shell 是今天最需要警惕的吗? 椰壳:如果大量使用编码 Agent、插件或 marketplace,至少值得立刻检查。 木知:它是什么问题? 椰壳:Air Security 协调披露称,Claude Code、Codex、Copilot、Gemini CLI 的插件安装存在钉扎 commit 与落盘代码校验不足的问题。Git 引用歧义可能替换代码,结合默认自动更新形成零点击 RCE 风险。 木知:披露日的修复状态呢? 椰壳:快照中,Claude Code 2.1.179 及以上、Codex 0.146.0 及以上已修;Copilot 当时未见补丁,Gemini CLI 为弃用不修。必须强调,以披露日快照为准。 木知:普通开发者能做什么? 椰壳:先做版本审计,再检查自动更新策略,不要把插件生态默认当成无风险依赖。 木知:几条消息连起来,说的是同一件事吗? 椰壳:是。Grok 4.7 代表模型继续往前;Jev 把选 Skill 变成决策层;ffmpeg-skill 让执行前先探测、执行后再校验;Muse 和 Plugin4Shell 则提醒外部平台规则与供应链风险。 木知:Agent 下一阶段不是越自主越好? 椰壳:至少今天更值得关注的是可控执行:谁决策、谁执行、谁校验,哪些权限要人工批准,插件怎么更新。 木知:如果今天只做三件事? 椰壳:用真实项目测试 Grok 4.7;拆开 Skill 路由、执行和校验;检查 Agent/CLI 版本、插件自动更新与外部写权限。 木知:最后一句? 椰壳:Agent 进入生产环境的标志,可能不是完全自己做事,而是每一步都更容易被看见、被限制,也能被验证。