椰木知AI 日报
← 返回播客
· 时长 6:16

AI 日报 · 2026-09-20:从“会聊天”到“会工作的 AI 工作流”

AI 正从单模型聊天走向多 agent 协作与 workflow 固化,关注 harness、云端开发测试和真实验证方法。

收听

节目文稿

木知:今天 AI 圈有哪些值得关注的新玩法? 椰壳:今天比较集中的一个方向,是 AI 正在从“单个模型聊天”转向“多个 agent 协作完成任务”。很多人开始关注的,不再只是哪个模型回答更聪明,而是怎么把不同模型、工具和流程组织起来。 木知:是不是你经常说的 multi-agent? 椰壳:对。今天有一个值得关注的开源项目线索。@BennyKokMusic 分享了一个跨 Claude、Codex、OpenCode、Pi 的多端 harness,可以在 Mac 或云 VPS 运行。它包含 agent 通信、图片和视频展示、文件附件能力,并且 MCP 可以启动子 agent。 木知:harness 可以理解成 AI 的工作框架吗? 椰壳:可以这么理解。它不是单纯调用模型,而是在模型之外增加一层组织能力。比如不同 agent 负责不同任务,一个 agent 负责分析,一个 agent 负责执行,一个 agent 负责检查。 木知:为什么现在大家开始关注这一层? 椰壳:因为单个模型越来越强之后,新的问题出现了。很多复杂任务不是缺少一个聪明回答,而是需要持续推进,需要记住上下文,需要处理文件,需要调用工具,也需要多个步骤之间衔接。 木知:所以未来可能不是“一个超级 AI”,而是一个 AI 团队? 椰壳:这是目前很多探索方向之一。不过也需要保持冷静。agent 看起来越来越自主,但实际完成复杂任务,仍然依赖工具、权限、环境和人的判断。 木知:说到这个,最近 Reddit 有什么讨论吗? 椰壳:有一个 Reddit r/artificial 的帖子讨论“AI models are not hacking autonomously”。这个讨论提醒大家,不要把模型能力和完整系统能力混为一谈。 木知:什么意思? 椰壳:比如一个模型能够生成代码,不代表它天然拥有目标、权限、服务器访问能力和持续行动能力。真正的自动化系统,需要很多额外组件。 木知:那是不是意味着,人反而更重要? 椰壳:是的。有用户分享,更倾向于在环使用 Claude Code、Codex sessions,而不是完全无人参与的 autonomous agent。很多实际工作里,人负责目标定义、判断和验收,AI 负责扩大执行能力。 木知:除了 multi-agent,还有什么开发玩法? 椰壳:有一个比较有意思的线索。@route20191212 分享称,通过 Cursor Projects 或云端 PC 运行 Android emulator,可以验证自己制作的 app。 木知:这个听起来很酷。 椰壳:是的,但需要强调,目前它属于待复现的实测式发现。也就是说,这是一个值得尝试的方向,但还不能当成已经被广泛验证的稳定方案。 木知:如果这个方向成立,会有什么变化? 椰壳:可能意味着开发者可以更多利用云端环境完成开发、运行和测试。比如 AI 帮你写代码,然后在云端环境里启动测试,再根据结果继续修改。 木知:感觉像一个 AI 开发实验室。 椰壳:可以这样理解。但关键不是让 AI 无限自动运行,而是建立可靠流程。 木知:那普通人现在使用 AI,最值得学的方法是什么? 椰壳:有一个方法我觉得非常值得关注:先亲自做一次,让 AI 记录过程,再固化成 workflow。 木知:为什么不是直接告诉 AI:“帮我自动完成”? 椰壳:因为很多工作里面隐藏了大量经验。比如写一份报告,看起来只是几个步骤,但真正重要的是:为什么选择这些资料,为什么这样组织结构,哪些地方需要人工判断。如果一开始就让 AI 自动化,它可能只学到了表面操作。 木知:所以先让 AI 学习人的过程? 椰壳:对。先由人完成一次,把思考过程、操作步骤、判断标准记录下来,然后再变成可以重复使用的 workflow。 木知:这是不是比研究万能 prompt 更长期? 椰壳:很多人正在往这个方向走。@yevloop 就提出,拥有工作流和分发能力的 wrapper,可能比最聪明的单条 prompt 更有价值。 木知:因为 prompt 只是一次性? 椰壳:对。一个 prompt 解决一次问题,而 workflow 可以不断复用。 木知:那 Claude 相关学习资源最近有什么? 椰壳:@Ziven_Coder 整理了 17 个免费的 Claude、Claude Code、Claude Skills、Claude Design 学习入口。 木知:适合什么人? 椰壳:如果你想学习 AI 编程、AI 工具使用或者设计相关能力,这类整理可以作为资料入口。 木知:有没有产品验证方面的案例? 椰壳:有。@HARNEESKUM4mwe 分享让真实用户使用 dummy data 测试 AI 应收账款 workflow。 木知:为什么不用自己测试? 椰壳:因为开发者容易陷入自己的视角。自己觉得流程合理,不代表用户真的愿意使用。真实用户反馈,可以帮助发现流程里的问题。 木知:所以 AI 产品现在不能只看功能数量? 椰壳:对。AI 产品竞争,不只是模型能力竞争,也是流程设计竞争。一个功能很多但没人使用的系统,价值可能不如一个解决具体问题的小流程。 木知:最近还有其他社区讨论值得关注吗? 椰壳:HN 上有一篇《How to Write with an LLM》,讨论如何使用 LLM 写作。 木知:现在很多人都用 AI 写东西,这个有什么特别? 椰壳:它代表了一种思考:AI 写作并不是简单替代人输出文字,而是如何在人和模型之间建立更好的协作方式。 木知:是不是也有人反对 AI 写作? 椰壳:有。HN 上也有文章提出,几乎不应该使用 AI 写作。这类观点提醒大家,AI 可以帮助整理、修改和扩展,但人的表达、判断和创造仍然重要。 木知:今天总结一下? 椰壳:今天几个方向可以放在一起看。第一,多 agent harness 说明 AI 正在从单模型走向协作系统。第二,Cursor 云端 Android emulator 这类玩法展示了 AI 开发环境的新可能,但目前需要继续验证。第三,最值得实践的方法,是先亲自完成一次任务,让 AI 记录过程,再把它固化成 workflow。 木知:最后给开发者一句建议? 椰壳:不要只寻找一个更强的模型或者一个万能 prompt。真正有价值的能力,是把自己的经验变成 AI 可以重复执行的流程。先做一次,再让 AI 帮你复制。