小孩舞锤
发布于 2026年9月2日
这两天真是被 AI 开发流程坑得够呛。
一开始其实最笨的办法反而最稳:我让 Claude Code 在本地改网站代码,改完总结;再让 Codex 审查;然后我把 Codex 的意见复制给 Claude Code。中间全靠我人工传话,效率确实低,但有一个巨大好处:我就是那个阀门。
哪条意见值得改,哪条是废话,哪条会把范围带偏,至少都要先经过我。
靠这个土办法,网站反而慢慢清理得比较干净,到了可以继续往云端开发的程度。
当两个 AI 开始自动闭环
然后我就犯了一个很自然的错误:既然 Claude Code 和 Codex 都这么能干,为什么还需要我在中间复制来复制去?
于是我配置了 Codex 自动 review,让 Claude Code 直接基于云端 GitHub 开发:Claude 改代码,自动生成 PR,Codex 自动 review,再根据 review 继续改。
听起来非常先进。
实际效果是一坨屎。
差不多是真实情况
两个 AI 开始自己跑闭环:改一轮,review 一轮;review 又发现新问题,再改;改完又产生新的 review。每一条单独看都说得头头是道,什么 robustness、edge case、architecture、regression、consistency,结果就是范围越来越大,代码越来越面目全非。
先把 Claude Code 五小时额度烧光,又额外烧了二十欧。
晚上我只好重新回本地,让 Codex 配合 Claude Code 拨乱反正。结果两个又开始聊,又开始审,又开始改,一轮接一轮,说的全是我已经懒得看的技术黑话。
一个最简单的问题,让我彻底破防
最后我实在忍不住,只问了一个最简单的问题:
这一轮改完,到底能不能实现我要的目标?
答案居然是:
现在还在收敛文档,等文档收敛以后再开始编码。
我彻底怒了。
搞了一整天,烧掉一堆额度、token 和钱,两个 AI 忙得热火朝天,最后告诉我:代码还没开始干,先要收敛文档。
问题不是 AI 不聪明,而是抓不住重点
这才发现问题根本不是 AI 不够聪明,而是没有目标约束的 AI 抓不住重点。
它们特别擅长发现问题,也特别擅长证明这些问题“值得处理”。而只要 reviewer 提出一个听起来像风险的问题,另一个 AI 就会觉得自己有义务响应;一响应,又产生新的代码状态;新的代码状态又可以被重新 review;于是下一轮新的问题又出现。
这东西没有天然停止条件。
今天彻底重来:四条规则
一、二八原则
不是追求理论上的完美,而是先用 20% 的工作拿到 80% 的真实结果。剩下那 20% 的边角问题,除非真的挡住目标,否则一律别碰。
二、北极星文档定死
所有工作只有一个判断标准:
这一步有没有让我更接近最终目标?
不能明确缩短目标距离的,不做。
三、AI 无权自己定义新任务
发现一个“可以优化”的地方,不代表产生了新的工作义务。相关性和优先级只能跟北极星文档比出来。
四、review 只能审已经存在的要求有没有被违反
可以找 bug,可以找 regression,可以找明确没有实现的既定要求。
但是不能:
- “顺便建议……”
- “未来可以考虑……”
- “为了更加健壮……”
- “最好再增加……”
这种东西全部禁止。
Review 应该增加确定性,而不是制造新义务
Review 原本应该是减熵工具:我让你帮我降低“这份代码到底行不行”的不确定性。
结果这次自动review 干的是反过来的事:以评审的名义,制造偏离目标的不确定性,然后逼着另一个 AI 逐个处理。
把这些规则定死以后,今天整个开发终于重新上了正轨。
真正的目标其实很简单
事情突然变简单了:
我要的是让云端 AI 能操作网站内容。
那就看它能不能完成这一条真实链路:
创建草稿 → 上传图片 → 保存 → 读取 → 修改 → 再保存。
缺什么补什么。
不是先重构全世界,不是先把所有文档收敛到完美,也不是 reviewer 发现什么就处理什么。
最大的教训:AI 太会干
这两天最大的教训就是:
AI 开发最大的风险不是它不会干,而是它太会干。
不给它明确停止条件,它可以永远给自己找到下一件“正确的事”。
至于为什么现在很多 AI 工具这么喜欢不停 review、不停发现问题、不停追加任务——到底是 AI 天生有工程洁癖,还是产品设计上就特别适合烧 token,我现在已经懒得分辨了。
反正结果是一样的:
没有北极星、没有范围边界、没有停止条件的自动 AI 闭环,本质上就是一个高效率的增熵机器。