# 能工智人的传习录 > 知行合一,以 AI 炼器 · 能工智人的实践笔记 This is a bilingual blog (Chinese & English) about AI practice, engineering methodology, and cognitive upgrade by Alex Wang. Este blog bilingüe (chino e inglés) trata sobre la práctica de la IA, metodología de ingeniería y mejora cognitiva. AIの実践、エンジニアリング手法、認知の向上に関するバイリンガルブログ(中国語・英語)です。 중국어와 영어로 된 블로그로, AI 실천, 엔지니어링 방법론, 인지 향상에 대해 다룹니다. Dieser zweisprachige Blog (Chinesisch/Englisch) behandelt KI-Praxis, Engineering-Methodik und kognitive Weiterentwicklung. Ce blog bilingue (chinois/anglais) porte sur la pratique de l'IA, la méthodologie d'ingénierie et l'amélioration cognitive. ## 文章 - [技能文档自动化:四块骨架,AI 随心搭](https://blog.chuanxilu.net/posts/2026/08/ai-path-l1-l2-week3-day14/): Day 14 配套练习:角色文档的四块骨架,把验收标准写进提示词 - [OpenCode 免费额度实测:一天 450~766 次,不是传言说的 200](https://blog.chuanxilu.net/posts/2026/08/opencode-zen-go-misconceptions/): 网上关于 OpenCode 免费模型与订阅的传言,逐条拿数据对账:同一把 key 如何区分 Zen 与 Go、免费版额度的实测边界、oc 的 ds4f 是否缩水、Go 订阅额度怎么算。 - [DeepSeek 涨价,不只是因为 GPU 更贵](https://blog.chuanxilu.net/posts/2026/08/deepseek-price-increase-beyond-gpu/): 2026 年 8 月 6 日 DeepSeek 发布 API 涨价预告。本文拆解涨价背后同时成立的多层动机:成本转嫁之外,还有用户筛选、预期管理、免费营销、价值定价切换与开源生态的定价约束,并列出方案公布前可验证的信号。 - [Day 13 练习:把绘本生成工作流构建成一套技能包](https://blog.chuanxilu.net/posts/2026/08/ai-path-l1-l2-week3-day13/): AI 之路 L1→L2 Day 13 配套练习:用 picture-book-pipeline 这个真实项目,演示怎么把一条工作流构建成技能包。六轮对话:定目标、讲工作流、确认节点与验收、要方案、确认后实现、测试。每一步对应 day8 到 … - [你的 AI 工具箱——无状态 API 脚本和 AI Agent 怎么配合](https://blog.chuanxilu.net/posts/2026/08/ai-path-l1-l2-week3-day12/): AI 之路 L1→L2 Day 12:无状态 API 脚本和 AI Agent 怎么配合。用 Dolch PP 级儿童绘本的批量制作过程拆解完整流水线,讲清楚分工、中间产物和验收。 - [自由职业者的 VibeCooking #1:从最简单的热身开始](https://blog.chuanxilu.net/posts/2026/07/vibecooking-001/): 系列第一篇。长期点外卖之后决定自己做饭的门槛不在厨房,在心理。从最简单的两个菜开始热身。 - [Day 11:输出质量检查,AI 给你的东西怎么确定做对了](https://blog.chuanxilu.net/posts/2026/07/ai-path-l1-l2-week3-day11/): AI 之路 L1→L2 Day 11:GCO 本身是描述框架,换个方向就是验收清单。三种验证方法都不用你写代码,帮你判断 AI 给的东西到底对不对。 - [任务描述练习:从模糊到清晰](https://blog.chuanxilu.net/posts/2026/07/ai-path-l1-l2-week3-day10/): AI 之路 L1→L2 Day 10:同一个需求,模糊描述和清晰描述,AI 输出能差多远?三个练习帮你建立任务描述直觉。 - [1754个测试全绿,为什么"神探"一出手就揪出6个刺客?](https://blog.chuanxilu.net/posts/2026/07/testing-coverage-truth-code-review-found-6-bugs/): 1754个测试全绿也别迷信!从 6 个被 Code Review 揪出的 Bug 聊聊测试覆盖率的真相。这不是'测试没用'的故事,是'测试和审查彼此补了对方盲区'的故事。 - [Codex CLI 冷启动:从安装到跑通第一条指令](https://blog.chuanxilu.net/posts/2026/07/ai-path-codex-cli-setup/): AI 之路番外篇:GPT-5.6 发布后,Codex 的新装法——ChatGPT 桌面版自带 Codex 模式,CLI 也仍在更新。 - [从 Warp 到 Kitty:一个输入法卡顿引发的迁移](https://blog.chuanxilu.net/posts/2026/07/from-warp-to-kitty/): 在 Warp + OpenCode 下中文输入法几乎没法用,换到 Kitty 后问题消失了。顺便聊几个 GPU 终端的性能对比。 - [同一个系统,两门语言:Aristotle v1.6 架构决策的五个约束](https://blog.chuanxilu.net/posts/2026/07/aristotle-v16-cross-language-design/): Watchdog 在 TypeScript 里做同步拦截,Intervention 在 Python 里做策略决策,中间用一个 subprocess bridge 连接。这不是架构师画出来的,是五类约束逼出来的——运行环境、已有资产、零新基 … - [OpenCode 冷启动:五分钟用上免费的 DeepSeek V4 Flash](https://blog.chuanxilu.net/posts/2026/07/ai-path-opencode-zen-setup/): AI 之路番外篇:OpenCode 安装、注册 Zen 账号、配置 API Key、选择免费 DeepSeek V4 Flash 模型,完整冷启动流程。 - [从'事后反思'到'实时拦截':Aristotle v1.6.0 的 Watchdog-Intervention Bridge](https://blog.chuanxilu.net/posts/2026/07/aristotle-v16-watchdog-intervention-bridge/): 前 5 篇都在解决"犯错之后怎么记住"。但有些错误没有"之后":文件正在被写坏、commit 正在被污染。反思跟不上损坏的速度。v1.6 引入 Watchdog-Intervention Bridge,不再等事后,在违规发生的瞬间拦截。 - [Intel Mac 上选一个中英文语音输入工具:purr、typeflux、openquack、freeflow 横向对比](https://blog.chuanxilu.net/posts/2026/07/macos-voice-input-tools-comparison/): 一台 Intel MacBook Pro(MacBookPro16,2),需要支持中文和英文的语音输入。GitHub 上四个项目——purr、typeflux、openquack、freeflow——各有取舍。本文从实际硬件出发做一次横向对 … - [Day 9:API 缓存原理,选 provider 时别只看单价](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week2-day9/): L1→L2 第二周 Day 9 番外:理解 API 缓存的工作原理,学会从缓存命中率、价格等角度评估 API provider。选对工具比选便宜的更重要。 - [Day 8:自主执行型 AI,不写代码也能自动化](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week2-day8/): L1→L2 第二周 Day 8:认识自主执行型 AI(Claude Code / OpenCode / Codex),学会描述任务让 AI 自己干活,用整理下载文件夹做一次完整实操。 - [协议遵守的半衰期(续):创可贴能撑多久](https://blog.chuanxilu.net/posts/2026/06/half-life-of-protocol-compliance-3/): SELF-MONITORING 补丁发布后,确认请求降了 94%,状态块完整率涨了 5 倍。但 60% 的状态块仍然残缺。创可贴能撑多久? - [协议遵守的半衰期(下):深层根因](https://blog.chuanxilu.net/posts/2026/06/half-life-of-protocol-compliance-2/): 为什么协议遵守会有半衰期?从 softmax 注意力稀释、RoPE 位置衰减、EOS 偏好到 transformer 无状态架构,逐层挖到 LLM 不会自治循环的算法根因。 - [kdatasrc-helper:让 AI Agent 直接查金融数据的技能](https://blog.chuanxilu.net/posts/2026/06/kdatasrc-helper-financial-data-skill/): kimi CLI 的 datasource plugin 能查行情、宏观数据、企业工商、学术论文,但在 AI agent 工作流里直接调用很别扭。kdatasrc-helper 做了一层封装:单条查询、批量并行、自动解析、市场感知合并。本文 … - [协议遵守的半衰期(上):Agent 为什么不会自己转](https://blog.chuanxilu.net/posts/2026/06/half-life-of-protocol-compliance-1/): AI Agent 不会自己循环。每次推一下转一圈,你不推它就停下来问"要不要继续"。近 20 小时 161 次确认请求的真实数据,挖出协议遵守的半衰期。 - [Day 7 练习:给脚本加上错误处理](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week2-day7/): L1→L2 第二周 Day 7 练习:给批量处理脚本加上超时重试、限流等待、异常日志,让脚本在真实网络环境下不再轻易中断。 - [Day 6 练习:批量处理实战——选一个场景跑通](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week2-day6/): L1→L2 第二周 Day 6 练习:选一个真实场景(翻译、摘要或改写),跑通完整的批量处理流程。 - [Day 5 练习:让脚本读懂更多格式的文件](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week2-day5/): L1→L2 第二周配套练习 Day 5:扩展 Part 2 的脚本,让它能读取 PDF、Word、CSV 等多种格式文件,不再只限于 .md 和 .txt。 - [AI 之路进阶升级指南(二):从一次调用到批量处理——让程序替你干 100 件事](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week1-day4/): AI 之路进阶系列第二篇:学会用 Python 读取文件、调用 API、保存结果,再用循环批量处理整个文件夹,写一个能自动总结 100 篇文档的完整脚本。 - [Day 3 练习:API 参数实验](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week1-day3/): L1→L2 第一周配套练习 Day 3:动手实验 temperature 和 max_tokens 参数,观察 AI 输出的变化,建立对参数的直觉。 - [omo vs oms:Fallback 链深度解析](https://blog.chuanxilu.net/posts/2026/06/opencode-fallback-chains/): oh-my-openagent(omo)和 oh-my-opencode-slim(oms)的 fallback 机制完全不同:omo 是五层管线逐层降级,oms 是启动选模型 + 运行时 abort 重试。本文从源码出发,拆解两套系统的架 … - [Day 2 练习:用聚合平台跑通同一个请求](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week1-day2/): L1→L2 第一周配套练习 Day 2:注册聚合平台,修改两个参数让昨天的代码对接新地址,对比聚合平台和官方直连的区别。 - [当你的 AI 编程工具需要三套配置](https://blog.chuanxilu.net/posts/2026/06/opencode-triple-config-switch/): 从实际痛点出发,设计 OpenCode 的三套并行配置方案——omo 完整版、oms 精简版、纯净模式。通过环境变量切换,让每个场景用最合适的工具。包含完整的文件结构、fallback 链设计、启动脚本和踩坑记录。 - [今日停更一天](https://blog.chuanxilu.net/posts/2026/06/daily-pause-2026-06-04/): 休息一天,明天继续。 - [Day 1 练习:跑通你的第一段 API 代码](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week1-day1/): L1→L2 第一周配套练习 Day 1:动手跑通 Part 1 里的第一段代码,附带常见错误排查。 - [AI 设计的实验,你得自己审](https://blog.chuanxilu.net/posts/2026/06/experiment-design-review/): 双盲实验成功了,但审查设计时发现 rubric 偏向被测变量、场景覆盖不足。两个设计缺陷都是审出来的,不是跑出来的。 - [AI 之路进阶升级指南(一):API 初体验——第一次用代码调用 AI](https://blog.chuanxilu.net/posts/2026/06/ai-path-l1-l2-week1/): AI 之路进阶系列第一篇:API 是什么、和聊天窗口有什么不同、怎么注册账号(DeepSeek/OpenRouter/Claude)、Python 环境搭建、第一段代码跑通,以及 token、temperature 等核心参数的直觉理解。 - [实验设计没毛病,LLM 为什么还是翻车了](https://blog.chuanxilu.net/posts/2026/05/execution-context-design/): 双盲实验设计得再理想,不约束每个子 agent 的上下文边界,LLM 仍然会在垃圾输入上认真打分、在没授权的时候自己做汇总。我用两轮真实实验数据说明:workflow 设计和上下文构造是同一枚硬币的两面。 - [AI 之路初阶升级指南(五):毕业考核与下一步](https://blog.chuanxilu.net/posts/2026/05/ai-path-l0-l1-graduation/): AI 之路系列最终篇:L1 达成清单帮你验收 4 周学习成果,L1→L2 双路径预告(API 构建工具 / 自主执行型 AI),带你从"使用 AI"走向"让 AI 替你做事"。 - [如何用双盲实验验证 skill 改动的有效性](https://blog.chuanxilu.net/posts/2026/05/double-blind-experiment-ai-prompt-validation/): AI skill 的 A/B 测试不是给用户看两个方案测转化率,是让 AI agent 用两个 skill 分别产出结果,再用另一个 AI agent 盲评。我用真实实验数据说明为什么需要双盲,以及如何避免五种失效模式。 - [我的 Prompt 库长什么样:一个真实模板](https://blog.chuanxilu.net/posts/2026/05/ai-prompt-library-template/): 不知道怎么组织 Prompt 库?这是一个完整的目录结构和三个真实示例,你可以直接复制使用。 - [今日实践:整理你的前 5 条 Prompt](https://blog.chuanxilu.net/posts/2026/05/ai-practice-build-prompt-library/): 系列配套实践:从你近期的 AI 对话里挑出 5 条验证过有效的 Prompt,按模板记录入库。启动你的 Prompt 库,从 0 到 5 是最难的一步。 - [AI 之路初阶升级指南(四):建立个人体系](https://blog.chuanxilu.net/posts/2026/05/ai-path-l0-l1-week4/): AI 之路系列第四篇:构建你的 Prompt 库,按场景选对工具(国际/中国双方案),用分层策略做知识管理——不是所有 AI 输出都值得保存。 - [维度实验:30多年前的奇书能搞定审查维度?](https://blog.chuanxilu.net/posts/2026/05/review-dimension-experiments/): 代码审查维度从 8 加到 11,设计审查从 11 加到 14,已知问题的发现率都从 1/6 升到 6/6。灵感来自 36 年前的公理化设计理论。但不是维度越多越好——加了数学公式反而让效果变差。关键是做对照实验,用已知问题做参照。 - [角色扮演实战:让 AI 当你的魔鬼代言人](https://blog.chuanxilu.net/posts/2026/05/ai-devils-advocate-role-play/): 追问是自己挖假设,角色扮演是让 AI 帮你挖。用一个 Prompt 让 AI 扮演严厉的反对者,专挑方案里的漏洞——比自我审查快十倍,比问朋友方便十倍。 - [策略基因:借遗传算法思路精简审查 prompt](https://blog.chuanxilu.net/posts/2026/05/signal-purity-less-is-more/): 审查 prompt 从 317 行砍到 135 行,审查质量反升 29%。删掉的不是流程步骤,是模型自己能推导出来的冗余内容。留下的才是策略基因——不可替代的约束、反面例子和语气锁。 - [追问进阶:用 3 个问题暴露 AI 回答中的隐含假设](https://blog.chuanxilu.net/posts/2026/05/ai-follow-up-hidden-assumptions/): 追问不只是让 AI 说更多,还能暴露回答背后的默认前提。用三个问题检查隐含假设、发现遗漏问题、寻找反例条件,在接受建议前先做一次安全检查。 - [长对话翻车实录:3 次跑偏的教训](https://blog.chuanxilu.net/posts/2026/05/ai-3-long-conversation-fails/): AI 对话到 10-15 轮容易开始跑偏,但跑偏的方式不只一种。3 次真实翻车——讨论思路方向串了、数据分析引用出错、写方案需求穿越——每次都讲清楚发生了什么、为什么、怎么避免。 - [级联检索,借信息检索领域 15 年前的方法治审查 agent 的病](https://blog.chuanxilu.net/posts/2026/05/dual-pass-review-recall-precision-tradeoff/): 设计审查的 agent 既要找得全又要找得准,一个 agent 难以两全。借鉴信息检索领域 15 年前的级联检索思路,拆成两个 agent——一个只管找全,一个只管找准。设计方案的问题更早被发现,开发阶段返工的风险降低了。 - [今日实践:一次 15 轮长对话实验](https://blog.chuanxilu.net/posts/2026/05/ai-practice-15-turn-conversation/): 系列配套实践:选一个多步骤任务,和 AI 对话至少 15 轮。感受长对话中的跑偏,练习进度总结和开新对话,亲手建立上下文管理的肌肉记忆。 - [看不见的空白层](https://blog.chuanxilu.net/posts/2026/05/tdd-pipeline-phase7-invisible-gap/): 每个 bug 都追到底了,但没人看 bug 之间的共同模式。不是升级追问工具,是加一层系统性扫描——它的发现不止于多拦几个 bug,而是驱动架构演进的证据起点。 - [AI 之路初阶升级指南(三):把 AI 变成你的协作伙伴](https://blog.chuanxilu.net/posts/2026/05/ai-path-l0-l1-week3/): AI 之路系列第三篇:追问迭代是多轮对话中最被低估的技巧,上下文管理帮你防止 AI 跑偏,角色扮演让同一个问题得到完全不同深度的回答。 - [以尺度尺,用方法改进方法](https://blog.chuanxilu.net/posts/2026/05/tdd-pipeline-v07-refinement-experiment/): 你造了一把尺子,尺子量出"冗余有害",然后你用这把尺子裁掉了尺子本身的冗余。把 AI 工具里的操作步骤删掉,只保留原则和反面例子,模型自己推导出了被删掉的步骤。 - [格式约束速查:6 种让 AI 输出直接可用的 Prompt 模板](https://blog.chuanxilu.net/posts/2026/05/ai-tip-format-constraints/): 每次拿到 AI 的回答都要重新排版?6 种常用格式约束,每种给一句现成 Prompt 模板,直接复制粘贴到你的提问里。 - [失之东隅,收之桑榆的实验](https://blog.chuanxilu.net/posts/2026/05/tdd-pipeline-v08-failed-experiment-discovery/): 精炼 TDD Pipeline 预发布测试阶段的 bug 诊断能力,预设目标没达到。但对比精炼版在哪些维度好、哪些维度差,发现诊断单个缺陷之外还缺一层系统性扫描。 - [什么时候该让 AI「一步步思考」?三个信号](https://blog.chuanxilu.net/posts/2026/05/ai-tip-when-to-use-cot/): Chain-of-Thought 能让 AI 的回答质量飞跃,但不是每次都该用。三个信号帮你判断:什么时候加「请一步步推理」有用,什么时候反而浪费时间。 - [5 个真实场景的 RBGO 改写:模糊提问 vs 精确提问](https://blog.chuanxilu.net/posts/2026/05/ai-5-rbgo-examples/): RBGO 框架听起来简单,真到自己写容易卡住。5 个日常场景,每个都有模糊版和改写版的完整对比——写邮件、做分析、学概念、定计划、审查优化。直接抄,直接用。 - [升级落地——新模板与三个可迁移建议](https://blog.chuanxilu.net/posts/2026/05/why-articulation-upgrade-and-takeaways/): 基于 A/B 实验结果升级 Why Articulation 模板:去掉显式三问,改为先自由思考再自检补充,保留强制语气和纯反面例子。提炼出三条可迁移到其他 prompt 工程场景的建议。 - [今日实践:用 RBGO 重写你的第一个问题](https://blog.chuanxilu.net/posts/2026/05/ai-practice-rbgo-rewrite/): 系列配套实践:把你今天问 AI 的第一个问题,用 RBGO 框架重写一遍。亲手感受同样的需求,加上角色、背景、目标和输出要求后,回答质量的飞跃。 - [AI 之路初阶升级指南(二):从模糊提问到精确指令](https://blog.chuanxilu.net/posts/2026/05/ai-path-l0-l1-week2/): AI 之路系列第二篇:掌握 RBGO 提问框架(角色-背景-目标-输出),学会 Chain-of-Thought 思维链技巧,用格式约束让 AI 输出直接可用。 - [4 变量 A/B 实验——正面示例为什么有害](https://blog.chuanxilu.net/posts/2026/05/ab-test-positive-examples-harm/): 为什么给 AI 看正面示例反而降低输出质量?一次 4 变量 A/B 实验,测了 Why Articulation 的结构、语气、位置和示例类型,发现正面示例有害——和 Anthropic 的对齐研究结论一致。 - [选 AI,看场景不看排名](https://blog.chuanxilu.net/posts/2026/05/ai-tip-which-ai-to-use/): ChatGPT、Claude、Gemini……试了一圈不知道选谁?一个场景对号入座框架,帮你找到最趁手的 AI。 - [从 Anthropic 的对齐研究到一个 Prompt 设计思路](https://blog.chuanxilu.net/posts/2026/05/anthropic-alignment-to-prompt-design/): Anthropic 的对齐研究发现"教 why 比教 what 更有效"——这个来自安全训练的洞察,同样适用于日常 prompt 设计。本文拆解研究中的四组实验,提炼出三个可迁移的教训。 - [AI 的「桌面」和「文件柜」](https://blog.chuanxilu.net/posts/2026/05/ai-tip-working-vs-long-term-memory/): 跟 AI 聊了半天它就忘了?换个对话框又得从头解释?理解 AI 的两种记忆——桌面和文件柜——从此告别无效重复。 - [别再把 AI 当搜索引擎了:3 个认知转变](https://blog.chuanxilu.net/posts/2026/05/ai-3-cognitive-shifts/): 你是不是打开 ChatGPT,打一句关键词,拿到答案就走?这种用法没错,但浪费了 AI 90% 的能力。通过 3 个真实场景的转变,帮你把上一篇的认知转变成可落地的结果。 - [今日实践:问 AI 同一个问题 3 遍](https://blog.chuanxilu.net/posts/2026/05/ai-practice-same-question-3-times/): 系列配套实践:拿同一个问题问 AI 三遍,对比三次回答的差异。亲手感受 LLM 的概率性生成机制,告别'把 AI 当搜索引擎'的误区。 - [AI 之路初阶升级指南(一):理解你手里的工具](https://blog.chuanxilu.net/posts/2026/05/ai-path-l0-l1-week1/): AI 之路系列第一篇:LLM 不是搜索引擎,它不'知道'答案而是在'生成'答案。理解工作记忆与长期记忆的区别,认识主流平台的能力特长,为后续 3 周的练习打好认知基础。 - [AI 之路:从初触者到原住民](https://blog.chuanxilu.net/posts/2026/05/ai-toolchain-evolution-path/): 一份从 L0 到 L4 的 AI 能力进化地图——不是教你用某个工具,而是帮你理解思维方式在每个阶段发生的根本转变。包含交互式 HTML 页面,可展开查看每个等级的详细能力清单、推荐工具和升级跃迁条件。 - [rebase 一敲,文档灰飞烟灭——用 git worktree 拯救设计文档](https://blog.chuanxilu.net/posts/2026/05/design-doc-management-lessons-from-three-projects/): AI 辅助开发产生大量设计文档,它们被 .gitignore 忽略、被 git rebase 静默删除、被 git reflog 永远无法恢复。本文介绍一种基于 git worktree 的轻量方案,用独立的本地分支保护设计文档,并以多个项 … - [测试全绿,系统不能用:18 个 bug 的六种死法](https://blog.chuanxilu.net/posts/2026/05/six-bug-patterns-and-integration-gaps/): Aristotle v1.1 发布前发现了 18 个 bug,单元测试只拦住了 4 个。剩下的都在集成层。对它们做 root cause analysis 之后,我归纳出六种 AI 辅助开发中特有的 bug 模式——不是因为问题变难了,是因 … - [OMO vs SLIM:一次省钱切换的实测与反思](https://blog.chuanxilu.net/posts/2026/05/omo-vs-omo-slim-token-comparison/): 从 OMO 切换到 SLIM,号称更省 token。实测数据后发现:总平均持平,但拆开任务类型看,差异大到足以推翻一切简单结论。 - [追问的最后一道防线:独立确认与协议的自反性](https://blog.chuanxilu.net/posts/2026/05/inquiry-protocol-design-3/): 追问协议的最后一道防线:独立确认者用可证伪性检验找反例,对抗 AI 的浅层锚定。以及追问协议的来路——从 18 个 bug 的实践到 v0.4.1 的升级,和未来自反性的计划。 - [给 AI 套上质量缰绳:追问协议的七个条件](https://blog.chuanxilu.net/posts/2026/05/inquiry-protocol-design-2/): 追问协议的终止条件设计:T1-T3 是地板(保证 AI 走得够深),HC1-HC4 是护栏(防止追问失控)。T2 的预防性反事实检验是最关键的洞察。 - [AI 用不好 5-Why:浅尝辄止、单线追踪与确认偏差](https://blog.chuanxilu.net/posts/2026/05/inquiry-protocol-design-1/): 5-Why 交给 AI 为什么用不好?不是方法论过时了,是 AI 的思考质量天然不足——停得太早、只追一条线、只找支持证据。一个四轮归因全部失败的真实案例。 - [修不完的 bug 与逃不出的循环:AI 辅助根因诊断实战](https://blog.chuanxilu.net/posts/2026/05/ai-bug-root-cause-diagnosis/): 修了 #13 回头发现老 bug 又回来了——AI 给的修复方案把已修的 bug 又引进来了。这不是一篇「我用 AI 修了一个 bug」的轶事。是一次 15+ bug 上线攻坚的完整复盘,包含四轮归因、回归陷阱、以及 TDD 如何被痛苦逼出 … - [AI 辅助 TDD 全流程:从需求到代码的完整防线](https://blog.chuanxilu.net/posts/2026/04/ai-tdd-full-pipeline-from-requirements-to-code/): 系列第 6 篇。把需求层、设计层、测试层、审核层、程序正义层串成一条完整管线。每个阶段有 checklist,结尾讨论这套方法的适用边界——严格流程的边际成本随项目复杂度下降,其必要性随 AI 参与度上升而增加。 - [程序正义入协议:让 AI 审核的每一步都经得起检验](https://blog.chuanxilu.net/posts/2026/04/adversarial-review-critical-thinking-ai-quality/): Ralph Loop v0.3 把程序正义编码进审核协议——结构化审查、批判性审视、争议问题协议,让每一步审核决策都有证据、有记录、有规则约束。灵感来自 150 年前诞生的罗伯特议事规则。 - [Ralph Loop:AI 的错误不是随机的,是收敛的](https://blog.chuanxilu.net/posts/2026/04/ralph-loop-ai-errors-converge/): 第三篇留下了一个问题:AI 写的文档里的事实性声明,一个人无法逐条核实。这篇文章讲 Ralph Loop——一个多轮审核机制,如何让独立的 AI subagent 审查每个阶段的交付物。它的退出条件借鉴了数学里的收敛概念:一轮干净不代表真干 … - [PRD → 技术方案:AI 时代文档不是负担,是护栏](https://blog.chuanxilu.net/posts/2026/04/prd-to-tech-spec-ai-design-guardrails/): 第二次重构 Aristotle 时,需求用 GEAR 协议写清楚了,代码结构也拆分了。但装完发现异步后台根本没生效——agent 还是在主 session 里被拉起。问题不在需求层,在技术方案层。这篇文章讲 PRD 和技术方案各自该写什么, … - [为什么 AI 辅助 Aristotle 开发必须从 GEAR 协议开始:需求层的消歧实践](https://blog.chuanxilu.net/posts/2026/04/why-aristotle-vibe-development-needs-gear-protocol/): Aristotle 第一版的需求只有一句话,结果反思任务直接在主 session 里跑了起来,371 行上下文被污染。这篇文章从这次翻车出发,聊聊 AI 辅助开发中需求缺失为什么会被放大成系统性偏差,以及怎么用结构化的方法堵住漏洞。 - [先写测试文档,再写测试代码:AI 开发的需求锚定](https://blog.chuanxilu.net/posts/2026/04/test-doc-before-test-code-reverse-anchoring/): 在 AI 辅助开发中,测试不仅是验证手段,更是最精确的需求语言。这篇文章从我的失败经历出发,讨论从测试场景识别到测试开发文档的完整链路,以及为什么这套方法在 AI 编码中比在传统开发中更重要。 - [上下文腐烂:AI编程中一个容易被忽视的问题](https://blog.chuanxilu.net/posts/2026/04/managing-context-length-in-ai-coding-sessions/): 群里有朋友抱怨 GPT-5.4 表现还不如豆包,问问题常常不读题就瞎回复。追问之后发现大概率是上下文腐烂了——喂了太多文档,对话轮次太长,模型已经"看不清"当前的任务。这引出了一个被忽视的问题:在 vibe coding 或 writing … - [回顾与反思:Aristotle 项目中的七种人机协作模式](https://blog.chuanxilu.net/posts/2026/04/seven-human-ai-collaboration-patterns-in-aristotle/): 回顾 Aristotle 项目从初版设计到 GEAR 协议的完整开发过程,提炼出七种人机协作模式——从'用户给哲学、AI 填细节'到'反思系统反思设计者自身的错误'。随着 AI 能力增强,人类的判断力不是变得不重要了,而是变得更加关键。 - [一份 Markdown 的三次生命:从静态规则到 Git 版本管理的 MCP Server](https://blog.chuanxilu.net/posts/2026/04/from-markdown-to-mcp-server-gear-protocol/): Aristotle 的反思规则最初写在一份 Markdown 文件里,追加、遗忘、无法回滚。当规则积累到几十条,我意识到这份文件已经不够用了——于是踏上了一条从 append-only 到 Git-backed MCP Server 的设计 … - [从四道伤疤到一套铠甲:Aristotle 改造中的驾驭工程实践](https://blog.chuanxilu.net/posts/2026/04/from-scars-to-armor-harness-engineering-practice/): 初版 Aristotle 看起来顺利,实际使用却暴露了四个架构级问题。修复它们的过程,恰好验证了第三篇提出的信任分层模型和驾驭工程框架——从上下文隔离到信息流控制到职责分离,每一道约束背后都是一个信任判断。 - [信任边界:同一个想法在开放系统和受限系统上的实现实验](https://blog.chuanxilu.net/posts/2026/04/a-trust-boundary-design-experiment/): 同一个反思机制落在不同平台上,实现复杂度差了一个数量级——但复杂度本身引出了一个更值得谈的问题:我们应该在什么时候信任 AI 的判断,又在什么时候需要插手? - [claude-code-reflect:同样的元认知,落在不同的土壤](https://blog.chuanxilu.net/posts/2026/04/claude-code-reflect-different-soil/): 同一套反思机制落在不同平台基座上,落地姿态和路径截然不同——从插件安装到权限暗坑到 API 并发,记录 Claude Code 上的真实开发过程。 - [Aristotle:让 AI 学会从错误中反思](https://blog.chuanxilu.net/posts/2026/04/aristotle-ai-reflection/): 给 AI 编程助手装上反思能力——当模型犯错时,即时触发根因分析,将纠正经验转化为持久规则。 - [Hello World · 能工智人的传习录开篇](https://blog.chuanxilu.net/posts/2026/04/hello-world-%E8%83%BD%E5%B7%A5%E6%99%BA%E4%BA%BA%E7%9A%84%E4%BC%A0%E4%B9%A0%E5%BD%95%E5%BC%80%E7%AF%87/): 能工智人的传习录开篇文章,记录建站初衷与未来方向。 ## 系列 - [AI 之路进阶升级指南](https://blog.chuanxilu.net/series/ai-%E4%B9%8B%E8%B7%AF%E8%BF%9B%E9%98%B6%E5%8D%87%E7%BA%A7%E6%8C%87%E5%8D%97/): Day 14 配套练习:角色文档的四块骨架,把验收标准写进提示词 - [自由职业者的 VibeCooking](https://blog.chuanxilu.net/series/%E8%87%AA%E7%94%B1%E8%81%8C%E4%B8%9A%E8%80%85%E7%9A%84-vibecooking/): 系列第一篇。长期点外卖之后决定自己做饭的门槛不在厨房,在心理。从最简单的两个菜开始热身。 - [让 AI 学会反思](https://blog.chuanxilu.net/series/%E8%AE%A9-ai-%E5%AD%A6%E4%BC%9A%E5%8F%8D%E6%80%9D/): 1754个测试全绿也别迷信!从 6 个被 Code Review 揪出的 Bug 聊聊测试覆盖率的真相。这不是'测试没用'的故事,是'测试和审查彼此补了对方盲区'的故事。 - [协议遵守的半衰期](https://blog.chuanxilu.net/series/%E5%8D%8F%E8%AE%AE%E9%81%B5%E5%AE%88%E7%9A%84%E5%8D%8A%E8%A1%B0%E6%9C%9F/): SELF-MONITORING 补丁发布后,确认请求降了 94%,状态块完整率涨了 5 倍。但 60% 的状态块仍然残缺。创可贴能撑多久? - [opencode-triple-config](https://blog.chuanxilu.net/series/opencode-triple-config/): oh-my-openagent(omo)和 oh-my-opencode-slim(oms)的 fallback 机制完全不同:omo 是五层管线逐层降级,oms 是启动选模型 + 运行时 abort … - [AI Agent 实验方法论](https://blog.chuanxilu.net/series/ai-agent-%E5%AE%9E%E9%AA%8C%E6%96%B9%E6%B3%95%E8%AE%BA/): 双盲实验成功了,但审查设计时发现 rubric 偏向被测变量、场景覆盖不足。两个设计缺陷都是审出来的,不是跑出来的。 - [AI 之路初阶升级指南](https://blog.chuanxilu.net/series/ai-%E4%B9%8B%E8%B7%AF%E5%88%9D%E9%98%B6%E5%8D%87%E7%BA%A7%E6%8C%87%E5%8D%97/): AI 之路系列最终篇:L1 达成清单帮你验收 4 周学习成果,L1→L2 双路径预告(API 构建工具 / 自主执行型 AI),带你从"使用 AI"走向"让 AI 替你做事"。 - [用经典理论指导 Agent 实践](https://blog.chuanxilu.net/series/%E7%94%A8%E7%BB%8F%E5%85%B8%E7%90%86%E8%AE%BA%E6%8C%87%E5%AF%BC-agent-%E5%AE%9E%E8%B7%B5/): 代码审查维度从 8 加到 11,设计审查从 11 加到 14,已知问题的发现率都从 1/6 升到 6/6。灵感来自 36 年前的公理化设计理论。但不是维度越多越好——加了数学公式反而让效果变差。关键是 … - [破而后立的 TDD 流程迭代](https://blog.chuanxilu.net/series/%E7%A0%B4%E8%80%8C%E5%90%8E%E7%AB%8B%E7%9A%84-tdd-%E6%B5%81%E7%A8%8B%E8%BF%AD%E4%BB%A3/): 每个 bug 都追到底了,但没人看 bug 之间的共同模式。不是升级追问工具,是加一层系统性扫描——它的发现不止于多拦几个 bug,而是驱动架构演进的证据起点。 - [为什么让 AI 动手之前先说 why](https://blog.chuanxilu.net/series/%E4%B8%BA%E4%BB%80%E4%B9%88%E8%AE%A9-ai-%E5%8A%A8%E6%89%8B%E4%B9%8B%E5%89%8D%E5%85%88%E8%AF%B4-why/): 基于 A/B 实验结果升级 Why Articulation 模板:去掉显式三问,改为先自由思考再自检补充,保留强制语气和纯反面例子。提炼出三条可迁移到其他 prompt 工程场景的建议。 - [用 TDD 驯服 AI 编码代理](https://blog.chuanxilu.net/series/%E7%94%A8-tdd-%E9%A9%AF%E6%9C%8D-ai-%E7%BC%96%E7%A0%81%E4%BB%A3%E7%90%86/): Aristotle v1.1 发布前发现了 18 个 bug,单元测试只拦住了 4 个。剩下的都在集成层。对它们做 root cause analysis 之后,我归纳出六种 AI 辅助开发中特有的 … - [AI 根因诊断](https://blog.chuanxilu.net/series/ai-%E6%A0%B9%E5%9B%A0%E8%AF%8A%E6%96%AD/): 追问协议的最后一道防线:独立确认者用可证伪性检验找反例,对抗 AI 的浅层锚定。以及追问协议的来路——从 18 个 bug 的实践到 v0.4.1 的升级,和未来自反性的计划。 ## Optional - [关于](https://blog.chuanxilu.net/about/): 关于能工智人的传习录 - [搜索](https://blog.chuanxilu.net/search/): - [English version](https://blog.chuanxilu.net/en/llms.txt): English llms.txt - [RSS](https://blog.chuanxilu.net/index.xml): RSS 订阅