两个评估面板被磨砂玻璃隔开,背后隐藏着 X/Y 到 A/B 的映射关系

如何用双盲实验验证 skill 改动的有效性

TL;DR: 改了 skill,怎么知道是真的变好了还是自我感觉良好?我跑了一个双盲实验:两个版本、四个场景、独立评审盲打分。评审看到 X=2.44、Y=2.41,说分不出来。揭盲后精简版 4/0 全胜。 ...

2026-05-29 · 5 分钟 · Alex Wang
水彩风格:整齐排列的文件夹和卡片,阳光透过窗户洒进来

我的 Prompt 库长什么样:一个真实模板

建 Prompt 库最大障碍不是工具,是不知道怎么组织。昨天让你整理 5 条,今天展示一个完整的真实模板。 目录结构 这个结构基于 Markdown 文件夹方案,你可以直接复制: prompt-library/ ├── 写作类/ │ ├── 邮件.md │ ├── 文章总结.md │ └── ... ├── 分析类/ │ ├── 数据解读.md │ ├── 案例拆解.md │ └── ... ├── 日常类/ │ ├── 会议纪要.md │ └── ... └── README.md (全局说明) 每条 Prompt 的记录格式: ...

2026-05-28 · 3 分钟 · Alex Wang
水彩风格:一本打开的笔记本,上面写着几条简洁的提示词,背景是淡蓝色的格子

今日实践:整理你的前 5 条 Prompt

今日实践 从你近期用 AI 写代码、写文档、做分析的经历里,挑出 5 条你觉得"确实好用"的 Prompt。按 Part 4 教的模板记录:原始提问 + 效果评价 + 迭代版本。记录在哪里都可以——备忘录、Notion、纯文本文件,先别纠结工具。 ...

2026-05-27 · 2 分钟 · Alex Wang
水彩风格:木工台上整齐摆放的玻璃罐、皮革笔记本和精选工具,一个两层抽屉柜子象征知识管理分区,一切井井有条

AI 之路初阶升级指南(四):建立个人体系

📖 本文是「AI 之路初阶升级指南」系列的第 4 篇(共 5 篇)。 第一篇:理解你手里的工具 · 第二篇:从模糊提问到精确指令 · 第三篇:把 AI 变成协作伙伴 · 第四篇:建立个人体系 · 第五篇:毕业考核与下一步 前三周学了追问、上下文管理、角色扮演……技巧越积越多,问题来了:这些零散的能力怎么统一管理?第四周就干这件事——建 Prompt 库、选对工具、做知识管理,把你学到的东西固化成一套个人体系。 ...

2026-05-26 · 7 分钟 · Alex Wang
一排暗淡的审查维度插槽只有一格亮起,加入新模块后全部亮起——但右边加了数学符号的版本反而变暗

维度实验:30多年前的奇书能搞定审查维度?

系列:用经典理论指导 Agent 实践(第三篇) 第一篇:双轮审查:召回和精确为什么不能兼得 · 第二篇:策略基因:借遗传算法思路精简审查 prompt TL;DR: 两组对照实验。代码审查维度从 8 个加到 11 个,已知问题的发现率从 1/6 升到 6/6。设计审查引入公理化设计维度,发现率同样从 1/6 升到 6/6。但加了数学公式的版本证明维度不是越多越好——计算过程挤掉了审查注意力,发现数掉 35%。做对照实验,用已知问题做参照,才知道哪个维度有效。 ...

2026-05-25 · 8 分钟 · Alex Wang
水彩风格:木桌上一份方案文件,周围三个戏剧面具(绿色支持、红色批判、琥珀色中立),三角排列指向方案,象征角色扮演暴露盲区

角色扮演实战:让 AI 当你的魔鬼代言人

昨天讲的是追问——拿到 AI 的回答,用三个问题把隐含假设挖出来。追问的前提是你得自己想得到要问什么。但有些漏洞,你站在自己的视角是看不到的。 这时候可以让 AI 换个身份。 ...

2026-05-25 · 2 分钟 · Alex Wang
一段臃肿的 prompt 被修剪成紧凑的策略基因结构,冗余内容散落在旁边,核心约束被保留下来

策略基因:借遗传算法思路精简审查 prompt

系列:用经典理论指导 Agent 实践(第二篇) 上一篇:双轮审查:召回和精确为什么不能兼得 TL;DR: 审查 prompt 从 317 行砍到 135 行(-58%),审查质量反升 29%。删掉的不是流程步骤,是模型自己能推导出来的冗余内容。留下的才是策略基因——不可替代的约束、反面例子和语气锁。 ...

2026-05-24 · 9 分钟 · Alex Wang
水彩风格:桌面上一叠半透明纸张和三个追问检查点,象征用追问暴露 AI 回答背后的隐含假设

追问进阶:用 3 个问题暴露 AI 回答中的隐含假设

上一篇讲的是长对话怎么跑偏。写完那篇我发现,跑偏不只发生在对话变长之后,也会发生在每一次看似完整的回答里。 AI 回答很快,结论也常常很顺。但它很少主动说明:这个结论依赖哪些前提。前提没被检查,就会被默认接受;这样的默认多了,后面的分析就可能建立在错误基础上。 ...

2026-05-24 · 2 分钟 · Alex Wang
水彩风格:桌面上一条由纸张组成的蜿蜒路径,三处节点分别象征方向混杂、数据引用出错和需求穿越

长对话翻车实录:3 次跑偏的教训

上一篇的练习是跑一次 15 轮长对话,体验了进度总结和开新对话。如果你真做了,大概率还感受到了——跑偏的方式不止一种。 下面三次都是我自己撞过的。讲清楚发生了什么、为什么会发生、怎么避免。 ...

2026-05-23 · 6 分钟 · Alex Wang
两个漏斗并排——左边宽口承接大量候选问题,右边窄口过滤出真正有价值的发现

级联检索,借信息检索领域 15 年前的方法治审查 agent 的病

系列:用经典理论指导 Agent 实践(第一篇) TL;DR: 设计审查的 agent 既要找得全又要找得准,一个 agent 难以两全。借鉴信息检索 15 年前的级联检索思路,拆成两个 agent——一个只管找全(Recall Pass),一个只管找准(Precision Pass)。设计方案的缺陷更早暴露,开发阶段返工的风险降低了。 ...

2026-05-22 · 8 分钟 · Alex Wang