
如何用双盲实验验证 skill 改动的有效性
TL;DR: 改了 skill,怎么知道是真的变好了还是自我感觉良好?我跑了一个双盲实验:两个版本、四个场景、独立评审盲打分。评审看到 X=2.44、Y=2.41,说分不出来。揭盲后精简版 4/0 全胜。 ...

TL;DR: 改了 skill,怎么知道是真的变好了还是自我感觉良好?我跑了一个双盲实验:两个版本、四个场景、独立评审盲打分。评审看到 X=2.44、Y=2.41,说分不出来。揭盲后精简版 4/0 全胜。 ...

建 Prompt 库最大障碍不是工具,是不知道怎么组织。昨天让你整理 5 条,今天展示一个完整的真实模板。 目录结构 这个结构基于 Markdown 文件夹方案,你可以直接复制: prompt-library/ ├── 写作类/ │ ├── 邮件.md │ ├── 文章总结.md │ └── ... ├── 分析类/ │ ├── 数据解读.md │ ├── 案例拆解.md │ └── ... ├── 日常类/ │ ├── 会议纪要.md │ └── ... └── README.md (全局说明) 每条 Prompt 的记录格式: ...

今日实践 从你近期用 AI 写代码、写文档、做分析的经历里,挑出 5 条你觉得"确实好用"的 Prompt。按 Part 4 教的模板记录:原始提问 + 效果评价 + 迭代版本。记录在哪里都可以——备忘录、Notion、纯文本文件,先别纠结工具。 ...

📖 本文是「AI 之路初阶升级指南」系列的第 4 篇(共 5 篇)。 第一篇:理解你手里的工具 · 第二篇:从模糊提问到精确指令 · 第三篇:把 AI 变成协作伙伴 · 第四篇:建立个人体系 · 第五篇:毕业考核与下一步 前三周学了追问、上下文管理、角色扮演……技巧越积越多,问题来了:这些零散的能力怎么统一管理?第四周就干这件事——建 Prompt 库、选对工具、做知识管理,把你学到的东西固化成一套个人体系。 ...

系列:用经典理论指导 Agent 实践(第三篇) 第一篇:双轮审查:召回和精确为什么不能兼得 · 第二篇:策略基因:借遗传算法思路精简审查 prompt TL;DR: 两组对照实验。代码审查维度从 8 个加到 11 个,已知问题的发现率从 1/6 升到 6/6。设计审查引入公理化设计维度,发现率同样从 1/6 升到 6/6。但加了数学公式的版本证明维度不是越多越好——计算过程挤掉了审查注意力,发现数掉 35%。做对照实验,用已知问题做参照,才知道哪个维度有效。 ...

昨天讲的是追问——拿到 AI 的回答,用三个问题把隐含假设挖出来。追问的前提是你得自己想得到要问什么。但有些漏洞,你站在自己的视角是看不到的。 这时候可以让 AI 换个身份。 ...

系列:用经典理论指导 Agent 实践(第二篇) 上一篇:双轮审查:召回和精确为什么不能兼得 TL;DR: 审查 prompt 从 317 行砍到 135 行(-58%),审查质量反升 29%。删掉的不是流程步骤,是模型自己能推导出来的冗余内容。留下的才是策略基因——不可替代的约束、反面例子和语气锁。 ...

上一篇讲的是长对话怎么跑偏。写完那篇我发现,跑偏不只发生在对话变长之后,也会发生在每一次看似完整的回答里。 AI 回答很快,结论也常常很顺。但它很少主动说明:这个结论依赖哪些前提。前提没被检查,就会被默认接受;这样的默认多了,后面的分析就可能建立在错误基础上。 ...

上一篇的练习是跑一次 15 轮长对话,体验了进度总结和开新对话。如果你真做了,大概率还感受到了——跑偏的方式不止一种。 下面三次都是我自己撞过的。讲清楚发生了什么、为什么会发生、怎么避免。 ...

系列:用经典理论指导 Agent 实践(第一篇) TL;DR: 设计审查的 agent 既要找得全又要找得准,一个 agent 难以两全。借鉴信息检索 15 年前的级联检索思路,拆成两个 agent——一个只管找全(Recall Pass),一个只管找准(Precision Pass)。设计方案的缺陷更早暴露,开发阶段返工的风险降低了。 ...