对抗 AI 讨好型人格的“双向钢人论证”
Industry
Source: 人人都是产品经理Publish time unverified
模型答非所问、只会顺着你说——AI 的讨好型人格怎么治?本文从逻辑学中的钢人论证出发,提出双向钢人决策测试:让 AI 同时扮演最坚定的支持者与最尖锐的反对者,在极限对抗中逼出真实结论,并讨论了为何不宜把整套规则写进全局 AGENTS.md。 在日常使用各类大语言模型时,许多人经常会陷入一种诡异的舒适区:你抛出一个并不成熟的想法,AI 往往第一句就是“这是一个非常棒的视角!”,随后给出一堆四平八稳、放之四海而皆准的分析。 这种现象在学界被称为 AI 的谄媚偏差(Sycophancy)。大模型在强化学习(RLHF)训练机制下极易演化出“讨好型人格”——倾向于顺着用户的假设说话,扮演绝不犯错但毫无增量的中央空调。 不久前 Reddit 上疯传过一段让模型深度思考的 Prompt,核心是通过“指出未说出的假设、缺少的信息、常犯的错误并提问”来避免泛泛而谈。 但这套逻辑如果缺少了对论点本质的极限对抗,依然难以彻底解决模型的迎合惯性。要真正逼出深度答案,必须引入逻辑学中最具对抗性的思维模型——钢人论证(Steelman Argument)。 从“稻草人”到“双向钢人” 辩论学中有一个著名的逻辑谬误…