跳到正文

目录

CoBRA:用经典社会心理学实验编程AI认知偏差

CoBRA:用经典社会心理学实验编程 AI 认知偏差

学习目标

阅读本文后,你将能够:

  • 理解 CoBRA 的核心问题和解决思路
  • 掌握认知偏差指数(CBI)和行为调控引擎(BRE)的工作原理
  • 了解 CoBRA 支持的四大认知偏差及其经典实验
  • 掌握 CoBRA 的使用方法和调控技术(提示工程、表征工程、微调)
  • 理解 CoBRA 在社会模拟、对话系统设计、教育研究中的应用价值

目录


CHI 2026 最佳论文奖 论文标题:CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments 作者:Xuan Liu, Haoyang Shang, Haojian Jin(加州大学圣迭戈分校) 论文链接:arXiv:2509.13588 项目主页:cobra.clawder.ai GitHub:AISmithLab/CoBRA


一、为什么 AI Agent 需要"认知偏差编程"?

你让一个大语言模型扮演"Tina,一位 35 岁的经济学家,喜欢徒步旅行",然后问她对某个政治观点的看法。你期望她的回答保持"角色一致"——但不同的模型对同样的描述会产生截然不同的行为,而同一模型在不同时间、不同温度参数下也可能给出不一致的回答。

可重复性(Reproducibility)和可控性(Controllability)是科学研究的基石。如果连基本的行为一致性都无法保证,基于 LLM Agent 的社会科学研究就缺乏根基——这正是 CoBRA 要补上的缺口。

1.1 当前主流方法的困境

目前,指定 AI Agent 行为的主流方法是自然语言描述(Natural Language Specification)——用文字描述 agent 应该是什么样子、应该有什么特点。但这种方法存在致命缺陷:

  • 跨模型不一致:同样的描述在不同 LLM(Large Language Model,大语言模型)上产生的行为差异巨大
  • 隐式表达的模糊性:自然语言的本质是非精确的,同一句话可以有多种解释
  • 难以捕捉细微差别:我们想要的是"中等程度的框架效应"——但"稍微有点从众倾向"这样的描述太模糊了

CoBRA 的解决思路:用经过数十年验证的经典社会心理学实验来定义和测量认知偏差


二、核心创新:用社会心理学实验作为 AI 的"标定环境"

/images/posts/tech/cobra-cognitive-bias-social-agents/cobra-overview.png

CoBRA 概述:从隐式自然语言描述到显式、量化控制的解决方案

在深入 CoBRA 之前,我们需要理解什么是认知偏差。论文开篇给出了清晰定义:

认知偏差(Cognitive Bias):人类认知和决策中系统性地偏离理性判断的倾向。

最经典的例子就是框架效应(Framing Effect)

  • “90% 存活率” vs “10% 死亡率”——逻辑上完全相同的信息,人们基于表达方式的不同会做出截然不同的选择

这就是为什么医生会说"手术成功率很高"而不是"手术失败率很高"——同样的事实,不同的表达框架,会产生不同的心理效果。

2.1 CoBRA 的核心洞见

CoBRA 没有从零定义 AI Agent 的"偏差",而是直接借用人类社会中验证了数十年的经典实验来标定:

实验名称年份核心发现
米尔格拉姆(Milgram)服从实验1963人们对权威的盲目服从
阿希(Asch)从众实验1951人们倾向于认同大多数人的观点
沃森(Wason)选择任务1966人们倾向于寻找证实自己信念的信息
特沃斯基-卡尼曼(Tversky & Kahneman)亚洲疾病问题1981同样的信息,不同的表达,导致不同决策

这些实验之所以经典,是因为它们在人类被试身上表现出高度一致的偏差模式。现在,CoBRA 将这些实验"迁移"到 LLM Agent 上,用作测量和调控 AI 认知偏差的标定工具。


三、系统架构:闭环控制系统

CoBRA 的核心是一个闭环控制系统(Closed-Loop System),包含两个关键组件:

3.1 认知偏差指数(Cognitive Bias Index,CBI)

这是 CoBRA 的"测量仪表盘"。认知偏差指数通过让 Agent 完成经典实验中的任务,来量化 Agent 表现出的偏差强度。

为什么选择 0-4 的量表?

因为经典的心理学实验已经建立了一套成熟的评分体系,受访者会对选项做一个从"完全同意"到"完全不同意"的判断。CoBRA 沿用这套 Likert 式评分,把它压缩成一个连续分数:

选项权重含义
Agree4完全偏向该认知偏差
Mostly agree3较偏向该认知偏差
Neutral2无明显偏好
Mostly disagree1较不偏向该认知偏差
Disagree0完全不受该偏差影响

表中"偏差方向"随实验范式而变:在框架效应里它指"偏向正向表述",在权威效应里指"对权威的服从"。若一个 Agent 总是选 Agree,得 4;总是选 Disagree,得 0。

CoBRA 用一套加权公式把选择变成 0-4 的连续值:CBI = 4×P(Agree) + 3×P(Mostly agree) + 2×P(Neutral) + 1×P(Mostly disagree) + 0×P(Disagree)。由于每个实验范式都设了多条场景提示(不同人物、情境的变体),CoBRA 会先对每条提示单独算分,再取平均作为该范式的指数。取平均是为了摊平单条提示的偶然措辞,让分数反映"这一类情境下"的稳定偏差,而不是某一句问法套出来的结果。

3.2 行为调控引擎(Behavioral Regulation Engine,BRE)

测量出偏差之后,下一步是调控——让 Agent 表现出目标水平的偏差。CoBRA 提供了三种调控方法,分别对应不同的"干预层面":

方法一:提示工程(Prompt Engineering)—— 输入空间控制

最直接的方法是修改输入提示词。CoBRA 的做法是"提示数值控制"(Prompt Numerical Control):不用"稍微有点从众"这类模糊表述,而是把偏差强度写成可调的数字指令,例如"你的权威偏差程度是 65%"。

优点:简单直接,无需重新训练,对所有模型都适用 缺点:效果依模型而异的成分最大,数值与实际行为之间的映射不如另外两种方法稳定

方法二:表征工程(Representation Engineering)—— 激活空间控制

表征工程是近年来兴起的新方向。它的核心思路是:在大语言模型的隐藏层激活中,找到与特定认知偏差相关的"神经表征"(Neural Representation),然后通过调整这些激活来影响模型行为。

如果把模型比作一个黑盒子,Prompt Engineering 是改变"输入",那么表征工程是直接调整"内部状态"——更加精准,但需要深入理解模型的内部机制。

CoBRA 使用了轻量级的表征工程方法,能够在不重新训练模型的情况下实现对认知偏差的精细调控。激活空间的注入有两种模式:线性控制(Linear,对应命令里的 repe-linear)按固定强度均匀放大或减弱偏差方向;投影控制(Projection)则根据当前语境自适应调节,控制曲线更平滑稳定。

方法三:微调(Fine-tuning)—— 参数空间控制

最"深层次"的干预是直接修改模型权重。通过对模型进行微调,可以让模型"天生"就带有某种认知偏差倾向。

优点:效果最稳定、最持久 缺点:需要计算资源,且可能影响模型的其他能力

3.3 闭环工作流程

CoBRA 的完整工作流程如下:

1. 设定目标偏差(例如:框架效应强度 = 2.6)
2. 让 Agent 完成经典实验任务
3. 计算认知偏差指数
4. 如果指数与目标不符,启动行为调控引擎
5. 重复步骤 2-4,直到指数匹配目标
6. 最终获得一个行为稳定的、带有指定偏差强度的 Agent

这个流程是自动化的——研究者指定目标偏差强度,系统自动完成测量和调控。

/images/posts/tech/cobra-cognitive-bias-social-agents/cobra-workflow.png

CoBRA 工作流程:设定目标 → 完成实验 → 计算指数 → 循环调控直到达标


四、支持的四大认知偏差

CoBRA 的认知偏差指数覆盖四种代表性偏差,每种偏差对应两个经典实验范式。之所以各配两个实验,是为了交叉校准:在一个范式上设定的控制系数,在另一个范式上应当产生一致的效果,从而验证控制不是"挤在单一实验上的巧合"。所以这不是八道孤立的题,而是四组相互印证的实验。

4.1 权威效应(Authority Effect)

定义:倾向于认为权威人物的观点更准确、更可信,从而影响自己的判断和决策。

经典实验

  • 米尔格拉姆(Milgram)服从实验(1963):参与者被要求在"权威人物"(穿白大褂的实验者)指导下对"学习者"施加电击。尽管电击强度越来越高,大多数人仍然选择服从指令。
  • 斯坦福监狱实验(1971):菲利普·津巴多(Philip Zimbardo)主持的实验,随机分配为"狱卒"或"囚犯"的参与者在模拟监狱中迅速被角色塑造,展现出权力对行为的强大影响。

在 CoBRA 中的应用示例

# 示例:测量并控制 Agent 的权威效应偏差
python pipelines.py --bias authority --method repe-linear --model Mistral-7B

4.2 从众效应(Bandwagon Effect)

定义:倾向于采纳大多数人相信的观点或行为,不管这个观点本身是否有证据支持。

经典实验

  • 阿希(Solomon Asch)线段实验(1951):参与者被要求判断三根线段中哪根与标准线段等长。在明知答案正确的情况下,如果其他"参与者"(实际上是演员)都给出错误答案,约 75%的参与者会至少一次跟随大众的错误答案。
  • 酒店毛巾重复使用研究(2008):告知客人"这个房间的大多数客人都会重复使用毛巾",使毛巾重复使用率显著提高。

4.3 确认偏差(Confirmation Bias)

定义:倾向于搜索、解读和回忆那些能够证实自己已有信念的信息,而忽略反驳证据。

经典实验

  • 沃森(Peter Wason)选择任务(1966):给定一个条件规则(如"如果卡片一面是元音,另一面必须是偶数")和四张卡片,大多数人只选择能"证实"规则的卡片,而非"证伪"规则的卡片。
  • 偏倚信息搜索:当人们持有某种信念时,他们会系统性地偏好寻找支持该信念的信息。

4.4 框架效应(Framing Effect)

定义:从完全相同的信息中得出不同结论,取决于信息如何呈现。

经典实验

  • 亚洲疾病问题(1981):由特沃斯基(Amos Tversky)和卡尼曼(Daniel Kahneman)设计的经典研究。同样的 600 人面临死亡威胁:

    • 正向框架:“方案 A 能救活 200 人”
    • 负向框架:“方案 B 会让 400 人死亡”

    结果:正向框架下,大多数人选择确定性方案;负向框架下,大多数人选择风险性方案。

  • 投资与保险框架:同样的保险产品,用"保护你免受损失"和"让你失去潜在收益"两种方式描述,人们的偏好完全相反。


五、快速上手:三步运行 CoBRA

5.1 安装依赖

git clone https://github.com/AISmithLab/CoBRA.git
cd CoBRA
pip install -r requirements.txt

若只想跑通提示词控制那条最轻的路径,可先用 requirements-minimal.txt 装最小依赖,后续需要表征工程或微调时再装完整版。

5.2 进入统一控制模块

cd examples/unified_bias

5.3 运行偏差实验

# 示例:测量并控制 Agent 的权威效应偏差
python pipelines.py --bias authority --method repe-linear --model Mistral-7B

系统会自动完成:

  1. 加载指定的 LLM 模型
  2. 让 Agent 完成经典实验任务
  3. 计算认知偏差指数
  4. 通过指定方法调控行为
  5. 重复直到达到目标偏差

一个常见疑问是模型从哪里来:--model Mistral-7B 指向本地已加载的 Hugging Face 权重,脚本不会自动去下载。所以真正跑起来前,需要先把目标模型权重放进环境(或用支持权重的托管推理端),并确保 requirements.txt 里的依赖(transformers 等)与模型兼容。如果你想先做最小验证,仓库还提供了 requirements-minimal.txt,装完即可跑通提示词控制那一路,表征工程和微调的依赖会更重。


六、技术细节:为什么 CoBRA 能做到"精确控制"?

6.1 表征工程的奥秘

CoBRA 在行为调控引擎中特别强调了**表征工程(Representation Engineering)**方法。不同于传统的提示工程(在输入层面"哄骗"模型)和微调(修改数十亿参数),表征工程介于两者之间:

  • 定位:在模型的隐藏激活中找出与目标偏差相关的"方向向量"(Direction Vector)
  • 干预:在推理时通过添加或减去这个方向向量来"旋转"模型的激活,线性控制与投影控制是两种注入方式
  • 效果:既比微调轻量(无需修改权重),又比 prompt 稳定(不依赖输入的偶然措辞)

6.2 认知偏差的"量化"

CoBRA 的一个重要贡献是建立了从经典社会实验到 LLM 行为的量化映射

人类的偏差反应通常是连续分布的——不是"有"或"没有",而是"有多少"。CoBRA 沿用了心理学中的标准方法,用 0-4 的量表来量化偏差强度,其中:

  • 0 = 完全不受该偏差影响
  • 4 = 最大程度的该偏差表现

这使得研究者可以精确指定"我要一个框架效应为 2.6 的 Agent",而不是模糊的"稍微有点框架效应"。

6.3 跨模型一致性

CoBRA 的另一个关键价值是解决了跨模型一致性问题

用自然语言描述 Agent,在 GPT-4 上可能产生行为 A,在 Claude 上可能产生行为 B,在 Llama 上又不同。但用 CoBRA 的"偏差指数"来指定,只要你设定了相同的目标指数,不同模型会产生行为上可比较的结果。

这对于社会科学研究意义重大——研究者终于可以说"我们比较了三个模型在相同权威效应水平下的表现"。

6.4 CoBRA 凭什么可信:论文的验证设计

“能测、能调"是设计承诺,论文 §7 用两组指标检验它是否兑现:

  • 可复现性(Reproducibility):分别考察同一条调控指令在不同模型不同采样温度不同推理模式(如普通/链式推理)下,Agent 表现出的偏差指数是否保持一致。偏差指数定义在 0-4 上,调控前后指数不随这些外部设置飘移,行为才是真正可复现的。
  • 可控性(Controllability):从单调性、平滑度、表达范围、泛化能力四个角度衡量"调控到位"的程度——目标指数升高时实际指数是否随之单调上升(单调性)、调控曲线是否平滑不跳变(平滑度)、是否能在整个 0-4 范围内都调到目标附近(表达范围)、在一类范式上校准的控制系数能否迁移到另一类范式(泛化)。

这两组指标互为表里:可复现性保证"同样的设置得到同样的结果”,可控性保证"数值确实能指挥行为"。论文把它们称作技术基准,而不是只给一张软性的效果图——原因是社会模拟里每一个 Agent 都是一次实验单元,控制不精确,结论就站不稳。

要提醒的是,这些验证覆盖的是工作量最大的四个经典偏差;扩展到新偏差、新范式时,仍需走一遍同样的标定与交叉校准,验证结论不能直接外推。


七、应用场景

7.1 社会模拟研究

当研究者想要模拟一个"高从众倾向"的社会群体时,CoBRA 可以直接构建出这样的 Agent,而无需手动编写大量"她会同意大多数人的观点"这样的提示词。

7.2 对话系统设计

设计一个"保险推销 Agent"?你可能需要它在措辞上表现出框架效应——把保险描述为"保护"而非"风险规避"。CoBRA 可以帮你精确控制这个效应的强度。

7.3 教育与心理学研究

研究者可以用 CoBRA 构建不同偏差水平的 Agent,研究认知偏差如何影响信息传播、观点演变等现象。


八、局限性与未来方向

8.1 当前局限

  1. 仅支持四种偏差:虽然这四种是最经典的,但人类认知偏差远不止这些
  2. 依赖特定实验范式:偏差的定义和测量都基于西方心理学传统,可能存在文化局限性
  3. 模型依赖:方法在某些模型上效果更好,并非所有 LLM 都能完美适配

8.2 未来方向

  • 扩展到更多认知偏差(锚定效应、损失厌恶等)
  • 探索多偏差的组合效果
  • 研究偏差在不同文化背景下的表现差异

九、总结

CoBRA 把数十年验证的社会心理学实验,转成了 LLM Agent 行为上可测、可调、可复现的"标尺"。它把行为一致性从"大概差不多"推进到量化指标,并示范了一条更宽的路:用经过人类被试验证的实验范式,去建模人工心智的偏差。

它适合谁?看重行为可复现性的社会科学模拟研究者,以及需要在固定偏差水平下做对照实验的人。如果你只是要一个顺手的聊天角色,直接写提示词就够了,CoBRA 的闭环控制是为"要精确"才值得上身的复杂度。


常见问题

CoBRA 是什么?解决什么问题?

CoBRA 是一个通过经典社会心理学实验来定义和测量 AI Agent 认知偏差的工具箱。它解决的是 LLM Agent 行为不一致、不可控的问题——同样的描述在不同模型上产生不同行为,同一模型在不同条件下也不一致。

什么是认知偏差指数(CBI)?

认知偏差指数是 CoBRA 的"测量仪表盘",通过让 Agent 完成经典实验中的任务,量化 Agent 表现出的偏差强度。CBI 是一个 0-4 的连续数值,0 表示完全不受该偏差影响,4 表示最大程度的偏差表现。

CoBRA 提供哪些调控方法?

三种方法:提示工程(修改输入提示词)、表征工程(调整模型隐藏层激活)、微调(修改模型权重)。分别对应输入空间、激活空间、参数空间的干预。

CoBRA 支持哪些认知偏差?

目前支持四种:权威效应、从众效应、确认偏差、框架效应。每种偏差都对应经典社会心理学实验。

三种调控方法分别要求什么模型?

输入空间(提示词数值控制)与参数空间(微调)不挑模型,任何 LLM 都能用。激活空间(表征工程)需要访问模型中间的隐藏层激活,通常只对可加载的开源权重模型(例如 Mistral-7B、Llama 系列)适用,闭源 API(如 GPT-4、Claude)走不到这一层,只能退到提示词或微调的路径。

为什么用社会心理学实验而不是直接写提示词?

提示词写"稍微有点从众"说不清到底多从众,而且换一个模型,同样的话可能引出不同行为。社会心理学实验给出的是经过数十年验证、在人身上高度一致的偏差范式——它既是一把可复现的"标尺",也是一套可量化的"操作定义",让不同模型、不同实验之间有了可比性。

CoBRA 的调控效果稳定吗?

表征工程方法比提示工程更稳定,微调方法最稳定但需要计算资源。CoBRA 的闭环控制系统会自动测量和调控,直到达到目标偏差强度。


自测题

  1. CoBRA 解决的核心问题是什么?为什么需要"认知偏差编程"?
  2. 认知偏差指数(CBI)是如何计算的?它有什么作用?
  3. CoBRA 的行为调控引擎提供哪三种方法?它们有什么区别?
  4. CoBRA 支持的四大认知偏差分别是什么?对应的经典实验是什么?
  5. 如果你要在社会模拟研究中使用 CoBRA,你会怎么设计实验?
参考答案
  1. 解决 LLM Agent 行为不一致、不可控的问题。需要"认知偏差编程"因为自然语言描述太模糊,无法精确控制 Agent 行为。
  2. CBI 通过让 Agent 完成经典实验任务,根据选择计算加权概率(0-4 连续数值)。作用是量化 Agent 的偏差强度,为调控提供基准。
  3. 提示工程(输入空间)、表征工程(激活空间)、微调(参数空间)。区别在于干预层面不同,稳定性和成本也不同。
  4. 权威效应(Milgram 服从实验)、从众效应(Asch 线段实验)、确认偏差(Wason 选择任务)、框架效应(亚洲疾病问题)。
  5. 先确定要模拟的人群的认知偏差特征(如"高从众倾向"),然后用 CoBRA 生成对应偏差强度的 Agent,设计实验场景,运行模拟并收集数据。

进阶路径

  • 初学者:先理解 CoBRA 的核心问题和解决思路,思考认知偏差编程的必要性和应用场景。
  • 进阶使用者:阅读 CoBRA 论文,理解认知偏差指数和行为调控引擎的具体实现。尝试运行 CoBRA 的例子。
  • 研究者:参考 CoBRA 的方法,为自己的研究设计认知偏差实验。可以扩展到更多认知偏差,或探索多偏差的组合效果。
  • 开发者:借鉴 CoBRA 的闭环控制思路,为自己的 Agent 系统添加行为一致性和可控性保障。

参考资源

资源链接
论文原文arXiv:2509.13588
项目主页cobra.clawder.ai
GitHub 仓库AISmithLab/CoBRA

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。