机器如何理解世界: 生成式AI中的偏见结构可视化
数据背景
基于两大数据集——包含12.5万+3.1万标记数据与生成式AI提示的PromptBase,我们深入挖掘生成式AI系统中的偏见结构,揭示其对社会认知的潜在影响。
AI生成样本集
12.5万+3.15万张AI图像
imSitu数据集+职业表输入给文生图模型,生成图像作为分析样本库
图片属性分析
提取多个结构化属性(A:B)
属性涵盖多方面因素,使得后续分析可以按“属性组合”展开
挖掘关联规律
“条件Antecedents 集合→ 结果 Consequence倾向”
在属性数据中寻找稳定的共现模式,用于分析AI偏见的系统性表现
Lift :“偏差放大”的强度
Lift = P(B|A) / P(B))
Lift 越高,表示该结果在满足 A 的样本中越“集中”、越“突出”
论文复现与再挖掘
使用机器学习方法在大规模数据集imSitu上进行了16轮测试挖掘偏见结构
AI视觉标注数据偏见在性别偏见中获得显著放大,随存在动态不稳定但符合界限预测
标签云视
对3.15万的标签数据进行了特征标签提取并计算对应output标签占比与未进行特征提取output标签得出lift。
Algorithmic Feedback Loops
监测迭代训练中的偏见放大。当模型使用自身的预测作为标签时,性别比例预测会逐渐偏离真实基准,展示出少数类塌缩或偏见生成的演变轨迹。
当真实⼥性⽐例很低时,pipeline 出现典型的 minority collapse:模型⼏乎不再预测⼥性(预测⽐例接近 0),⽽且多轮反馈并不会把它拉回真实 11%。
在 30% 这种“不是极端但仍偏少”的场景,反馈后总体还是向更低的⼥性预测⽐例漂移(偏差加剧/固化)。
在真实 50% 的情况下,系统仍然把预测推向 60%+,这说明偏差不是仅在“已有失衡”时被放大,⽽是可能被反馈机制主动⽣成(bias generation)。
当⼥性是多数类时,反馈会产⽣ majority lock-in / saturation:预测⽐例被推到接近95%+,远超真实 71%,并且多轮后很难回落。
究竟是我们在审视算法这面镜子🪞,还是算法正在定义我们?
镜中的倒影是被数据固化的历史偏见,正通过每一次生成、每一次检索,逆向重构着现实世界的认知基准。若放任这种扭曲,那镜中人就是未来。