top of page

AI 模型会继承性别偏见,并可能将其放大

Google News 提出了一个关于人工智能的直白观点:尽管模型的回答看似独立,但它们并非凭空创造性别偏见。

Analytics India Magazine 的标题“AI Doesn’t Invent Gender Bias, It Inherits Ours”用一句话概括了这一矛盾。AI 系统从人类记录中学习模式,随后以人类单独难以达到的规模复制这些模式。

这一解释并不能免除模型开发者或客户的责任。训练数据反映社会现实,但工程师决定数据、目标、防护措施、评估方法和部署场景。真正的较量在于继承的历史与有意的干预之间。

风险远不止是聊天机器人给出冒犯性回答。生成式模型如今会起草职位描述、总结简历、生成绩效评估、推荐产品,并帮助员工解读大量信息集合。

每一次自动化决策,都可能让旧有刻板印象披上一层技术外衣。一旦模型以流畅的语言呈现这种模式,用户便可能将重复误认为客观判断。

因此,Google、OpenAI、Meta、Anthropic 以及企业 AI 采购方都面临同一项令人不安的考验:他们必须证明,负责任的 AI 意味着可衡量的群体间表现,而非精心润色的原则或挑选出来的演示案例。

为什么 Google News 的标题此刻重要

这一标题之所以重要,是因为 AI 已从反映文化转向积极塑造日常工作流程中的决策。

搜索聚合可能让一种观点看起来只是又一个转瞬即逝的意见。但在此事上,核心主张建立在语言模型、计算机视觉和自动化决策系统领域多年的研究之上。

机器学习会识别示例中的统计关系。大型语言模型(LLM)从文本中学习模式,并预测可能出现的词序列。仅仅因为某种反复出现的社会模式很常见,这两种过程都无法判断其是否公平。

历史记录中,工作、教育、信贷、领导职位、出版和公众认可的获取机会并不平等。因此,关于这些记录的文本中,也存在性别与职业、权威、家庭角色和个人特质之间的不平等关联。

模型即使没有收到“男性领导、女性协助”这样的明确规则,也可能吸收这些关联。这种关联会通过人和机构提供的重复示例、标签、排序和反馈逐渐形成。

UNESCO 在对 GPT-2、GPT-3.5 和 Llama 2 的研究中记录了这一问题。其性别偏见研究发现,部分生成内容让女性承担家庭角色的频率远高于男性。

女性姓名经常与家庭、家人和儿童相关联。男性姓名则更常与商业、高管职位、薪酬和职业生涯相联系。

这并不意味着每个现有模型的每一次回答都包含同样的刻板印象。模型会变化,提示词会产生影响,防护措施各不相同,评估方法捕捉到的行为也不同。

但这说明,单个中立回答几乎无法证明什么。一个系统或许能正确回答显而易见的公平问题,却仍可能在数千个普通请求中产生不平等模式。

Google News 也让这一观点具有更广泛的意义,因为 Google 同时处于信息链路的两端。它既传播关于 AI 的报道,也在开发 Gemini 模型,并将生成式回答整合进自身产品。

Google 表示,其 AI 开发包含旨在避免不公平偏见的测试、监控和防护措施。这些AI 原则确立了一项承诺,但并不能独立证明每款产品或每种场景都能实现平等结果。

这一差别很重要。原则描述的是预期方向;审计、事件报告、子群体结果和产品行为,才能说明已部署系统是否真正遵循这些原则。

因此,这一标题所传递的不只是又一场关于不礼貌输出的讨论。它追问的是:企业能否阻止继承而来的模式演变为自动化的推荐、排序和决策。

人类数据进入 AI 的路径不止训练文本

偏见会通过整个开发流程进入模型,包括数据收集、标注、优化、测试和人工反馈。

训练数据最受关注,因为其影响很容易理解。如果网络文本反复将工程师描述为男性、将照护者描述为女性,模型便可能学习到这些关联。

然而,将数据视为唯一原因过度简化了这一机制。开发者决定哪些来源进入语料库、哪些语言占主导、哪些内容被过滤,以及哪些示例获得更高权重。

这些决策会改变模型接触到的内容。删除明确的辱骂言论,并不一定能消除与权威、能力、雄心、温暖感或家庭责任有关的隐性模式。

标签又引入了一层影响。数据标注员可能会将回答归类为专业、有帮助、安全或冒犯性内容。这些判断部分取决于文化预期和给予标注员的指示。

模型目标则施加了更多压力。优化过程会奖励在既定目标上表现良好的行为。如果目标忽略子群体差异,模型可能在整体上有所改进,却持续让特定群体遭遇失败。

人工反馈能够减少有害行为,但其中同样带有人类假设。审核人员可能对公平存有分歧,将礼貌误认为中立,或奖励那些掩盖偏见、却未纠正其深层关联的答案。

产品设计随后决定了风险暴露方式。用于创意头脑风暴的模型,与用于候选人排序或总结员工评估的同一模型,所带来的风险并不相同。

界面选择也会影响信任。流畅的文字、自信的排版和快速的响应,可能让不确定的预测显得权威。用户往往只看到最终答案,而看不到其背后的数据缺口。

NIST 将其视为一个社会技术问题,即技术组件与人类机构相互作用,共同产生结果。其关于管理 AI 偏见的工作考察系统性、计算性、统计性和人为来源,而不是将责任归咎于单一数据集。

这一更广泛的视角更准确地界定了责任。社会提供带有偏见的材料,但组织决定是否将这些模式转化为已部署的系统。

这一区别也解释了为什么“模型是从我们这里学来的”并不完整。企业不能在选择使用互联网数据训练并商业化模型后,再指着互联网来逃避责任。

设想一个招聘团队要求 LLM 比较绩效评估。历史评估可能会用成就相关词汇描述男性,而用协作或人格特质相关词汇描述女性。

一个总结系统可能在听起来中立的同时保留这种失衡。即便两人的成果相当,它也可能突出一名员工的营收责任,而强调另一名员工的沟通风格。

伤害还可能在后续环节延续。管理者可能依据这些总结作出晋升、继任计划或薪酬讨论的决定。模型于是将历史语言模式转化为新的组织证据。

知识工作者在使用 AI 搜索私有档案时,也会面临类似问题。系统可能会将有关男性领导者的文件排得更靠前,因为这些文件包含更强的权威信号。

更好的检索和来源可见性能够帮助用户审视这些模式。透明的AI knowledge base有助于核查,但用户仍必须质疑该集合包含了什么、遗漏了什么。

因此,偏见可能在提示词之前、生成过程中,以及答案到达决策者之后出现。只修复一个环节,其他路径仍会完好无损。

真正的对手是继承的历史与有意的干预

核心冲突在于,模型构建者究竟只是复制历史模式,还是主动测试并纠正其影响。

没有开发者能够仅凭完全中立的数据构建出严肃的通用模型。语言文献中包含冲突、歧视、刻板印象、进步、法律、虚构、讽刺以及不平等的社会条件。

抹去所有偏见相关内容,不会让模型更公平,只会让它的信息更不完整。更困难的目标是让系统认识历史,同时避免将历史不平等呈现为理所当然的规范。

这要求将描述与建议区分开来。模型应理解领导者历来常被表述为男性,同时在评估个人是否适合某一职位时避免沿用这种关联。

开发者拥有多个干预节点。他们可以重新平衡数据集、改进文档、调整训练目标、测试子群体表现、对应用进行红队测试,并在发布后监控行为。

没有一种方法提供普遍适用的解决方案。重新平衡一个维度可能掩盖另一个维度,而测量二元性别类别的测试可能排除性别认同不符合这些类别的人。

提示词过滤器可以拦截显而易见的刻板印象,却可能让间接模式未受触及。模型也许避免使用性别化词语,但仍赋予不同程度的能动性、自信、资历或技术能力。

研究职业推荐的学者发现,模型选择符合刻板印象的工作岗位的频率,可能高于真实劳动力数据所能证明的程度。这是放大,而非简单复制。

放大之所以发生,是因为模型将大量示例压缩为可复用的关联。大型语料库中的重复可能成为强有力的预测捷径,即使每一个单独示例看起来都不起眼。

系统随后会基于这种捷径生成新文本。这些输出可能进入网站、招聘记录、教育材料和未来训练集合,从而形成反馈循环。

这一循环改变了责任的性质。人类偏见提供初始信号,而自动化可能扩大其影响范围、一致性和表面上的正当性。

早期计算机视觉研究也说明了同样的机制。Gender Shades 项目针对肤色与性别交叉群体,评估了商业性别分类系统。

MIT 的一篇报道指出,浅肤色男性的错误率为 0.8%,深肤色女性则为 34.7%。这种分类差异表明,平均准确率可能掩盖严重的子群体失误。

这项工作关注的是人脸分析,而非生成式语言。但其教训可以直接迁移:总体表现无法揭示究竟是谁承担了错误。

交叉性评估考察的是特征组合,而非将性别或肤色分开测试。这一点很重要,因为不利处境可能在其交叉点上叠加。

这项研究也提供了干预能够奏效的证据。后续审计发现,在研究人员披露问题后,相关公司降低了多项已测量的差异。

这并不能证明每个系统都变得公平了。但它确实削弱了这样一种宿命论式的说法:继承而来的偏见使改进无从谈起。

模型文档是另一项务实的干预措施。Google 的研究人员提出了模型卡(model cards),即标准化报告,用于说明预期用途、评估条件、局限性,以及模型在相关群体中的表现。

模型卡框架鼓励开发者报告不同人口群体及其交叉子群体的结果。它也帮助采购方判断某项基准测试是否贴近其预期用途。

仅靠文档无法保护任何人。如果采购团队忽视详细警告,或将模型部署到其未被评估过的环境中,这类警告的价值就十分有限。

不过,披露改变了举证责任。它让客户、审计人员、研究人员和受影响社区有具体内容可供审查,而不必只能相信笼统的公平承诺。

因此,真正的较量并非人与机器之间的对抗,而是被动继承与可问责的工程、采购和治理之间的较量。

公平性基准仍未能揭示什么

一个模型即使通过了公开发布的偏见测试,仍可能在陌生的语言、工作流程、人群或部署环境中表现不公。

公平性并不存在单一的通用指标。错误率相等、选中率相等、预测校准和个体一致性之间可能彼此冲突。

正确的衡量方式取决于所作出的决策。对话助手、医疗分诊系统、招聘筛选工具和信贷模型带来的后果并不相同。

基准设计本身也涉及人的选择。研究人员会选择身份类别、提示词、职业、标签、阈值和参考数据。每一个选择都界定了测试能够看见什么。

二元性别评估就是一个清晰的例子。它们可以揭示对女性和男性的不平等对待,却无法代表非二元性别者、跨性别者和性别不规范者。

语言也构成另一项局限。一个模型在英文提示词上表现良好,却可能在印地语、西班牙语、阿拉伯语或地区方言中再现不同的刻板印象。

翻译无法完全解决这个问题。性别标记、职业头衔、代词、家庭结构和社会期待因语言和社区而异。

地理因素同样重要。一个主要使用北美材料训练的模型,可能会误读其他地区的姓名、就业模式或沟通规范。

因此,测试必须涵盖系统实际运行时所面对的人群和情境。实验室中的通用分数不能取代针对具体应用的评估。

直接提示与间接提示之间也存在差距。模型往往能够识别关于歧视的明确提问,因为开发者会在安全训练中纳入这些案例。

日常提示词可能暴露更多问题。要求模型撰写推荐信、分配领导力特质、生成高管形象,或推荐职业,都可能揭示更细微的关联偏见。

一旦开发者开始直接针对某项基准进行优化,这项基准的信息价值就可能下降。分数提高了,但未被衡量的行为可能保持不变,或转移为更不明显的形式。

这在机器学习中是一个常见问题。当某项测量成为首要目标时,团队可以改善这个数字,却不改善更广泛的结果。

供应商访问权限带来了进一步的不确定性。独立研究人员并不总能检查专有训练数据、模型权重、系统提示词、过滤器或反馈方法。

开放模型带来不同的权衡。研究人员能够检查和修改更多组件,但下游用户也可以移除防护措施,或在缺乏一致监督的情况下部署修改后的版本。

UNESCO 观察到,在其研究中,一些开放模型表现出更强的、可测量的刻板印象。该组织也指出,开放性能够支持更广泛的协作来推进缓解措施。

无论开放还是封闭,都不能保证公平。关键问题在于,独立方能否评估有意义的行为,以及开发者是否会对已记录的失败作出回应。

持怀疑态度的读者也应避免将每一种人口群体差异都视为歧视的证据。一些观察到的差距可能源于测量误差、样本构成、模糊提示词或选择不当的参考数据。

这种谨慎应当改进审计,而不是否定审计。研究人员需要可复现的方法、透明的假设、足够的样本量和不确定性估计。

组织还需要建立事件反馈渠道。员工和受影响用户应能够报告意外行为,而不必穿过不透明的支持流程。

最可信的公平性方案,应将部署前测试与持续监测结合起来。真实用户会暴露开发团队从未预料到的情境。

团队应追踪错误造成的后果,而不仅仅是其发生频率。轻微的措辞失衡,与系统性排除合格申请者并不相同。

采购团队也必须提出同样严肃的问题。他们应了解哪些数据进入应用、模型影响哪些决策,以及人类是否能够真正对其输出提出质疑。

当人类只是自动接受建议时,“人在回路中”并不够。监督需要时间、权限、替代性证据,以及明确的系统覆写路径。

否则,这个说法可能沦为仪式化表述。一个人在数百个机器排序案例上点击批准,并不能将自动化转化为审慎判断。

当 AI 偏见规模化时,谁会面临压力

模型开发者、企业采购方和管理者都将面临压力,因为责任取决于对系统的控制权,而不是对其原始数据的所有权。

开发者控制训练选择、评估方法、发布决策、防护措施和产品文档。他们最有技术能力识别反复出现的模型行为。

云平台和应用供应商控制基础模型如何进入具体工作流程。它们的提示词、检索系统、排序逻辑和用户界面都可能引入新的不平等。

企业客户选择使用场景。他们决定 AI 输出是仅用于辅助头脑风暴,还是会影响就业、健康、教育、保险或金融决策。

管理者控制实施方式。他们建立审查程序、升级渠道、绩效目标,并决定员工能获得多少时间来质疑自动化结果。

每个参与者都可以将责任指向他方。模型公司可以归咎于公开数据,应用供应商可以归咎于基础模型,客户则可以归咎于两家供应商。

正是在责任需要变得更具体时,这条链条使问责变得困难。合同和文档应明确谁在何种条件下测试哪个组件,以及失败如何触发行动。

就业领域提供了一个尤为清晰的压力点。模型可能协助撰写招聘广告、搜寻候选人、对申请进行排序、准备面试,或总结员工反馈。

偏见可能出现在每一个环节。带有性别色彩的措辞可能缩小申请者范围,简历模式可能影响排序,而生成的总结可能重复过往评价中的不平等描述。

风险并不要求模型直接使用性别信息。姓名、职业空档、学校、会员身份、所在地和写作模式都可能充当代理变量。

因此,移除受保护属性并不会自动消除不平等影响。测试必须在完整流程运行后,检视不同群体的结果。

公司还需要一个比较基准。人类决策本已包含偏见,因此拒绝自动化并不会默认产生一个无偏见系统。

相关比较并不是机器错误与完美人类判断之间的比较,而是已部署流程与可信替代方案之间的比较,并需衡量其对受影响群体及后果的影响。

这种比较可以揭示有价值的改进。结构化评估可能减少一些不一致的人类判断,同时也可能因规模或隐藏代理变量带来新的风险。

最好的结果不是宣布人类或 AI 中的任何一方中立,而是设计一个让错误变得可见、可质疑且可纠正的流程。

开发者还面临着能力营销与治理证据之间日益扩大的差距。模型发布强调基准测试提升、更长上下文、更快生成和更强推理能力。

公平性报告很少获得同等重视。采购方往往只会收到笼统的安全描述,却得不到其自身人群所需的子群体结果。

Google 和其他主要开发者可以通过发布与应用相关的评估、方法论变化、已知局限性,以及对外部审计的有据可查回应来缩小这一差距。

独立审查仍不可或缺,因为内部团队受到产品期限和商业激励的制约。外部研究人员可以测试发布流程所忽视的案例。

媒体传播在这里同样重要。当 Google News 推高有关 AI 继承偏见的报道时,它有助于将学术关切带入采购和管理层的讨论。

然而,曝光度也可能将辩论压缩成一句口号。“AI 继承我们的偏见”令人印象深刻,但它不应成为工程实践薄弱的借口。

更有力的解读提出了更高要求:社会创造了潜在的不平等,开发者围绕其作出了编码选择,而部署者决定由此产生的系统在何处获得权威。

Google News 辩论之后应关注什么

下一个检验是:公司是否发布更有力的子群体证据,采购方是否要求部署审计,以及被报告的失败是否带来可衡量的产品变化。

第一个信号,是主要模型开发者提供更详细的评估。关注其是否公布跨性别、种族、年龄、语言、地理区域和交叉群体的结果。

一份有用的发布说明应解释测试人群、提示词设计、比较基准、不确定性和已知局限性。单一的总体公平性评分几乎不具备诊断价值。

纵向结果更为重要。公司应展示新模型相较其前代是改善、退步,还是改变了差异表现。

第二个信号,是工作场所内针对应用层面的审计。基础模型评估无法预测检索数据、自定义提示词、排序系统和本地政策所造成的每一种影响。

组织应在部署前测试其完整工作流程,并在模型更新、数据变化或提示词重大修订后重复这项评估。

审计发现应与行动相连。已记录的不平等应触发明确回应,例如暂停某项功能、变更数据、增加审查或限制使用场景。

第三个信号,是受影响用户是否获得有意义的救济途径。人们需要知道 AI 何时实质性影响了一项决定,以及如何质疑错误结果。

这一质疑流程应能触达有权审查证据的人。它不应将用户重新送回作出争议决定的同一自动化系统。

如果子群体失败持续出现在更新的模型和实际部署中,这些信号将强化“继承偏见”的论点。如果透明干预措施持续减少伤害,它们则会削弱宿命论式解读。

进展很可能仍不均衡。一个模型可能在直接刻板印象上有所改善,却在图像生成、多语言行为或对权威的间接评估上出现退步。

这正是为什么 Google News 的标题应开启一场更艰难的讨论,而不是结束它。AI 偏见既不是神秘的机器冲动,也不是一次对齐更新后就会消失的问题。

它是一连串通过数据、优化、评估、部署和使用所表达的人类选择。每一个环节都可能重现不平等,也可能将其打断。

每当 AI 系统对人进行评估时,读者都应提出一个务实的问题:有什么证据表明,这一具体工作流程能公平对待相关群体?

应要求提供各子群体的结果、已知局限、监测计划以及申诉机制。如果供应商只提供原则和汇总基准测试结果,就应将这一缺口视为与决策相关的信息。

对于知识工作,应保留来源,并审视 AI 如何得出结论。当用户将生成的主张与自己的材料进行核验时,一个可搜索的第二大脑能够提升可追溯性。

Google News 将继续呈现有关模型偏见的争论。持久的问题在于,开发者和采购方是否会将这些争论转化为可观察、可验证的测试。

不要问 AI 是否创造了偏见。应当问:谁衡量了这种继承而来的模式,谁放大了它,谁能够提出质疑,以及证据出现后发生了什么改变。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page