来源: Nature Health
研究发现,ChatGPT、Grok、Claude等LLM在标准偏见问卷上得分优于人类,但在51个生活情境故事预测任务中,当角色患有HIV、精神疾病或乙肝时,模型对其表现出明显歧视,将之与危险、疏远相关联;中文提示偏见更显著,而逐步推理可减轻偏见。团队提出个体化、相关性过滤等九项缓解策略,呼吁上市前进行情境化偏见审计。
来源: Nature Health
研究发现,ChatGPT、Grok、Claude等LLM在标准偏见问卷上得分优于人类,但在51个生活情境故事预测任务中,当角色患有HIV、精神疾病或乙肝时,模型对其表现出明显歧视,将之与危险、疏远相关联;中文提示偏见更显著,而逐步推理可减轻偏见。团队提出个体化、相关性过滤等九项缓解策略,呼吁上市前进行情境化偏见审计。