LLM可预测社会科学实验结论,但“硅样本”不能替代真人

作者:

来源: Nature

哈佛团队让GPT-4预测70项真实社科实验(近12万人参与)的结果,发现其能有效区分干预措施效果强弱,但系统性高估效应量约一倍。研究表明LLM可用于辅助预实验和筛选假设,但“合成受访者”缺乏真实体验和利益关联,且可能放大多数群体声音、掩盖少数观点。作者警告AI预测可能制造“理解幻觉”,并需防范其被用于优化有害说服内容。