提到AI偏見,大多數人先想到種族、性別或者年齡。但一項最近放上arXiv的研究把目光投向了更少被討論的群體——智力障礙人群。研究者想知道,聊天AI在描述這類人時,會不會藏著一些不易察覺的刻板印象。
實驗設計相當乾脆。他們挑了五個主流大模型:OpenAI的GPT-4-Turbo和GPT-4o、Meta的Llama-3-70B-Instruct、Anthropic的Claude-3-5-Sonnet,以及Mistral的Mistral-Large。每個模型都基於10組提示詞寫故事,每組提示詞又分「帶智力障礙描述」和「不帶描述」兩個版本。這樣一輪跑下來,總計生成了25000篇故事。
用故事「釣」出隱藏態度
為什麼用故事生成來測偏見?因為直接問模型「你對智力障礙人群有什麼看法」,它八成會給你一套政治正確的套話。但當它自由發揮寫故事時,角色設定、性格標籤、情節走向都會暴露模型的真實傾向。分析工作交給另一個GPT-4-Turbo例項,它會對照文獻裡提到過的偏見主題,比如童化、依賴化、弱勢化,去標記故事裡的呈現差異。
最終結果讓人有點不安:一旦角色被標註為智力障礙,AI更傾向於把他們寫得天真、順從、需要被照顧,同時也較少賦予他們專業身份或做主的機會。這種差異不是極端的歧視,而是一種更微妙的「善意疊加」——反而更值得警惕。
每個模型的「偏見指紋」不同
不同模型之間的表現並不一致。有的模型在多次生成中反覆出現類似的「庇護式」語氣,有的則相對中立。這說明偏見不是大模型的統一印記,而是和訓練資料、對齊策略直接掛鉤的工程問題。對開發者而言,這種差異意味著通過調整資料配比或加入針對性測試,偏見是有可能被壓低的。
現實影響:AI聊天中的「隱性降維」
這項研究的價值不止於學術。現在不少客服、教育、心理健康產品都接入了大模型,如果底層模型對智力障礙使用者抱有隱性成見,AI回覆可能會不自覺地把對方當作「永遠的孩子」,而不是一個有自主能力的成年人。換句話說,技術本應賦能,卻可能在無形中放大了社會已有的刻板印象。
- 開發者應該把類似的故事生成測試納入模型評估流程,不能只看基準分數。
- 使用者在使用AI輔助工具時,如果感覺回覆的語氣怪異得「過度關愛」,也可以多留個心眼。
下一步:把偏見「釣」出來再抹掉
好在,這項研究也提供了一個可復現的檢測思路:用簡單的提示詞變化就能讓隱性偏見顯形。研究者建議在訓練階段加入更多關於殘障人士的正面、自主的敘事樣本,並在生成端增加偏見篩選邏輯。檢測只是第一步,修正才是更漫長的工程。
作為長期關注AI倫理的編輯,我很高興看到有研究專門盯著這個「隱形角落」。畢竟,一個真正公平的AI,應該平等對待每一個人——包括那些大多數時候想不起來的少數群體。











評論
暫無評論
成為第一個評論的人