簡介:歡迎來到「量度個體差異」(Measuring Differences)
歡迎閱讀 OCR A Level 心理學(H567)個體差異領域(Individual Differences area)的溫習筆記!在這一章中,我們會透過兩項具里程碑意義的核心研究(Core Studies),深入探討「量度個體差異」(Measuring differences)這個核心主題:
• 經典研究(Classic Study):Gould, S. J. (1982) – 《笨蛋的一統天下》(A nation of morons)(針對 Robert Yerkes 於 1917 年第一次世界大戰智力測驗的批判性評論)
• 當代研究(Contemporary Study):Hancock, J. T., Woodworth, M. T., & Porter, S. (2011) – 《像狼一樣飢渴:心理病態者語言的用詞模式分析》(Hungry like the wolf: A word-pattern analysis of the language of psychopaths)
為甚麼心理學家要量度個體差異?因為我們希望了解人類行為出現差異的原因——從智力等認知能力,到心理病態等性格特質。然而,要準確量度內在的心理狀態是極為困難的。如果量度工具存在缺陷、偏見或被濫用,後果可能會對社會造成災難性的影響。讓我們馬上開始探討吧!
---第一部分:經典研究 – Gould (1982) / Yerkes (1917)
研究背景與目的(Background & Aim)
1917 年第一次世界大戰期間,心理學家 Robert Yerkes 希望證明智力是一種與生俱來、由基因遺傳的特質。同時,Yerkes 亦有其專業野心:他希望透過對應徵入伍的軍人進行大規模的心理測量(psychometric testing),將心理學確立為一門嚴謹、客觀的「硬科學」(hard science)。
數十年後的 1982 年,演化生物學家兼散文家 Stephen Jay Gould 發表了一篇題為《笨蛋的一統天下》(A Nation of Morons)的評論文章。Gould 的目的是揭露 Yerkes 測驗計劃中嚴重的研究方法缺陷、種族中心主義(ethnocentric)的文化偏見,以及其所帶來的悲劇性政治後果。
考試避坑貼士(避免常見錯誤):請記住,Gould 並沒有親自進行軍隊測驗!真正於 1917 年進行實證測驗的是 Robert Yerkes;Gould 只是在 1982 年撰寫批判文章重新評估相關數據。
樣本與參與者(Sample & Participants)
Yerkes 在一戰期間測試了約 \(1.75\text{ million}\)(175 萬)名美國陸軍新兵。這個龐大的樣本包括美國本土出生的白人、非裔美國人,以及來自不同背景的歐洲新移民。
三種標準化智力測驗(The Three Standardised Intelligence Tests)
Yerkes 設計了三種不同的標準化測驗途徑:
1. 陸軍甲種測驗(Army Alpha):專為具備英文讀寫能力者設計的筆試。共包含 \(8\) 個部分,包括類比推理、數列填空,以及測試常識的選擇題(例如識別美國商業品牌名稱,如 Crisco 起酥油)。
2. 陸軍乙種測驗(Army Beta):專為文盲或不諳英語的新兵設計的圖像非語言測驗。共包含 \(7\) 個部分,例如迷宮尋路和圖片補缺任務(例如替畫中的小提琴補上缺失的弦線,或替留聲機畫上缺失的喇叭)。
3. 個人檢驗(Individual Examination):專為在陸軍乙種測驗中不及格的新兵而設的個別口試。
Gould 指出的研究方法缺陷(Methodological Failures Identified by Gould)
Gould 強調了 Yerkes 進行研究時出現的幾項重大缺陷:
• 執行與分流標準不一(Inconsistent Administration & Sorting):不同軍營對「識字」的判定標準差異極大。當排隊等候乙種測驗的人龍太長時,不識字的新兵會被硬塞去考甲種筆試,導致他們理所當然地獲得零分。
• 嚴重的文化偏見與種族中心主義(Severe Cultural Bias & Ethnocentrism):這些測驗量度的根本不是先天的原始智力,而是受試者對美國文化、俚語、商業產品及正規學校教育的熟悉程度。
• 混亂的測驗環境(Chaotic Testing Conditions):測驗在過度擁擠且氣氛令人生畏的大廳中進行,許多新兵此前甚至從未握過鉛筆,更遑論參加標準化考試。
• 後勤執行失敗(Logistical Failures):由於測驗站積壓了大量受試者,個人檢驗實際上極少被執行。
主要研究結果與評分(Key Findings & Scores)
Yerkes 將測驗分數換算為心理年齡(mental ages):
• 平均心理年齡:美國成年白人男性的平均心理年齡僅為 \(13.04\) 歲(僅略高於當時臨床上定義為心理年齡 \(12\) 歲的「愚魯」/「笨拙」[moronity] 門檻)。
• 移民等級階梯:膚色較淺的北歐和西歐移民得分最高;中歐和東歐移民得分明顯較低(例如俄羅斯斯拉夫人的平均心理年齡為 \(10.74\) 歲,意大利人平均為 \(11.01\) 歲)。
• 種族差異:非裔美國新兵的平均得分最低,平均心理年齡僅為 \(10.41\) 歲。
• 「後天環境」(Nurture)的證據:Yerkes 自己的數據顯示,移民在美國居住的時間越長,測驗得分就越高。Yerkes 對此視而不見,但 Gould 指出,這直接證明了測驗表現是受到後天環境適應及英語學習所影響,而非先天的基因能力。
社會影響與政治後果(Social Impact & Political Consequences)
Yerkes 充滿缺陷的數據被政客和優生學家利用,用以論證美國人的整體智力正因移民而下降。這直接導致了《1924年移民限制法案》(Immigration Restriction Act of 1924,即《約翰遜—里德法案》)的通過。該法案以 1890 年的人口普查為基準,設立了嚴格的 \(2\%\) 移民配額,大幅削減了來自南歐和東歐的移民人數。令人痛心的是,這項法案阻止了數以百萬計身處險境的人(包括 1930 年代逃避迫害的猶太難民)前往美國尋求庇護。
Gould 研究的核心總結:Yerkes 試圖透過標準化心理測量來評估先天智力,但 Gould 證明了這些測驗量度的只是文化知識和讀寫能力,從而證明了有缺陷的量度工具會產生極其危險且具高度社會敏感性的後果。
---第二部分:當代研究 – Hancock et al. (2011)
研究背景與目的(Background & Aim)
心理病態(Psychopathy)是一種人格障礙,特徵包括缺乏同理心、情感冷淡淺薄(poverty of affect)、具衝動性以及殘忍無情的操縱行為。心理病態者通常將他人視為可供剝削和利用的資源。
Hancock 等人希望探討心理病態特質是否會在罪犯描述其犯罪過程的語言中無意識地流露出來。他們測試了心理病態者的語言是否反映出:
1. 工具性/掠奪性世界觀(An instrumental / predatory worldview):將謀殺視為一種合乎邏輯、經過策劃的必然結果。
2. 基本生理與物質需求(Basic physiological and material needs):聚焦於生存和物質回報,而非高層次的社會情感需求(基於馬斯洛的需求層次理論 [Maslow's Hierarchy of Needs])。
3. 情感匱乏(Poverty of affect):在情感上抽離,並對自己的罪行產生心理疏離感。
研究設計與樣本(Design & Sample)
• 研究設計:準實驗(Quasi-experiment),結合半結構式訪談及電腦化內容分析。
• 樣本:\(52\) 名被關押於加拿大懲教設施的男性已定罪謀殺犯(自願樣本;全員皆承認有罪)。
• 診斷工具:心理病態程度採用《心理病態檢核表修訂版》(Psychopathy Checklist-Revised, PCL-R)進行評估,這是一項滿分為 \(40\) 分的可靠臨床評估工具。得分達 \(30\) 分或以上(或研究常用的 \(25+\) 分分界線)的參與者被分類為心理病態者。最終樣本包括 \(14\) 名心理病態者及 \(38\) 名非心理病態對照組。
詳細實驗步驟(Procedure: Step-by-Step)
1. 逐步訪談法(The Step-Wise Interview):參與者接受標準化逐步訪談程序的半結構式訪談,研究人員引導他們盡可能詳細地敘述自己的殺人罪行經過。
2. 盲審法(Blinding):訪談員對參與者的 PCL-R 心理病態得分並不知情(雙盲),以避免訪談員偏差(interviewer bias)。
3. 錄音與轉錄:訪談平均持續 \(25\text{ minutes}\)(25 分鐘),過程全程錄音,並逐字轉錄成文字稿。
4. 電腦語言分析軟件:轉錄文本透過兩種自動化軟件工具進行分析:
• Wmatrix:將訪談文本與標準語料庫進行比對,分析語意概念(例如食物、金錢、家庭)及語法詞性(例如連詞、動詞時態)。
• DAL(語言情感辭典 / Dictionary of Affect in Language):分析所用詞彙的情感效價(pleasantness/愉悅度)、情緒強度及情感意象。
主要研究結果:心理病態者的語言特徵(Key Findings: The Language of Psychopaths)
Hancock 等人發現了三種明顯的語言標記(linguistic markers):
1. 工具性與從屬連詞(Instrumentality & Subordinating Conjunctions):
心理病態者使用了顯著較多的因果/從屬連詞(例如 because [因為]、since [由於]、so that [以便]、in order to [為了])。這表明他們將暴力犯罪視為實現特定目標的工具性因果手段。
2. 馬斯洛需求層次(Maslow's Hierarchy of Needs):
心理病態者使用了顯著較多與低層次基本生理及物質需求相關的詞彙(例如 food [食物]、drink [飲料]、money [金錢]、shelter [住所]、clothing [衣物])。相比之下,非心理病態對照組則使用了顯著較多與高層次社會情感需求相關的詞彙(例如 family [家庭]、religion [宗教]、love [愛]、spirituality [心靈精神])。
3. 情感匱乏與心理疏離(Poverty of Affect & Psychological Distancing):
• 過去時態動詞:心理病態者使用了顯著較多的過去時態動詞(例如 happened [發生了]、stated [陳述道]),而非現在時態動詞,以此在心理上拉開與自己暴力行為的距離。
• 言語不流暢(Speech Disfluencies):心理病態者使用的贅詞/填充詞(如 um 和 uh 等)高出 \(33\%\)。這表明更高的認知負荷(cognitive load):要在沒有真實情感回憶的情況下編造出一個情感平淡的故事,需要耗費更多的腦力。
• 情感平淡化:DAL 分析證實,他們的敘述在情緒強度上較低,且令人感到較不愉快。
研究結論(Conclusions)
• 心理病態者在描述犯罪時,展現出一種獨特、情感抽離、理性且具工具導向的模式。
• 心理病態性格特質會留下細微、無意識的語言指紋(linguistic fingerprints),這些特徵可以透過自動化電腦文本分析準確捕捉。
Hancock et al. 研究的核心總結:與心理病態者容易操縱答案的自我報告問卷不同,自動化文本分析(Wmatrix 和 DAL)提供了一種客觀、科學的方法來量度深層的心理差異。
---第三部分:比較分析與核心主題(Comparative Analysis & The Key Theme)
核心主題:量度個體差異(Measuring Differences)
兩項研究都探討了心理學家用來量度複雜心理特質的方法(Gould/Yerkes 研究智力;Hancock et al. 研究心理病態人格)。
Gould 與 Hancock et al. 的相似之處
• 標準化(Standardisation):兩項研究都採用了標準化的測驗或訪談程序(Yerkes 的甲種/乙種測驗指引;Hancock 的逐步訪談程序及 PCL-R 診斷門檻)。
• 抽樣偏誤(Sampling Bias):兩項研究均全數依賴男性、受機構監管/軍隊樣本,限制了推論至更廣泛人群的普遍性(generalizability)。
Gould 與 Hancock et al. 的相異之處
• 研究方法的客觀性(Methodological Objectivity):Gould 揭示了 Yerkes 如何使用主觀、具文化偏見且容易出現人為錯誤和行政混亂的紙筆測驗。相反,Hancock et al. 使用了客觀的自動化電腦軟件(Wmatrix 和 DAL),消除了研究人員的主觀詮釋偏差。
• 構念效度(Construct Validity):Yerkes 聲稱量度先天智力,實際上量度的卻是文化同化程度與識字水平。Hancock et al. 則成功捕捉了符合臨床診斷標準(PCL-R)的有效、無意識心理病態標記。
• 樣本規模(Sample Size):Yerkes 調查了龐大的樣本(\(1.75\text{ million}\)),而 Hancock et al. 則使用了規模較小、具針對性的樣本(\(52\) 名已定罪謀殺犯)。
Hancock et al. 在多大程度上改變了我們的理解?
• 從靜態量度到動態量度:早期的心理測量依賴往往帶有文化偏見的靜態紙筆測驗。Hancock et al. 將我們的理解轉向動態、隱蔽的行為量度(無意識的用詞模式)。
• 科技演進:Hancock et al. 展示了現代電腦輔助技術在量度敏感的個體差異時,如何能夠減少研究人員偏差和人為錯誤。
第四部分:OCR 領域、視角與爭論(Areas, Perspectives, and Debates)
1. 個體差異領域(The Individual Differences Area)
該領域的核心假設是每個人都擁有獨特的心理特徵,我們可以透過量度這些差異來量化並理解人類行為。兩項研究都展示了心理學家如何嘗試將人群沿著特定光譜(智力與性格特質)進行分類。
2. 心理學作為一門科學(Psychology as a Science)
• Yerkes (Gould):試圖透過大規模量化使心理學成為一門硬科學,但未能控制混淆變量(讀寫能力、測驗環境、文化背景),從而削弱了科學效度。
• Hancock et al.:展現了高度的科學嚴謹性:標準化的逐步訪談、雙盲程序、透過 PCL-R 確立的高評分者間信度(inter-rater reliability),以及自動化且具可證偽性(falsifiable)的電腦演算法。
3. 具社會敏感性的研究與種族中心主義(Socially Sensitive Research & Ethnocentrism)
• Gould 研究中的種族中心主義:Yerkes 的測驗預設了高智商的標準就是美國白人的文化素養。所得數據助長了種族歧視、優生學以及具歧視性的移民法案。
• Hancock 研究的應用與倫理:雖然電腦化文本分析在罪犯側寫(criminal profiling)、假釋評估和司法風險評估中具備極具前景的應用價值,但僅憑語言標記將個人貼上心理病態標籤,背負著重大的倫理責任。
4. 先天與後天爭論(Nature vs. Nurture)
• Gould:Yerkes 聲稱智力是 \(100\%\) 先天決定(天生/遺傳)的,但測驗成績與在美居住年期之間的正相關,恰恰證明了後天環境(教育與生活環境)的強大影響力。
• Hancock et al.:表明心理病態表現為一種潛在的、硬編碼(hard-wired)的認知和情感差異,並會在無意識中塑造言語輸出。
第五部分:常見錯誤與溫習避坑指南
• 陷阱一:「Gould 測試了 175 萬名男性。」
糾正:大錯特錯!是 Robert Yerkes 於 1917 年收集了數據。Stephen Jay Gould 是在 1982 年撰寫評論/批判文章來分析 Yerkes 的研究方法。
• 陷阱二:「Hancock 研究中的心理病態者只是說了更多粗言穢語。」
糾正:作答必須精準!你在考試中必須明確指出特定的語言標記:從屬/因果連詞(例如 because)、基本生理/物質需求詞彙(例如 food, money)、過去時態動詞,以及言語不流暢(例如 um, uh 等填充詞出現率高出 \(33\%\))。
• 陷阱三:「陸軍甲種測驗是圖像式的,乙種測驗是筆試。」
糾正:剛好相反!甲種(Alpha)= 筆試(適用於具英語讀寫能力者);乙種(Beta)= 圖像測驗(適用於文盲及不諳英語者)。
• 陷阱四:「Yerkes 證明了移民的智商較低。」
糾正:Yerkes 的測驗缺乏效度。Gould 證明了該測驗量度的只是英語讀寫能力和對美國文化的熟悉度,而非先天的認知能力。
快速溫習清單(Quick Summary Checklist)
• Gould (1982):對 Yerkes (1917) 的批判性評論 – \(1.75\text{ million}\) 一戰新兵 – 甲種、乙種、個人檢驗 – 存在文化偏見 – 平均心理年齡僅 \(13.04\) 歲 – 導致 1924 年移民限制法案出台。
• Hancock et al. (2011):準實驗 – \(52\) 名加拿大男性謀殺犯(經 PCL-R 評估為 \(14\) 名心理病態者,\(38\) 名非心理病態者) – 逐步訪談法 – Wmatrix 與 DAL 軟件 – 發現從屬連詞增多、聚焦馬斯洛基本需求、多用過去式動詞及言語不流暢度提高。
• 核心主題聯繫:展示了心理量度如何從早期充滿缺陷、主觀的紙筆測驗,演變為客觀、自動化的語言特徵分析。