歡迎來到 Paper 3:研究綜合回顧(Synoptic Review of Studies)

歡迎來到 Pearson Edexcel A Level 心理學課程中最充實、最有收穫的部分之一!在 Paper 3(Psychological Skills - 9PS0/03) 中,Section B 完全專注於研究綜合回顧(Synoptic Review of Studies)。在 Paper 3 滿分 80 分中,本部分佔了 24 分之多。

「綜合(Synoptic)」一詞的意思其實很簡單,就是「採取全面、整體的視角」。你不再需要孤立地看待各個課題中的研究,而是要融會貫通整個課程所學的知識,運用一套通用的評估工具,將經典研究(Classic Studies)與現代當代研究(Contemporary Studies)進行比較。

剛開始比較多項研究時感到有挑戰性?不用擔心!只要掌握了萬能的評估架構(GRAVE-SO),你就能滿懷信心去評估和對比任何一對研究。

---

1. 核心評估架構:GRAVE-SO

每當你在 Section B 遇到要求評估、對比或回顧研究的題目時,都可以運用 GRAVE-SO 準則來組織思維。這能確保你涵蓋 Pearson Edexcel 課程綱要所要求的所有研究方法標準。

GRAVE-SO 各項參數詳細拆解:

G — 推論度 / 代表性(Generalisability):
研究結果能否推廣至更廣泛的目標受眾?
• 檢視樣本大小、年齡、性別、文化背景,以及樣本是否存在種族中心主義偏誤(ethnocentric)男性中心主義偏誤(androcentric)
• 思考總體效度(population validity)(樣本能否代表廣大公眾?)與生態效度(ecological validity)(實驗環境是否反映日常生活?)。

R — 可信度 / 信度(Reliability):
研究是否能被重複進行並得出一致的結果?
• 尋找高程度的標準化程序(standardisation)(相同的指導語、時間控制、實驗環境)。
• 考慮評分者間信度(inter-rater reliability)(多位觀察者或評分員給出的分數是否一致?)。

A — 應用價值(Application):
研究結果在現實世界中有何實用價值?
• 它們能否幫助改善學校教育、推動法庭程序改革、減少社區偏見,或為精神障礙的臨床治療提供依據?

V — 效度(Validity):
研究是否真正測量了它聲稱要測量的內容?
內部效度(Internal validity):無關變項(extraneous variables)和混淆變項(confounding variables)是否受到嚴格控制?
表面真實性(Mundane realism):實驗任務是否貼近人們在日常生活中的真實活動?
歷史效度(Historical validity):研究結果在今天是否依然適用,抑或只是特定時代背景下的產物?

E — 研究倫理(Ethics):
研究人員是否遵守了英國心理學會人類研究倫理守則(BPS Code of Human Research Ethics)
• 考慮知情同意(informed consent)、保護參與者免受身體及心理傷害(protection from harm)、退出權(right to withdraw)、保密原則(confidentiality)、欺瞞(deception)以及事後充分解說(debriefing)。

S — 科學可信度(Scientific Credibility):
該研究是否具備客觀可檢驗性、可證偽性(falsifiable)、實證性(empirical),並經過同行評審(peer review)?

O — 客觀性 vs. 主觀性(Objectivity vs. Subjectivity):
研究人員收集的是客觀、不帶偏見的量化數據(quantitative data),還是依賴個人主觀詮釋的質化數據(qualitative data)?

核心應試技巧:每當你在 Section B 看到要求評估或比較的題目,直接圍繞 G-R-A-V-E-S-O 準則來構建你的段落。

---

2. 核心研究課題全方位綜合回顧

以下是 Topic 1 至 Topic 5 必修經典研究與當代研究的完整指南。請留意每組研究如何運用不同的研究方法來探討相似的主題。

---

Topic 1: 社會心理學(Social Psychology)

經典研究:Sherif et al. (1954/1961) — 群際衝突與合作:羅伯斯山洞實驗(The Robbers Cave Experiment)

研究目的與核心重點:探討群際衝突與偏見是否因爭奪稀缺資源而產生(現實衝突理論,Realistic Conflict Theory),以及為共同的超級目標(superordinate goals)(需要兩組群體通力合作才能完成的目標)合作能否減少這種摩擦。
實驗程序摘要:22 名年齡介乎 11 至 12 歲、來自美國中產家庭的白人新教徒男童,被安排入住奧克拉荷馬州羅伯斯山洞州立公園的模擬夏令營。他們被隨機分為兩組(「響尾蛇隊」與「老鷹隊」)。第一階段建立內群體規範(in-group norms);第二階段透過各項競爭性錦標賽(如棒球賽、拔河等)引入摩擦與對立;第三階段引入超級目標(如修復營地損壞的供水系統、合力拉動拋錨的卡車)。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):低。樣本具種族中心主義及男性中心主義偏誤(全部為年齡和文化背景相同的男童)。
- 信度(Reliability):由於身處天然實地環境(field setting),難以完全複製,不過 Sherif 採用了標準化的觀察記錄表。
- 應用價值(Application):在化解社區衝突、推動學校反種族隔離政策,以及透過共同目標促進國際外交等方面,具有強大的現實應用價值。
- 效度(Validity):生態效度高(男童相信這是一個真實的夏令營),但研究人員充當營地輔導員,存在極高的研究者偏誤(researcher bias)風險。
- 研究倫理(Ethics):涉及欺瞞手段;男童經歷了真實的心理困擾與敵意;知情同意僅由家長簽署,而非來自男童本人。

當代研究:Burger (2009) — 重現米爾格倫研究:現代人依然會服從嗎?

研究目的與核心重點:探討在現代樣本中,人們的服從水平是否仍與 Milgram 1963 年的經典發現一致,同時引入嚴格的倫理防護措施。
實驗程序摘要:採用兩步驟篩選程序剔除具情緒脆弱傾向的受試者。實驗將最大電擊電壓限制在 150V(即 Milgram 原研究中「學習者」首次發出尖叫、被視為「不可逆轉點」的電壓)。實驗設有兩個組別:基準組(Base Condition)組別 2(示範拒絕組,Model Refusal),後者安排了一名假被試(同謀)在 90V 時拒絕繼續。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):優於 Milgram 原版研究;樣本涵蓋了不同教育水平及種族背景的成年男女。
- 信度(Reliability):高度標準化的實驗室程序(相同的指導語腳本、催促語及儀器),方便精確複製。
- 應用價值(Application):證明了對權威的盲目服從隨着時間推移依然高度穩定,為警察、醫護人員及軍事部隊的專業培訓提供了實證依據。
- 效度(Validity):由於實驗室控制嚴格,內部效度極高;但表面真實性較低(因學習詞對而施加電擊並非日常任務)。
- 研究倫理(Ethics):較 Milgram 顯著改善。預先篩除了脆弱受試者、給予 3 次明確的書面退出權提醒、將最高電壓限制在 150V,並提供即時的事後解說。

---

Topic 2: 認知心理學(Cognitive Psychology)

經典研究:Baddeley (1966b) — 長期記憶中的語音與語意相似性

研究目的與核心重點:探討短期記憶(STM)與長期記憶(LTM)的編碼方式主要依賴語音編碼(acoustic code,聲音)還是語意編碼(semantic code,意思)。
實驗程序摘要:參與者學習來自四個不同詞表的詞語序列:語音相似(如 man, can, cat)、語音相異(如 pit, day, cow)、語意相似(如 great, large, big)及語意相異(如 hot, old, late)。在完成干擾任務並經過 20 分鐘延遲後,測試其長期記憶回憶表現。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):英國大學生/志願者樣本可能無法代表所有年齡組別或非英語母語者的資訊處理模式。
- 信度(Reliability):標準化程度極高(嚴格控制詞語呈現時間、固定干擾任務),極易複製。
- 應用價值(Application):為溫習與記憶技巧提供指引;學生由此明白 LTM 依賴語意編碼,因此理解概念遠比死記硬背更有效。
- 效度(Validity):內部效度高,但表面真實性低,因為背誦人造詞表並不符合日常生活的記憶需求。
- 研究倫理(Ethics):高度符合倫理要求;無欺瞞行為、無造成心理困擾,且獲得了參與者的完全知情同意。

當代研究:Sebastian and Hernández-Gil (2012) — 言語數據數字廣度的發展模式

研究目的與核心重點:探討 5 至 17 歲西班牙兒童語音循環(phonological loop,以數字廣度 digit span 測量)的發展軌跡,並將其表現與成年人及臨床失智症群組進行比較。
實驗程序摘要:570 名無聽力或認知障礙的西班牙本土兒童接受了個別標準化數字廣度測試(回憶長度遞增的數字序列)。結果顯示數字廣度隨年齡增長直至 17 歲(達到 \(5.91\)),該數值低於英語母語者的平均水平(\(\approx 7\)),這是由於西班牙語數字單詞的詞長效應所致。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):樣本量大(\(n = 570\)),涵蓋廣泛年齡層,但特定針對西班牙語人口。
- 信度(Reliability):標準化的數字廣度測試方案使得研究極易重複驗證。
- 應用價值(Application):建立了基準常模,有助於識別發育期語言障礙,並監測阿茲海默症患者的認知退化情況。
- 效度(Validity):在測試工作記憶模型(Working Memory Model)的子成分(語音循環)方面具有很高的構念效度(construct validity)。
- 研究倫理(Ethics):嚴格遵守兒童保護指引,取得家長知情同意,並在舒適的環境中進行測試。

---

Topic 3: 生理心理學(Biological Psychology)

經典研究:Raine, Buchsbaum & LaCasse (1997) — 正電子發射斷層掃描(PET)顯示殺人犯的腦部異常

研究目的與核心重點:探討被控謀殺但因精神失常理由不認罪(NGRI)的個體,與配對對照組相比是否存在局部腦功能障礙。
實驗程序摘要:41 名 NGRI 殺人犯(39 男 2 女)在年齡、性別及思覺失調症診斷(如適用)上與 41 名對照組參與者進行配對。在注射氟代脫氧葡萄糖(FDG)之前及注射期間,參與者進行了 32 分鐘以目標識別為核心的持續注意力測試(CPT),隨後進行 PET 腦部掃描
核心發現:NGRI 組在前額葉皮質(prefrontal cortex)胼胝體(corpus callosum)的葡萄糖代謝率顯著降低,並在杏仁核(amygdala)內側顳葉(medial temporal lobe)表現出左右不對稱活動。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):樣本僅限於 NGRI 殺人犯;無法推廣至所有暴力罪犯或一般大眾。
- 信度(Reliability):標準化的 CPT 任務與客觀的 PET 成像技術提供了極高的重測信度。
- 應用價值(Application):審慎地為衝動控制的神經生物學理論提供依據,但 Raine 強調 PET 掃描不能單獨用作法庭定罪的唯一證據。
- 效度(Validity):PET 提供了客觀的生理數據,但該研究屬於相關性研究——腦部異常並不能證明與暴力行為存在直接因果關係。
- 研究倫理(Ethics):NGRI 參與者本就出於司法辯護需要而接受 PET 掃描,從而減少了額外的倫理傷害;然而,注射放射性追蹤劑仍帶有輕微的生理風險。

當代研究:Brendgen et al. (2005) — 遺傳與環境因素對 6 歲雙胞胎身體攻擊與社會攻擊的影響

研究目的與核心重點:探討遺傳與環境因素對身體攻擊(physical aggression)社會/關係攻擊(social aggression)的相對貢獻。
實驗程序摘要:從魁北克新生雙胞胎研究中招募了 234 對 6 歲雙胞胎(同卵雙胞胎 [MZ] 與異卵雙胞胎 [DZ])。攻擊行為由教師(使用標準化問卷)和同儕(使用照片提名冊)各自獨立評定。
核心發現:身體攻擊主要受遺傳因素影響(MZ 雙胞胎的相關性顯著高於 DZ 雙胞胎),而社會攻擊則主要受非共享環境因素(non-shared environmental factors)影響。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):雙胞胎研究的結果有時推廣至單胎兒童時存在局限,但龐大的隊列樣本增強了總體效度。
- 信度(Reliability):獨立的教師評定與同儕評定之間具有高度的一致性(inter-rater reliability)。
- 應用價值(Application):提示幼童早期介入措施應從生物/發育角度針對身體攻擊,而對社會攻擊則應透過社會學習與同儕關係進行干預。
- 效度(Validity):在學校環境中進行自然觀察,避免了人為實驗室環境帶來的偏誤。
- 研究倫理(Ethics):同儕提名法需謹慎處理,以防在課堂中引發同儕摩擦或標籤效應。

---

Topic 4: 學習理論(Learning Theories)

經典研究:Watson & Rayner (1920) — 條件反射性情緒反應(小艾伯特實驗 Little Albert)

研究目的與核心重點:證明人類的情緒反應(如恐懼與恐懼症)可透過古典制約(classical conditioning)後天習得。
實驗程序摘要:向 11 個月大的嬰兒「小艾伯特」展示一隻白鼠(中性刺激 Neutral Stimulus)。當他伸手觸碰時,研究人員在其身後用鐵鎚敲擊懸掛的鋼條(非條件刺激 Unconditioned Stimulus),引發恐懼反應(非條件反應 Unconditioned Response)。經過多次配對後,單獨看見白鼠便會引發恐懼(條件反應 Conditioned Response)。研究亦證明恐懼產生了泛化(generalise),延伸至相似刺激(如兔子、毛皮大衣、聖誕老人面具)。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):單一參與者(\(n = 1\)),且氣質特殊;無法可靠地代表所有嬰兒。
- 信度(Reliability):制約程序記錄了清晰的基準線測試與刺激呈現過程,但按現代標準來看,精準控制程度仍顯不足。
- 應用價值(Application):為理解恐懼症的形成奠定了實證基礎,並促成了逆向制約(counter-conditioning)療法的發展。
- 效度(Validity):在即時關聯方面內部效度較高,但由於實驗室環境極具人工痕跡,缺乏生態效度。
- 研究倫理(Ethics):按現代標準屬於極不符合倫理。對嬰兒造成了嚴重的心理創傷,且在艾伯特離開醫院前未為其進行系統性的消除制約(de-conditioning)。

當代研究:Capafóns et al. (1998) — 系統減敏法治療飛行恐懼症

研究目的與核心重點:評估系統減敏法(Systematic Desensitisation, SD)對飛行恐懼症(aerophobia)的治療成效。
實驗程序摘要:41 名飛行恐懼症患者被分配至實驗治療組(\(n = 20\))或等候名單對照組(\(n = 21\))。治療包含放鬆訓練結合漸進式暴露(體內實境暴露 in vivo 及錄影模擬暴露)。在模擬飛行場景中,利用自陳診斷量表及生理指標(心率、肌肉張力、指溫)測量治療成效。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):良好的成年臨床樣本,但僅特定適用於飛行恐懼症。
- 信度(Reliability):標準化的治療方案(固定的療程次數及統一的暴露材料)。
- 應用價值(Application):證明行為療法能可靠地減少認知焦慮與生理恐懼反應,幫助患者恢復搭乘飛機的能力。
- 效度(Validity):同時結合客觀生理指標與主觀自陳報告,減少了偏誤並提升了構念效度。
- 研究倫理(Ethics):等候名單設計確保對照組參與者在研究結束後亦能接受治療,維持了倫理上的公平性。

---

Topic 5: 臨床心理學(Clinical Psychology)

經典研究:Rosenhan (1973) — 瘋狂場所中的正常人(On Being Sane in Insane Places)

研究目的與核心重點:探討精神科醫護人員能否可靠地區分健全者與精神失常者,並揭示精神科標籤的巨大影響力。
實驗程序摘要:8 名假病人聲稱自己聽到「空洞、砰(empty, hollow, thud)」的聲音,從而成功入住美國 5 個州的 12 間不同精神病院。入院後,他們立即停止模擬任何症狀,表現正常,並在筆記本上記錄觀察所得。
核心發現:所有假病人均被准予入院;11 人被診斷為思覺失調症(Schizophrenia),1 人被診斷為躁狂抑鬱性精神病。醫護人員無一人識破(儘管許多真實病人對其產生懷疑)。平均住院時間為 19 天。他們的正常行為(如做筆記、提早排隊等候午餐)均被曲解為患病症狀(「診斷標籤的黏著性」stickiness of diagnostic labels)。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):機構推論度高(涵蓋 5 個州的 12 間醫院,從私立醫院到資源不足的公立診所均有涉及)。
- 信度(Reliability):入院時的症狀報告高度標準化,但實地筆記依賴個人主觀觀察。
- 應用價值(Application):推動了精神病診斷體系的重大改革,並加速了 DSM 診斷準則的修訂(從 DSM-III 開始)。
- 效度(Validity):生態效度極高(在真實醫院環境中進行的隱蔽實地實驗)。
- 研究倫理(Ethics):對醫院工作人員構成嚴重欺瞞;分薄了原本用於照顧真實病人的醫療資源;假病人無法在提出要求後即時出院。

當代研究:Carlsson et al. (2000) — 思覺失調症的神經網絡交互作用:多巴胺與麩胺酸

研究目的與核心重點:回顧神經化學實證,透過探討麩胺酸缺乏(glutamate deficiency)(NMDA 受體功能減退)如何與多巴胺通路交互作用,重新審視傳統的多巴胺假說(dopamine hypothesis)。
實驗程序摘要:結合腦部造影、動物模型(例如使用 PCP 和氯胺酮等 NMDA 拮抗劑)以及死後人體腦組織分析的綜合文獻回顧(meta-analytic literature review)。
關鍵評估要點(GRAVE):
- 推論度(Generalisability):匯集了人類與動物模型的多元研究,所得結論廣泛適用。
- 信度(Reliability):依賴已發表且經過同行評審的生物化學及神經造影研究。
- 應用價值(Application):促進了新型非典型抗精神病藥物(atypical antipsychotics)的研發,這類藥物同時針對多巴胺與麩胺酸系統,運動神經副作用更少。
- 效度(Validity):理論效度高,綜合了多方面的實證數據,構建出更完整的生物學解釋。
- 研究倫理(Ethics):屬於次級文獻回顧研究,不涉及直接的人類參與者困擾。

---

3. 經典研究 vs. 當代研究對比矩陣表

在解答 Section B 的對比型試題時,可參考以下速查摘要表來對比各項研究:

Topic 1: 社會心理學
經典:Sherif et al. (1954/1961) — 實地實驗;生態效度高;缺乏現代倫理防護措施;聚焦於群體層面的衝突。
當代:Burger (2009) — 實驗室實驗;生態效度較低;遵循嚴格的現代 BPS 倫理防護指引;聚焦於個體層面的服從。

Topic 2: 認知心理學
經典:Baddeley (1966b) — 詞語序列回憶;確立了英國成年人 STM 的語音編碼與 LTM 的語意編碼特性。
當代:Sebastian & Hernández-Gil (2012) — 跨年齡發育階段(\(5\text{--}17\) 歲)的數字廣度測試;證明語音循環容量隨年齡增長而擴大,並受西班牙語詞長影響。

Topic 3: 生理心理學
經典:Raine et al. (1997) — PET 神經造影;探討 NGRI 殺人犯前額葉及皮質下區域的局部腦部異常。
當代:Brendgen et al. (2005) — 雙胞胎研究法;區分了遺傳因素(身體攻擊)與環境因素(社會攻擊)的不同影響。

Topic 4: 學習理論
經典:Watson & Rayner (1920) — 單一嬰兒個案實驗室研究;利用古典制約習得恐懼症;倫理水平低。
當代:Capafóns et al. (1998) — 對照臨床試驗;利用系統減敏法治療恐懼症,並結合生理與自陳指標;倫理水平高。

Topic 5: 臨床心理學
經典:Rosenhan (1973) — 隱蔽實地研究;揭示了診斷效度的缺失、機構去人性化(depersonalisation)以及精神科標籤的定型力量。
當代:Carlsson et al. (2000) — 神經化學回顧/元分析;將生物學模型由單純的多巴胺擴展至麩胺酸的交互作用。

---

4. 常見扣分陷阱與應對策略

考官在批改 Section B 時經常指出以下典型錯誤:

1. 純粹描述而缺乏評估(陷入 AO1 vs. AO3 陷阱):
常見錯誤:寫了滿滿兩頁紙詳細描述兩項研究的實驗步驟,卻沒有直接將它們進行對比。
應對策略:保持論述平衡。簡要列出研究特點(AO1),隨即運用 GRAVE-SO 準則進行評估或對比(AO3)。

2. 混淆生態效度(Ecological Validity)與表面真實性(Mundane Realism):
常見錯誤:寫道「Baddeley 的研究缺乏生態效度,因為背誦詞表不真實。」
應對策略:背誦詞表是一項人為的任務(缺乏表面真實性)。實驗室房間是一個非自然的環境(缺乏生態效度)。切記分清這兩個概念!

3. 作出空泛籠統的批評:
常見錯誤:寫道「Burger 比 Milgram 更符合倫理」「Raine 的控制做得很好」
應對策略:提供具體的操作細節。例如寫成:「Burger 透過兩步驟心理排除程序篩選參與者,並將電壓上限設定在 150V,從而提升了研究倫理。」

4. 時代錯誤(Historical Anachronism):
常見錯誤:以 2020 年代的現代 BPS 指引去苛責 Watson & Rayner (1920)。
應對策略:理解歷史背景。指出雖然 Watson & Rayner 的研究違反了現代 BPS 關於保護受試者免受傷害的指引,但在 1920 年代尚未建立正式的倫理守則,而該研究正是促成現代倫理防護標準建立的基石之一。

---

5. 本章總結與溫習清單

在參加 Paper 3 Section B 考試前,確保自己能胸有成竹地回答以下問題:

☐ 我能否熟練運用推論度(Generalisability)、信度(Reliability)、應用價值(Application)、效度(Validity)和研究倫理(Ethics)來評估每項經典與當代研究?
☐ 我能否解釋現代當代研究是如何在經典研究的基礎上進行拓展、複製或改良的?
☐ 我能否將 Raine 或 Baddeley 的量化客觀性,與 Rosenhan 或 Sherif 的質化觀察進行深入對比?
☐ 我能否清楚說明 Burger (2009) 相比於以往的服從研究在倫理上作出了哪些具體改進?

名師致勝錦囊:每當你溫習一項經典研究時,務必同時溫習與之對應的當代研究。養成「成雙成對」思考的習慣,考試時寫起綜合對比論述自然就會行雲流水!