歡迎來到 Paper 3 研究方法與統計學溫習指南

同學你好,歡迎!如果你正為 Paper 3: 心理學技能(Psychological skills, 9PS0/03) 備戰,這裡正是最適合你的地方。研究方法(Research Methods)在這份長達 2 小時的試卷中佔了極大比重(佔整個 A Level 總分的 30%)。如果你以往覺得研究方法或統計學很艱深抽象,千萬不用擔心!我們將會一步一步拆解每一個概念,配合清晰的例子、記憶口訣,並緊扣 Edexcel 考官的評分標準。


第 1 部分:科學研究方法 (Scientific Research Methods)

1. 變項與操作化 (Variables and Operationalisation)

在任何心理學研究中,研究員都希望探討改變某一事物是否會對另一事物產生影響。

自變項(Independent Variable, IV):研究員主動操縱或改變的變項,用以觀察其帶來的影響。
因變項(Dependent Variable, DV):研究員所測量的變項,用以評估自變項的效應。
操作化(Operationalisation):指以精確、可測量的方式來界定變項,使研究能夠客觀地進行測試與重複驗證(Replication)。

考試常見陷阱提示: 在考試中切忌寫出含糊不清的操作化變項!不要只寫 「IV 是咖啡,DV 是記憶力」,你必須寫成:「IV 為飲用 200 毫升含咖啡因的咖啡,對比飲用 200 毫升無咖啡因的水;DV 為在一張包含 20 個詞彙的列表中,成功正確回憶出的詞彙數量。」

2. 實驗方法 (Experimental Methods)

心理學家主要使用四種實驗設定:

實驗室實驗(Laboratory Experiment):在高度控制的人工環境中進行,研究員直接操縱自變項並嚴格控制無關變項(Extraneous variables)。優點: 內部效度(Internal validity)高,容易進行重複驗證。缺點: 生態效度(Ecological validity)低(人工環境可能導致不自然的行為),且出現需求特徵(Demand characteristics)的風險較高。
現場實驗(Field Experiment):在自然的真實環境中進行(例如港鐵站或學校),但研究員仍然會特意操縱自變項。優點: 生態效度高於實驗室研究。缺點: 對無關變項的控制較弱;可能涉及知情同意(Informed consent)等倫理問題。
自然實驗(Natural Experiment):研究員利用自然發生的自變項(例如在偏遠島嶼引入電視廣播)。實驗者不會直接操縱自變項。優點: 可以研究因倫理限制而無法以人為方式操縱的真實世界現象。缺點: 無法將受試者隨機分配至不同組別;難以確立直接的因果關係。
準實驗(Quasi-Experiment):自變項基於受試者本身既有的內在特徵(例如年齡、性別,或抑鬱症等臨床診斷)。優點: 能夠在受控條件下比較受試者的獨特特質。缺點: 無法將受試者隨機分配至各組,意味著必然存在混淆的受試者變項(Participant variables)。

3. 實驗設計 (Experimental Designs)

我們該如何將受試者分配到不同的實驗情境(Conditions)中?

獨立組別設計(Independent Measures Design):自變項的每個情境均使用不同的受試者(例如 A 組飲用含咖啡因飲品,B 組飲用無咖啡因飲品)。
優點: 沒有順序效應(Order effects,受試者不會因練習或疲勞而影響表現)。
缺點: 受試者變項(個人差異)可能會混淆實驗結果;需要招募更多受試者。
重複測量設計(Repeated Measures Design):同一批受試者參與自變項的所有情境(例如每位受試者在第 1 天接受咖啡因測試,在第 2 天接受無咖啡因測試)。
優點: 能有效控制受試者變項;所需受試者人數較少。
缺點: 出現順序效應(疲勞、厭煩或練習效應)及需求特徵的風險極高。可透過平衡對抗法(Counterbalancing,即 ABBA 技術)來減輕。
配對組設計(Matched Pairs Design):每個情境使用不同的受試者,但會預先測試並根據與研究相關的關鍵特徵(例如智商、年齡、記憶力)進行一對一配對。配對中的其中一人進入情境 A,另一人進入情境 B。
優點: 在不引入順序效應的情況下減少受試者變項的影響。
缺點: 耗時、難以做到完美配對,且一旦其中一名受試者退出,該組配對數據便會作廢。

4. 非實驗方法 (Non-Experimental Methods)

並非所有心理學問題都能夠或應該透過實驗來探討。Edexcel 要求同學必須掌握以下幾種重要的替代方法:

A. 觀察法 (Observational Methods)

自然觀察 vs. 結構化觀察(Naturalistic vs. Structured):自然觀察是在自然環境中觀察行為而不作任何干預。結構化觀察則在受控環境中使用預設的階段或編碼系統進行記錄。
參與觀察 vs. 非參與觀察(Participant vs. Non-participant):在參與觀察中,研究員會加入被研究的群體之中。在非參與觀察中,研究員則完全以旁觀者身份進行觀察。
隱蔽觀察 vs. 公開觀察(Covert vs. Overt):隱蔽觀察指受試者不知道自己正被觀察(使用隱蔽鏡頭或單向鏡)。公開觀察則指受試者完全清楚觀察者的存在。

B. 自我報告技術 (Self-Report Techniques)

問卷(Questionnaires):書面形式的問題集。可包含封閉式問題(Closed questions)(固定選項,產生定量數據)和開放式問題(Open questions)(自由作答,產生定性數據)。
訪談(Interviews):可分為結構化訪談(按順序朗讀完全相同的固定問題)、非結構化訪談(以一般主題為導向的自由對話),或半結構化訪談(有一組核心固定問題,同時保留進一步深入追問的空間)。

C. 相關研究 (Correlations)

相關研究探討兩個共變項(Co-variables)之間關係的強度與方向(不操縱任何自變項)。
正相關(Positive Correlation):當變項 A 增加時,變項 B 亦隨之增加。
負相關(Negative Correlation):當變項 A 增加時,變項 B 隨之減少。
零相關(Zero Correlation):變項之間不存在任何關聯。
至關重要法則: 相關並不等於因果關係!可能存在未被測量的第三變項導致了該關聯。

D. 課程大綱要求的其他研究方法

個案研究(Case Studies):對單一個人、小群體或獨特事件進行深入、詳細的調查(例如研究一名患有罕見腦損傷的病人)。能收集到豐富的定性數據,但缺乏總體效度(Population validity,無法推廣至整體人群)。
內容分析與主題分析(Content Analysis and Thematic Analysis):用於分析定性數據(例如日記、媒體、訪談記錄)的間接觀察技術。內容分析將定性數據轉化為定量類別(計算出現頻率)。主題分析則以定性方式識別、分析並報告反覆出現的模式/主題。
腦部掃描(Brain Scanning):結構性(例如 CAT、MRI)及功能性(例如 fMRI、PET)成像技術,可直接對活體大腦進行生物學層面的探測。
雙生子與收養研究(Twin and Adoption Studies):透過比較同卵雙胞胎(MZ,共享 100% 基因)、異卵雙胞胎(DZ,共享 50% 基因)之間的一致率(Concordance rates),以及被收養兒童與其親生父母及養父母的相似度,用以評估先天遺傳與後天環境(Nature vs. nurture)的影響。
動物研究(Animal Research):當進行人體實驗不符合倫理或不切實際時使用,具備極高的實驗控制度並可進行跨世代研究,但將結果推廣至人類複雜認知時具有局限性。
統合分析(Meta-Analysis):一種統計技術,結合針對同一主題的多項獨立研究的定量結果,以確立整體效應值(Effect size)。
縱貫研究 vs. 橫斷研究(Longitudinal vs. Cross-Sectional Studies):縱貫研究在一段長時間內持續觀察同一群組(能控制同世代效應,但容易面對樣本流失問題)。橫斷研究則在單一時間點比較不同的年齡組別(省時且成本低,但容易受世代差異影響)。

第 1 部分核心重點: 在考試的情境題目中,務必先準確指出所使用的核心方法。請務必結合題目情境來具體分析優缺點,切忌生搬硬套教科書的籠統定義!


第 2 部分:信度與效度 (Reliability and Validity)

你可以將信度(Reliability)理解為一致性(Consistency),將效度(Validity)理解為準確性或真實性(Accuracy or truthfulness)

1. 信度(一致性)

如果使用相同方法重複進行研究或測量,並能得出相同的結果,該測量便具備信度。

內部信度(Internal Reliability):測量工具內部各部分之間的一致程度(例如抑鬱症問卷中的所有問題是否都在測量同一概念)。
外部信度(External Reliability):測量工具隨時間推移或在不同場合下產生一致結果的程度。
評估信度的方法:
1. 重測信度法(Test-Retest Method):在兩個獨立的時間點,對同一批受試者進行相同的測試。若兩組分數之間的相關性很高,則確立了外部信度。
2. 評分者間信度(Inter-Rater / Inter-Observer Reliability):兩名或以上的獨立觀察員使用相同的行為類別記錄數據,隨後將數據進行相關分析。高度正相關即代表高信度。

2. 效度(真實性與準確性)

效度指一項測試或研究是否真正測量到它聲稱要測量的內容。

內部效度(Internal Validity):因變項所觀察到的變化,是否確實由操縱自變項所引起,抑或是由混淆變項導致?
外部效度(External Validity):研究結果能否推廣至實驗設定以外的情境?
- 生態效度(Ecological Validity):能否推廣至真實生活情境。
- 總體效度(Population Validity):能否推廣至其他人群及目標受眾。
- 時間/歷史效度(Temporal / Historical Validity):能否跨越不同時代推廣。

3. 具體的效度類型

表面效度(Face Validity):最基本的表面檢驗——該測量工具從直觀上看,是否像是能夠測量其預期目標?
建構效度(Construct Validity):測試在多大程度上能夠完整測量潛在的理論概念或建構(例如一項攻擊性測試是否涵蓋了攻擊性理論的所有層面?)。
效標關聯效度/同時效度(Concurrent Validity):將新的測量工具與已確立、經認證測量相同特質的現有測試進行對比(由同一批受試者完成)。強烈的正相關能證實其同時效度。
預測效度(Predictive Validity):測試分數在多大程度上能夠準確預測未來的表現或行為(例如 A-Level 入學評估能否準確預測最終的大學學位成績?)。

第 2 部分核心重點: 記住「浴室磅秤」的比喻!如果一個磅秤每天早上都穩定地顯示比你實際體重重 5 公斤,它具有極高的信度(一致),但完全無效(不準確)。


第 3 部分:統計學與數據處理 (Statistics and Data Handling)

1. 測量層次 (Levels of Measurement)

在進行任何統計計算之前,你必須先確定所收集的數據類型。數據共有三個層次:

1. 類別數據(Nominal Data):分類為明確、互不相交的組別數據。屬於頻率/計數數據(例如統計「吸煙者」與「非吸煙者」的人數,或記錄最喜歡的顏色)。
2. 順序數據(Ordinal Data):可以進行排列名次或排定等級的數據,但各單位之間的差距並不相等或未經標準化(例如跑步比賽中的第 1、2、3 名,或 1 至 10 分的評分量表)。
3. 等距數據(Interval Data):基於標準、固定單位且數值間隔完全相等的精確數學數據(例如攝氏溫度、以秒計算的時間、以公斤計算的重量)。

2. 描述統計學 (Descriptive Statistics)

A. 集中趨勢度量 (Measures of Central Tendency)

平均數(Mean):數學平均值(將所有數值相加後除以總數)。最適用於等距數據。容易受極端異常值影響。
中位數(Median):將數據由小至大排列時的正中間數值。最適用於順序數據。不受極端異常值影響。
眾數(Mode):出現頻率最高的數值。最適用於類別數據

B. 離散程度度量(分數的分散情況)

全距(Range):最高分與最低分之間的差額(計算公式為 \(\text{最高分} - \text{最低分}\) 或 \(\text{最高分} - \text{最低分} + 1\))。計算簡單,但忽略了中間所有數據。
標準差(樣本估計值)(Standard Deviation):一種精密的度量方法,顯示數據點偏離平均數的平均距離。它會運用到每一個單獨的數據點。

Edexcel 課程中的樣本標準差計算公式為:

\(s = \sqrt{\frac{\sum(x-\bar{x})^2}{n-1}}\)

其中:
• \(s\) = 樣本標準差
• \(\sum\) = 「總和」
• \(x\) = 每個獨立的原始分數
• \(\bar{x}\) = 樣本平均數
• \(n\) = 樣本中的總分數個數

3. 推論統計學:Edexcel「四大檢定」

推論統計檢定告訴研究員其研究結果是否具備統計顯著性(Statistical significance,即真實存在),抑或只是由偶然因素所致。

你必須熟知何時選擇並應用這四項必考檢定:

斯皮爾曼等級相關(Spearman’s Rho):用於探討相關/關聯,且數據至少達到順序層次。
卡方檢定(Chi-Squared, \(\chi^2\)):用於探討差異或關聯,適用於類別數據及獨立設計。
曼-惠特尼 U 檢定(Mann-Whitney U):用於探討差異,適用於順序(或等距)數據及獨立組別設計。
威爾科克森符號等級檢定(Wilcoxon Signed Ranks):用於探討差異,適用於順序(或等距)數據及重複測量(或配對組)設計。

4. 統計檢定選擇決策表

使用以下速查指引助你快速選出正確檢定:

類別數據 + 差異 + 獨立設計 \(\rightarrow\) 卡方檢定 (Chi-Squared)
順序數據 + 差異 + 獨立設計 \(\rightarrow\) 曼-惠特尼 U 檢定 (Mann-Whitney U)
順序數據 + 差異 + 重複/配對設計 \(\rightarrow\) 威爾科克森符號等級檢定 (Wilcoxon Signed Ranks)
順序數據 + 相關/關聯 \(\rightarrow\) 斯皮爾曼等級相關 (Spearman's Rho)

5. 假設、顯著性與慣例

虛無假設(Null Hypothesis, \(H_0\)):預測不存在顯著差異或相關(任何觀察到的結果純粹出於巧合)。
對立/實驗假設(Alternative / Experimental Hypothesis, \(H_1\)):預測存在顯著差異或相關(可為定向/單尾,或非定向/雙尾)。

標準顯著水準:在心理學中,標準公認的概率閾值為 \(p \leq 0.05\)(意味著結果純粹由巧合引起的概率在 5% 或以下)。
不等式符號:確保你完全掌握 \(<\)、\(>\)、\(\leq\) 和 \(\geq\) 的用法。
有效數字:Pearson Edexcel 明確規定相關係數必須四捨五入並表示為三位有效數字(例如 \(r_s = 0.654\) 或 \(r_s = -0.420\))。
解讀統計表格(觀察值 vs. 臨界值):計算出檢定統計量(即計算值/觀察值, Calculated/observed value)後,你需將其與統計表在 \(p \leq 0.05\) 水準下的臨界值(Critical value)進行比較。考試時你必須清晰說明觀察值是大於還是小於臨界值,從而判定接受還是拒絕 \(H_0\)。

第 3 部分核心重點: 牢記選擇檢定的 3 大黃金問題:1) 是研究差異還是相關? 2) 採用甚麼實驗設計? 3) 數據屬於哪個測量層次?


第 4 部分:心理學研究的倫理原則 (Ethical Principles)

所有在英國進行的心理學研究均必須嚴格遵守英國心理學會(BPS)倫理與行為準則

1. BPS 四大核心倫理原則

尊重(Respect):重視所有人的尊嚴與價值(涵蓋私隱權、保密性及知情同意)。
勝任能力(Competence):保持高水平的工作質素,並僅在自身專業知識、技能和培訓範圍內行事。
責任(Responsibility):保護受試者免受心理及生理傷害,確保進行事後解說(Debriefing),並對所有參與者的福祉負責。
誠信(Integrity):在所有專業互動中保持誠實、真實、準確和開放(避免不必要的欺瞞)。

2. 關鍵倫理指引

知情同意(Informed Consent):必須向受試者提供有關研究性質與目的的充分資訊,以便他們在知情的情況下自主決定是否參與。
退出權利(Right to Withdraw):必須告知受試者他們有權隨時退出研究,並可在研究結束後要求撤回其數據,而不會面臨任何懲罰。
保密性與匿名性(Confidentiality & Anonymity):個人數據必須保密。不得公開受試者姓名(應使用代號或化名)。
免受傷害保護(Protection from Harm):受試者所承受的生理或心理風險(例如壓力、尷尬、自尊受損),不得高於其在日常生活中可能遇到的水平。
欺瞞與事後解說(Deception & Debriefing):應避免欺瞞行為(隱瞞真實目的或誤導受試者),除非為防止需求特徵而有絕對必要。一旦使用了欺瞞手段,研究結束時必須提供全面的事後解說(Debrief),解釋真實研究目的、幫助受試者恢復基準情緒狀態,並重申其退出研究的權利。

第 4 部分核心重點: 在 Paper 3 的題目中,切忌只籠統回答「這違反了倫理」。你必須準確指出具體的 BPS 原則(例如尊重)或指引(例如免受心理傷害保護),並具體說明研究員應如何作出改善與補救!


第 5 部分:Paper 3 應試必勝策略與常見陷阱

Paper 3 非常著重於測試同學應對未見過的情境題的能力。以下是助你獲取最高分數的關鍵策略:

避開「泛泛而談」的評估陷阱:如果題目要求評估在攻擊性研究中使用現場實驗的優點,千萬不要只寫:「它具有較高的生態效度。」 你應該寫成:「由於研究是在小息時間於真實的學校操場環境中觀察兒童的攻擊行為,他們的表現十分自然,因此具備高度的生態效度。」
徹底掌握操作化:為自變項(IV)和因變項(DV)寫出具體的單位、時間範圍、分數或次數計量。
核對統計檢定規則:對於 Spearman’s Rho、Wilcoxon 和 Mann-Whitney U,請仔細確認顯著性是要求觀察值 \(\leq\) 還是 \(\geq\) 表格中的臨界值,並在答案中明確寫出該數值對比。
熟悉公式符號:無需對標準差感到畏懼:記住 \(s = \sqrt{\frac{\sum(x-\bar{x})^2}{n-1}}\) 只不過是用來測量樣本數據圍繞平均數的分散程度而已。