歡迎學習研究方法:情境中的心理學(Paper 2,Section C)

歡迎來到整個 AQA A Level 心理學課程中最重要的一章!研究方法屬於 Paper 2(情境中的心理學)的 Section C,佔了足足 48 分(佔該卷的一半分數),並佔你整個 A Level 總分的 33.3%。此外,在全部三份考卷中,至少有 10% 的總分是用來考核你的數學運算及數據處理能力。

如果一開始覺得數學或科學術語有點令人卻步,千萬不要擔心!我們會將每一個概念拆解成清晰、易吸收的小知識點,配合生活化的比喻、明確的法則和實用範例,助你信心十足地奪取滿分。

---

第 1 部分:科學過程與實驗方法

1. 實驗方法(Experimental Methods)

實驗是唯一能夠確立直接因果關係(Cause-and-effect relationship)的研究方法,研究人員透過操縱自變項(Independent Variable, IV)來觀察其對應變項(Dependent Variable, DV)的影響。

實驗主要分為四種類型:

1. 實驗室實驗(Laboratory Experiments):在高度受控的人工環境中進行,研究人員直接操縱自變項(IV)。
優點:對無關變項(Extraneous variables)控制度高;內部效度(Internal validity)高;極易重複驗證(Replication)。
缺點:人工環境導致生態效度(Ecological validity)偏低,且日常現實度(Mundane realism)低(實驗任務無法反映現實生活);容易產生需求特徵(Demand characteristics)的風險。

2. 實地實驗(Field Experiments):在真實的自然環境中進行,但研究人員依然會刻意操縱自變項(IV)。
優點:比實驗室實驗擁有更高的日常現實度與生態效度。
缺點:對無關變項失去嚴密控制;較難精確重複驗證;可能涉及倫理問題(例如:若受試者不知道自己正參與研究,便無法取得知情同意)。

3. 自然實驗(Natural Experiments):研究人員沒有操縱自變項;自變項的改變是自然發生的(例如:研究自然災害發生前後的心理健康狀況)。
優點:能夠研究那些在倫理上無法以人工方式構建的獨特真實情境。
缺點:自然發生的事件極為罕見;無法將受試者隨機分配(Random allocation)到不同組別。

4. 準實驗(Quasi-Experiments):自變項是基於受試者本身既有的個別差異或特徵(例如:年齡、性別、神經多樣性),並非由任何人為操縱。
優點:能夠在受控條件下比較不同群體之間的特徵差異。
缺點:無法隨機分配受試者,意味著無法完全消除受試者變項(Participant variables)帶來的混淆。

常見考評陷阱:切勿混淆自然實驗與準實驗!在自然實驗中,自變項是自然發生的環境事件;而在準實驗中,自變項則是受試者固有的特質(如年齡或性別)。

2. 研究目的與假設(Aims and Hypotheses)

研究目的(Aim):概括說明研究人員打算探討甚麼問題的總體陳述。
虛無假設(Null Hypothesis):預測變項之間沒有顯著差異沒有顯著關聯(任何觀察到的變化純粹是由機遇引起的)。
對立假設/實驗假設(Alternative / Experimental Hypothesis):預測變項之間存在顯著差異或關聯。

實驗假設分為兩類:

方向性假設(單尾檢定,Directional / One-tailed Hypothesis):明確指出結果的具體預期走向(例如:「飲用咖啡的受試者所回憶出的詞彙量,會顯著多於飲用水的受試者」)。
適用時機:「只有」在過去已發表的文獻或理論明確指向某個特定方向時才可使用。

無方向性假設(雙尾檢定,Non-directional / Two-tailed Hypothesis):指出兩者會有差異,但沒有說明具體走向(例如:「飲用咖啡的受試者與飲用水的受試者之間,所回憶出的詞彙量會存在顯著差異」)。
適用時機:當缺乏前人研究,或過去的研究結果相互矛盾時使用。

滿分奪標貼士 —— 操作化(Operationalisation):假設中的變項必須完全操作化(即有清晰定義且能量化測量)。切勿只寫「咖啡因會影響記憶力」,而應寫成:「飲用 200 ml 含咖啡因的咖啡相比飲用 200 ml 清水,受試者在 20 個詞彙的回憶測試中會取得更高的分數。」

3. 實驗設計(Experimental Designs)

我們該如何在各個實驗條件(Conditions)中安排受試者?

1. 獨立組設計(Independent Groups):不同的受試者分別參與不同的實驗條件。
優點:完全沒有順序效應(Order effects)(受試者不會因練習而表現變好,亦不會感到疲勞或厭倦)。
缺點:受試者變項(Participant variables)(例如智商、年齡等個別差異)可能會混淆實驗結果。
控制方法:進行隨機分配(Random allocation)(例如抽籤),使個別差異平均分佈於各組中。

2. 重複測量設計(Repeated Measures):同一批受試者參與所有的實驗條件。
優點:完全消除受試者個別差異帶來的影響;所需的總受試者人數較少。
缺點:會產生順序效應(疲勞、厭倦或練習效應),且更容易引發需求特徵。
控制方法:採用 \(AB\) 或 \(BA\) 設計的平衡對抗法(Counterbalancing)(一半受試者先進行條件 \(A\) 再進行條件 \(B\);另一半則先進行條件 \(B\) 再進行條件 \(A\))。

3. 配對組設計(Matched Pairs):不同受試者參與不同條件,但事前會先進行評估,並就關鍵特徵(例如相同的智商、年齡或閱讀能力)進行一對一配對。配對中的一人分入條件 \(A\),另一人分入條件 \(B\)。
優點:既能大幅減少受試者變項的干擾,又不會產生順序效應。
缺點:極度費時,而且很難做到完全精確的配對。

4. 變項與控制方法(Variables and Controls)

無關變項(Extraneous Variables, EVs):任何若不加以控制可能會影響應變項(DV)的干擾變項(例如室內光線、背景噪音)。
混淆變項(Confounding Variables, CVs):隨自變項(IV)一同產生系統性變化的變項,導致我們無法確定究竟是自變項還是混淆變項引起了應變項的改變。
需求特徵(Demand Characteristics):研究過程中的蛛絲馬跡讓受試者猜出了研究目的,從而改變自身的自然行為(控制方法:採用單盲設計 Single-blind design,受試者不知道自己身處哪一個條件)。
研究者效應(Investigator Effects):研究人員無論是有意或無意的提示,影響了受試者的行為(控制方法:透過標準化程序及雙盲設計 Double-blind design,受試者與負責執行實驗的研究員均不知道所屬條件或實驗假設)。
標準化(Standardisation):確保所有受試者面對的指導語、實驗環境和步驟程序完全一致。
隨機化(Randomisation):利用機遇原則(如洗牌、擲硬幣)來設計實驗材料,以消除研究者的主觀偏見。

5. 抽樣方法(Sampling Techniques)

目標總體(Target Population)是研究人員希望研究的整個群體。樣本(Sample)則是從中選出實際參與研究的較小群體。

隨機抽樣(Random Sampling):目標總體中的每個成員都有均等的入選機會(例如將所有名字輸入電腦隨機抽籤)。優點是完全沒有研究者偏見,但仍有可能純粹因運氣而抽到缺乏代表性的樣本。
系統抽樣(Systematic Sampling):按照抽樣架構,每隔第 \(n\) 個人選取一名(例如在字母排序的名單上每隔 5 個人選取 1 人)。方法客觀且能避免研究者偏見。
分層抽樣(Stratified Sampling):樣本嚴格按照目標總體中各子群體(層)的實際比例構成。代表性極高,但非常耗時複雜。
便利抽樣(Opportunity Sampling):直接選取在研究進行時任何在場且願意參與的人。快捷經濟,但代表性極低,且容易因特定地點/時間而產生嚴重偏差。
自願抽樣(Volunteer / Self-Selected Sampling):受試者透過回應廣告或海報主動報名參加。招募容易,但存在「自願者偏差」(容易吸引具備特定性格、積極度極高的人群)。

6. 前導研究(Pilot Studies)

前導研究是在正式研究展開前,利用少數受試者進行的小規模試行預演。其目的是在投入大量時間與金錢之前,檢查指導語是否清晰、測試時間分配、試用測量工具,並預先修正設計上的漏洞與缺陷。

核心總結:一項優秀的實驗研究,必須透過將變項操作化、標準化實驗步驟、運用平衡對抗法消除順序效應,並選取具代表性的樣本,從而精準確立因果關係。

---

第 2 部分:非實驗方法與觀察設計

1. 觀察技術與設計(Observational Techniques & Design)

觀察法涉及對自發行為進行觀看與記錄。觀察可按三大維度分類:

自然觀察 vs 控制觀察(Naturalistic vs Controlled):在毫無人為干預的日常環境中觀察 vs 在結構化的實驗室環境中觀察。
隱蔽觀察 vs 公開觀察(Covert vs Overt):受試者不知道自己正在被觀察(秘密進行) vs 受試者知悉自己正在被觀察(公開進行)。
參與觀察 vs 非參與觀察(Participant vs Non-participant):研究人員親自融入被研究的群體 vs 作為局外人進行旁觀記錄。

觀察設計要素:

行為類別(Behavioural Categories):將連續的目標行為拆解為具體、可觀察、可量化且互不重疊的細分行為(例如將「攻擊行為」操作化為踢、推、大聲叫罵)。
事件抽樣(Event Sampling):只要特定目標行為一出現,便記錄其發生次數。
時間抽樣(Time Sampling):在預先設定的時間間隔記錄目標行為(例如每隔 30 秒記錄一次受試者當前正在做甚麼)。

2. 自我陳述法:問卷與訪談(Self-Report Techniques)

問卷調查(Questionnaires):
封閉式問題(Closed questions):提供固定選項(例如李克特量表、是非題)。產生定量數據(Quantitative data)(易於進行統計分析,但缺乏深度)。
開放式問題(Open questions):允許受試者用自己的文字自由作答。產生定性數據(Qualitative data)(細節豐富,但難以進行統計分析和橫向比較)。

訪談法(Interviews):
結構化訪談(Structured):嚴格按照預設問題向每位受試者逐字逐句朗讀。高度標準化且易於重複驗證,但缺乏彈性。
非結構化訪談(Unstructured):類似日常交談,沒有固定問題;問題會根據受試者的回答即興延伸。內容豐富且靈活,但極難分析且容易產生訪談者偏見。
半結構化訪談(Semi-structured):備有一份核心問題清單,但訪談者擁有跟進提問以作澄清的自由度。

3. 相關研究(Correlations)

相關(Correlation)用於測量兩個連續共變項(Co-variables)之間關聯的強度與方向(例如溫習時數與考試成績)。

正相關(Positive Correlation):當一個共變項增加時,另一個共變項也隨之增加。
負相關(Negative Correlation):當一個共變項增加時,另一個共變項隨之減少。
零相關(Zero Correlation):兩個共變項之間不存在任何線性關聯。

關鍵區別:實驗透過操縱自變項來測量對應變項的影響,從而能確立因果關係(Causality);而相關研究僅測量兩個共變項之間的關聯,過程中沒有任何操縱。相關並不等於因果(Correlation does NOT equal causation),因為可能存在未被測量的第三變項(中介變項 Intervening variable)在背後主導這種關係。

4. 個案研究與內容分析(Case Studies & Content Analysis)

個案研究(Case Studies):對單一個人、小群體、機構或特定事件進行詳盡深入的調查。通常採用個案三角驗證法(Idiographic triangulation)(結合訪談、觀察和心理測驗)。能產生豐富詳盡的定性數據,但總體效度低,無法推論至廣大群體。
內容分析(Content Analysis):透過大眾傳媒(書籍、廣告、日記、演講等)對人類溝通進行間接觀察。
- 編碼(Coding):透過統計目標類別的出現次數,將定性數據轉化為定量數據。
- 主題分析(Thematic Analysis):一種定性分析過程,旨在識別整個材料中反覆出現的主題或核心思想。

核心總結:非實驗方法能為我們提供豐富的定性洞見(個案研究),並幫助我們找出趨勢規律(相關研究),但無法直接證明因果關係。

---

第 3 部分:信度、效度、倫理與科學原則

1. 倫理道德:BPS 行為準則

在英國進行的心理學研究必須嚴格遵守英國心理學會(BPS)道德與行為準則

知情同意(Informed Consent):受試者在同意參與前,必須充分理解真實的研究目的與流程。若事前無法取得完全同意,研究員可採用推定同意(Presumptive consent)(詢問類似群體的意見)、事前一般同意(Prior general consent)事後追溯同意(Retrospective consent)(於事後解說時取得)。
欺瞞(Deception):蓄意隱瞞資訊或誤導受試者的行為必須減至最低,且必須有充分理據,事後更必須進行完整解說。
免受傷害保護(Protection from Harm):受試者承受的身心傷害風險,絕不能高於日常生活中的正常水平。
保密性與匿名性(Confidentiality & Anonymity):個人資料必須受到嚴格保護;受試者身份不可被識別(例如使用編號或姓名縮寫代稱)。
退出權(Right to Withdraw):受試者有權在研究進行的任何階段隨時退出,並可在研究結束後要求銷毀其數據。
事後解說(Debriefing):研究結束後,必須向受試者詳細解釋真實研究目的、提供心理支援管道,並給予提問的機會。

2. 信度(Reliability / 一致性)

信度是指測量工具或研究程序的一致性與穩定度。如果在完全相同的條件下重複進行,能否產生相同的結果?

評估信度的方法:
1. 重測信度(Test-Retest Reliability):在兩個不同場合對同一批受試者施測相同的測驗。如果兩次得分的相關係數達到 \(+0.80\) 或以上,即確立了高信度。
2. 觀察者間信度(Inter-Observer / Inter-Rater Reliability):兩位或以上獨立的觀察員使用完全相同的行為類別同時記錄行為。將他們的記錄分數進行相關分析,若相關係數達到 \(+0.80\) 或以上,即表示具備很強的觀察者間信度。

提升信度的方法:將所有實驗指導語標準化;將行為類別操作化至清晰無重疊;盡量採用封閉式問題代替容易產生歧義的開放式問題。

3. 效度(Validity / 準確度與真實性)

效度是指一項測驗是否真正測量到它聲稱要測量的內容,以及研究結果能否反映真實世界。

內部效度(Internal Validity):應變項(DV)所發生的變化是否純粹由自變項(IV)引起(免受混淆變項與需求特徵的干擾)。
外部效度(External Validity):研究結果能夠推廣至研究情境之外的程度:
- 生態效度(Ecological validity):推論至日常生活真實情境的程度。
- 時代效度(Temporal validity):跨越不同歷史時期/時代的普遍適用性。
- 總體效度(Population validity):推論至其他人群的程度。

評估效度的方法:
1. 表面效度(Face Validity):由專家進行「表面觀察」,直觀審視測量工具看起來是否能測量到其聲稱的特質。
2. 效標關聯效度/同時效度(Concurrent Validity):將新測量工具的分數,與同一批受試者在已獲認可的成熟測驗上的得分進行比對。相關係數達 \(+0.80\) 或以上便能證實具備效標關聯效度。

4. 科學的特徵(Features of Science)

心理學研究要被視為真正的科學,必須符合以下核心標準:

客觀性與經驗主義方法(Objectivity & Empirical Method):收集直接、可觀察的證據,完全不受研究者個人主觀偏見或預期的影響。
可重複性(Replicability):研究步驟必須標準化並詳細記錄,讓其他學者能夠精確重複實驗並驗證結果。
可證偽性(Falsifiability / Karl Popper 理論):一項理論必須在理論上具備透過實證測試被證明是錯誤的可能性,才稱得上是科學。
理論構建與假設檢定(Theory Construction & Hypothesis Testing):建立能解釋觀察行為的宏觀原則,並從中推導出具體、可供驗證的預測(假設)進行實證檢定。
範式與範式轉移(Paradigms & Paradigm Shifts / Thomas Kuhn 理論):範式是指某一科學領域內學者普遍接受的一套核心假設與研究方法。當大量相互矛盾的證據(異例)出現並推翻舊範式時,便會引發科學革命,形成範式轉移(例如從行為主義轉變為認知心理學)。

5. 同儕審查與經濟效益(Peer Review & the Economy)

同儕審查(Peer Review):在論文發表前,由同領域的其他專家心理學家進行獨立且匿名的評審。其目的包括:
1. 客觀分配學術研究資助基金。
2. 審核研究的質量、原創性與方法論嚴謹度。
3. 防止造假或存在缺陷的研究流入學術期刊。

心理學對經濟的貢獻:心理學研究能從多方面推動整體經濟發展:
• 開發治療心理障礙的有效方案(例如使用 SSRI 藥物或認知行為治療 CBT 治療抑鬱症),有助降低醫療系統開支並減少工作缺勤率。
• 關於父親角色與依附關係的研究顯示,靈活的侍產假及育嬰假有助母親重返職場,從而提升家庭與社會的經濟生產力。

6. 心理學研究報告撰寫格式

學術論文遵循標準的撰寫結構:

1. 題目(Title):清晰精確。
2. 摘要(Abstract):約 150–200 字的精簡總結,涵蓋目的、假設、方法、結果及結論。
3. 引言(Introduction):文獻探討回顧、研究理據、目的與假設。
4. 方法(Method):詳細記錄各項細節以便他人精確複製(設計、樣本、材料/儀器、程序、倫理考量)。
5. 結果(Results):描述統計(圖表、集中趨勢測量)與推論統計檢定結果。
6. 討論(Discussion):結果詮釋、現實應用價值、研究限制及未來研究方向。
7. 參考文獻(References):標準學術引用格式(例如:Flanagan, C. (2020). Psychology Revision Guide. London: Oxford Press.)。

核心總結:科學研究依賴於公眾審查(同儕審查)、穩定一致的工具(信度 \(\ge +0.80\))、準確的測量(效度)以及嚴格的道德規範(BPS 倫理準則)。

---

第 4 部分:數據處理、描述統計與推論統計

1. 數據類型與測量尺度(Levels of Measurement)

定量數據(Quantitative):以數值形式呈現的數據。
定性數據(Qualitative):以文字呈現的非數值描述性數據。
初級數據(Primary Data):由研究人員專門為當前研究親自直接收集的第一手數據。
次級數據(Secondary Data):由他人在此前收集的現成資料(例如政府統計數據、期刊文章)。
統合分析(Meta-analysis):一種統計技術,透過整合多項探討相同課題的次級研究結果,計算出整體的效應值(Effect size)

測量尺度("NOIR" 階層體系):

1. 名目數據(Nominal Data):按名稱分類的獨立離散類別或頻數統計(例如:及格/不及格人數統計、飼養寵物類型:狗、貓、鳥)。
2. 順序數據(Ordinal Data):排列名次或按順序排列的數據,但單位之間的間距並不相等或標準化(例如:比賽的第 1、2、3 名;用 1–10 分自評快樂程度)。
3. 等距數據(Interval Data):在連續數值尺度上測量的數據,單位之間具有標準化且相等的間距(例如:攝氏溫度、以秒計算的時間、標準化測驗分數)。

2. 描述統計:集中趨勢與離散程度

集中趨勢測量(平均值):
平均數(Mean):數學上的算術平均值(所有數值總和除以總數目)。是最敏感的指標,因為它納入了每項數據,但極易受極端異常值(Outliers)扭曲。
中位數(Median):將所有數值按大小順序排列後的正中間數值。不受極端值影響,但忽略了各個數據的具體數值大小。
眾數(Mode):出現頻率最高的數值。是唯一適用於名目類別數據的平均值指標,但如果存在多個眾數時,參考價值便不高。

離散程度測量(數據分散程度):
全距(Range):最高分數與最低分數之間的差額(傳統計算公式為:\(\text{最高分} - \text{最低分} + 1\))。計算簡單,但極易受單一極端值扭曲。
標準差(Standard Deviation, SD):測量所有數據偏離平均數的平均距離/分散程度。標準差越小,表示分數緊密聚集在平均數周圍;標準差越大,表示分數分佈越廣泛分散。

3. 分佈形態:常態分佈與偏態曲線

常態分佈(Normal Distribution):對稱的鐘形曲線,平均數、中位數和眾數完全落在同一個中心峰值上。在常態分佈中,\(68.26\%\) 的分數落在平均數 \(\pm 1\text{ 個標準差 (SD)}\) 之內,\(95.44\%\) 落在 \(\pm 2\text{ 個標準差 (SD)}\) 之內。

正偏態(Positive Skew / 右偏):曲線尾部向右側延伸(數據集中在較低分數端,例如一場極度困難的考試,大部分人都考得低分)。
圖表上由左至右的排列順序為:\(\text{眾數 (Mode)} < \text{中位數 (Median)} < \text{平均數 (Mean)}\)。

負偏態(Negative Skew / 左偏):曲線尾部向左側延伸(數據集中在較高分數端,例如一場非常簡單的測驗,大部分人都考取高分)。
圖表上由左至右的排列順序為:\(\text{平均數 (Mean)} < \text{中位數 (Median)} < \text{眾數 (Mode)}\)。

4. 推論統計檢定:如何選擇正確的統計檢定

在考試中,當被要求為選擇的統計檢定提供理據時,你必須寫齊以下 3 項判斷標準:

1. 你是在檢定差異(Difference)還是相關/關聯(Correlation/Association)
2. 所採用的實驗設計是甚麼(不相關/獨立組設計 vs 相關/重複測量/配對組設計)?
3. 數據屬於哪種測量尺度(名目 Nominal、順序 Ordinal 還是等距 Interval)?

AQA 8大統計檢定決策矩陣:

名目數據(Nominal):
• 不相關設計(Unrelated Design)\(\implies\) 卡方檢定(Chi-square, \(\chi^2\))
• 相關設計(Related Design)\(\implies\) 符號檢定(Sign Test)
• 相關/關聯檢定 \(\implies\) 卡方檢定(Chi-square, \(\chi^2\))

順序數據(Ordinal):
• 不相關設計(Unrelated Design)\(\implies\) 曼-惠特尼 \(U\) 檢定(Mann-Whitney \(U\))
• 相關設計(Related Design)\(\implies\) 威爾卡克森 \(T\) 檢定(Wilcoxon \(T\))
• 相關檢定 \(\implies\) 斯皮爾曼等級相關(Spearman's Rho, \(r_s\))

等距數據(Interval - 參數檢定 Parametric tests):
• 不相關設計(Unrelated Design)\(\implies\) 獨立樣本 \(t\) 檢定(Unrelated \(t\)-test)
• 相關設計(Related Design)\(\implies\) 成對樣本 \(t\) 檢定(Related \(t\)-test)
• 相關檢定 \(\implies\) 皮爾森積差相關(Pearson's \(r\))

使用參數檢定(Parametric Test)的先決條件:

若要使用參數檢定(獨立樣本 \(t\) 檢定、成對樣本 \(t\) 檢定或皮爾森積差相關 \(r\)),數據必須同時符合三個條件:
1. 數據必須達到等距尺度(Interval)(或等比尺度 Ratio)。
2. 數據必須抽樣自呈常態分佈(Normal distribution)的母體。
3. 變異數同質性(Homogeneity of variance)(各條件下的數據分散程度大致均等)。

5. 如何計算符號檢定(Sign Test 逐步拆解)

符號檢定是考試中唯一可能要求你親自手算計算步驟的統計檢定。請遵循以下 4 個簡單步驟:

步驟 1:計算每位受試者在條件 \(A\) 的分數減去條件 \(B\) 的分數。記錄變化是正數(\(+\))還是負數(\(-\))。
步驟 2:計算 \(+\) 號和 \(-\) 號的總數。若有任何受試者的差額為零(即前後相同/Tie),將他們剔除,並從總人數 \(N\) 中扣除相應人數。
步驟 3:找出你的計算值(Calculated value, \(S\))。\(S\) 就是出現次數較少的符號的頻數
步驟 4:將計算出的 \(S\) 值與統計表中的臨界值(Critical value)作比較(根據指定的顯著水準,通常為 \(p \le 0.05\),以及調整後的 \(N\) 值對照查表)。
• 符號檢定法則:當 計算值 \(S \le \text{臨界值 (Critical value)}\) 時,結果即達到統計上的顯著差異。

6. 機率、顯著性與「R 法則」記憶法

• 在心理學中,標準的顯著水準設定為 \(p \le 0.05\)(意味著實驗結果純粹由機遇引起的機率只有 \(5\%\) 或以下)。
• 當研究涉及人身安全風險(例如測試新精神藥物)或重複驗證過往研究時,會採用更嚴格的 \(p \le 0.01\)(\(1\%\))。

查閱統計表必備 ——「R 法則」記憶口訣:
如何快速判斷計算值應該大於還是小於臨界值才算顯著?

• 如果檢定名稱中含有字母 'R'(Spearman's、Pearson's、Chi-square、Unrelated \(t\)、Related \(t\)):
\(\implies\) 必須達到 計算值(Calculated value)\(\ge\) 臨界值(Critical value) 才算顯著。
• 如果檢定名稱中沒有字母 'R'(Mann-Whitney、Wilcoxon、Sign test):
\(\implies\) 必須達到 計算值(Calculated value)\(\le\) 臨界值(Critical value) 才算顯著。

7. 統計決策錯誤:第一型與第二型錯誤

第一型錯誤(Type I Error / \(\alpha\) 錯誤 / 「假陽性」):錯誤地拒絕了實際上為真的虛無假設(宣稱發現了顯著差異/效應,但實際上並不存在)。當顯著水準設定得太寬鬆時便會發生(例如設為 \(p = 0.10\))。
第二型錯誤(Type II Error / \(\beta\) 錯誤 / 「假陰性」):錯誤地接受/保留了實際上為偽的虛無假設(未能發現真實存在的差異/效應)。當顯著水準設定得過於嚴苛時便會發生(例如設為 \(p = 0.001\))。

速記小錦囊:
第一型錯誤 = 過度樂觀的錯誤(「我有重大發現!」……但事實上根本沒有)。
第二型錯誤 = 過度悲觀的錯誤(「甚麼都沒發現……」……但事實上明明存在效應)。

核心總結:根據三大維度選取正確的統計檢定(差異/相關 \(\times\) 實驗設計 \(\times\) 測量尺度)。以 \(p \le 0.05\) 作為常規標準,牢記「R 法則」,計算符號檢定時務必先剔除打和(Tie)的數據!