👋 歡迎來到「數據」章節 (內容 3.1)

各位未來的「數位社會」專家好!這一章極為重要,因為數據是數位世界的燃料。我們所研究的一切——演算法、人工智慧、網絡——全都依賴數據。只要你了解數據的運作方式、來源及其演變過程,你就掌握了整門課程的關鍵!

我們將會拆解核心概念,例如數據、資訊、知識與智慧之間的區別,以及海量數據(大數據)如何影響我們的身分、隱私與權力架構。別擔心這些概念聽起來很專業,我們會用簡單的類比來確保你能輕鬆掌握!


1. 數據連續體:數據、資訊、知識與智慧

從原始材料到具行動力的洞察

在「數位社會」課程中,我們對用語必須精確。在日常對話中,「數據」和「資訊」經常被混用,但它們實際上代表著連續體上的不同階段。

核心定義(DIKW 連續體)
  • 數據 (Data): 指的是缺乏情境的原始、未經處理的事實、數字、符號或觀察結果。
    例子:「45」、「史密斯 (Smith)」、「上午 10:30」。
  • 資訊 (Information): 指的是經過處理、組織、結構化,並在特定情境下呈現以提供意義與關聯性的數據。
    例子:「史密斯乘客 (Smith) 預定搭乘的 45 號列車已於上午 10:30 出發。」
  • 知識 (Knowledge): 結合了理解、經驗、情境與人類洞察力的資訊,用以回答「如何 (how)」或「為何 (why)」。
    例子:了解到 45 號列車在雨天的早晨經常因為路軌狀況而延誤。
  • 智慧 (Wisdom): 符合倫理地運用知識與健全的判斷力來做出決策並採取未來的行動。
    例子:重新安排發車指引,並主動與乘客溝通以將混亂減至最低。

類比時間!👨‍🍳 把它想成烹飪:
數據就是原材料:麵粉、雞蛋、糖。
處理 (Processing) 就是烘焙過程:攪拌、量度、烘烤。
資訊就是成品:一個生日蛋糕!
知識就是了解烘焙溫度如何改變蛋糕的口感。
智慧就是決定這個蛋糕是為誰而做,以及是否需要因應飲食需求調整食譜。


2. 數據的類型

並非所有的數據都是一樣的!我們會透過不同的方式分類數據,以了解其用途與潛在影響。

定量數據 vs. 定性數據

  • 定量數據 (Quantitative Data):
    這類數據與數字有關,可以被測量或計算。它們結構化強,容易輸入資料庫。
    例子:年齡、身高、交易金額、網站點擊次數。
  • 定性數據 (Qualitative Data):
    這類數據具描述性,處理的是品質、屬性或特徵。它們通常是非結構化的,需要先進的自然語言處理或分類技術來進行運算分析。
    例子:用戶評論(「我覺得這款應用程式很難用」)、訪談記錄、情緒感受調查。

你知道嗎? 社群媒體上的貼文大多屬於定性數據(文字、圖像),但平台會透過記錄按讚數、分享次數以及觀看時間,將其轉化為定量指標。

大數據 (Big Data):數位社會的巨大堆疊

在「數位社會」課程中,我們非常著重於大數據。它指的是規模極大且極其複雜,超出傳統資料庫系統處理能力的數據集。

大數據的四個「V」

為了分析大數據,課程大綱 3.1.H 強調了四個「V」

  1. 容量 (Volume): 產生與儲存的龐大數據數量(以拍位元組 Petabytes 或艾位元組 Exabytes 計量)。例子:每天跨社交網絡上傳的數百萬部影片。
  2. 速度 (Velocity): 數據即時產生、收集、串流傳輸與處理的速度。例子:金融交易、即時遙測與即時定位追蹤。
  3. 多樣性 (Variety): 數據的不同形式,涵蓋結構化數字表格、半結構化日誌,以及非結構化的影片、音訊與感測器串流。
  4. 真實性 (Veracity): 數據的準確性、可靠性、品質與可信度。高真實性代表數據乾淨且可靠;低真實性則會導致自動化決策出錯。
為什麼大數據很重要?

處理大數據的目的在於找出人類分析師可能忽略的規律 (Patterns) 與關聯。這些規律推動了演算法預測、個人化服務與自動化治理(這將數據直接連結到了權力 (Power) 的概念)。


3. 數據收集與數據生命週期

數據從何而來?它在數位系統中又經歷了怎樣的路徑?

主動 vs. 被動數據收集

數據收集機制與價值觀與道德 (Values and Ethics) 的倫理概念直接相關,特別是在知情同意與透明度方面。

  • 主動數據收集:
    使用者在自覺意識下刻意提供數據。
    例子:填寫線上註冊表單、回答問卷調查、上傳媒體檔案。
  • 被動數據收集:
    在每次互動中,未經使用者明確、主動輸入的情況下自動收集數據,從而留下數位足跡。
    例子:追蹤 Cookies、裝置遙測數據、GPS 定位記錄、網頁瀏覽元數據 (metadata)。

數據生命週期

數據在技術系統 (Systems) 內經歷結構化的階段:

  1. 收集: 從主動輸入或被動感測器中獲取原始數據。
  2. 儲存: 將數據安全地保存在雲端儲存庫、資料庫或本地磁碟中。
  3. 處理/分析: 對數據進行清理、篩選並運行演算法,以提取規律。
  4. 資訊/洞察: 產生情境化的結果,為人類或機器的決策提供依據。
  5. 使用/行動: 在現實世界情境中應用洞察,例如個人化推薦或公共衛生政策。
  6. 消除/銷毀: 當數據達到其生命週期終點時,安全地處置或進行去識別化處理(例如數據遮蔽或加密抹除)。

4. 數據在數位社會的影響

數據的收集與運用對個人與體制產生了深遠影響,將內容 3.1 直接連結到核心概念(身分、權力、系統、價值觀與道德)。

數據所有權、治理與控制

一個核心爭論圍繞在:由使用者產生的數據,所有權與控制權歸誰?

當使用免費數位服務時,使用者通常以個人數據換取平台存取權。這種不對等在商業平台中造成了高度集中的權力 (Power),並引發了數據主權的問題。

  • 數據保護法規: 歐盟的《一般資料保護規範》(GDPR) 等框架確立了個人在同意、存取及刪除(「被遺忘權」)方面的法定權利。
  • 數據可攜性 (Data Portability): 賦予使用者在不同服務提供商之間轉移個人數據的法律與技術權利,從而減輕廠商鎖定 (vendor lock-in) 的問題。

隱私與身分建構分析

彙總的數據檔案使機構能夠對行為、偏好與社會經濟地位做出預測性推斷,直接影響個人的數位身分 (Identity)

數據偏見與可靠性

由於數據反映了人類的過程與既有的社會現況,數據集可能會使系統性偏見持續存在:

  • 收集偏見 (Collection Bias): 當抽樣方法系統性地低估或排除特定的群體或地理區域時產生。
  • 代表性偏見 (Representation Bias): 當訓練數據集中固有的歷史偏見導致演算法系統產生不公或歧視性結果時發生。

重點總結: 有偏見的數據會損害數據的真實性與公平性,引發關於自動化決策中價值觀與道德 (Values and Ethics) 的關鍵辯論。


第 3.1 章 數據總結

數據構成了數位世界的基礎基石。跨越 DIKW 連續體(數據、資訊、知識、智慧),大數據生態系統中的數據具有四個「V」的特徵:容量 (Volume)、速度 (Velocity)、多樣性 (Variety) 和真實性 (Veracity)。理解數據如何被收集、儲存、分析與治理,為我們下一個主題「演算法 (內容 3.2)」奠定了必備的基礎。