👋 欢迎来到“数据”章节 (内容 3.1)

各位未来的“数字社会”专家好!这一章极为重要,因为数据是数字世界的燃料。我们所研究的一切——算法、人工智能、网络——全都依赖数据。只要你了解数据的运作方式、来源及其演变过程,你就掌握了整门课程的关键!

我们将会拆解核心概念,例如数据、信息、知识与智慧之间的区别,以及海量数据(大数据)如何影响我们的身份、隐私与权力架构。别担心这些概念听起来很专业,我们会用简单的类比来确保你能轻松掌握!


1. 数据连续体:数据、信息、知识与智慧

从原始材料到具行动力的洞察

在“数字社会”课程中,我们对用语必须精确。在日常对话中,“数据”和“信息”经常被混用,但它们实际上代表着连续体上的不同阶段。

核心定义(DIKW 连续体)

数据 (Data): 指的是缺乏情境的原始、未经处理的事实、数字、符号或观察结果。
例子:“45”、“史密斯 (Smith)”、“上午 10:30”。

信息 (Information): 指的是经过处理、组织、结构化,并在特定情境下呈现以提供意义与关联性的数据。
例子:“史密斯乘客 (Smith) 预定搭乘的 45 号列车已于上午 10:30 出发。”

知识 (Knowledge): 结合了理解、经验、情境与人类洞察力的信息,用以回答“如何 (how)”或“为何 (why)”。
例子:了解到 45 号列车在雨天的早晨经常因为路轨状况而延误。

智慧 (Wisdom): 符合伦理地运用知识与健全的判断力来做出决策并采取未来的行动。
例子:重新安排发车指引,并主动与乘客沟通以将混乱减至最低。

类比时间!👨‍🍳 把它想成烹饪:
数据就是原材料:面粉、鸡蛋、糖。
处理 (Processing) 就是烘焙过程:搅拌、量度、烘烤。
信息就是成品:一个生日蛋糕!
知识就是了解烘焙温度如何改变蛋糕的口感。
智慧就是决定这个蛋糕是为谁而做,以及是否需要因应饮食需求调整食谱。


2. 数据的类型

并非所有的数据都是一样的!我们会通过不同的方式分类数据,以了解其用途与潜在影响。

定量数据 vs. 定性数据

定量数据 (Quantitative Data):
这类数据与数字有关,可以被测量或计算。它们结构化强,容易输入数据库。
例子:年龄、身高、交易金额、网站点击次数。

定性数据 (Qualitative Data):
这类数据具描述性,处理的是品质、属性或特征。它们通常是非结构化的,需要先进的自然语言处理或分类技术来进行计算分析。
例子:用户评论(“我觉得这款应用程序很难用”)、访谈记录、情绪感受调查。

你知道吗? 社交媒体上的帖子大多属于定性数据(文字、图像),但平台会通过记录点赞数、分享次数以及观看时间,将其转化为定量指标。

大数据 (Big Data):数字社会的巨大堆叠

在“数字社会”课程中,我们非常着重于大数据。它指的是规模极大且极其复杂,超出传统数据库系统处理能力的数据集。

大数据的四个“V”

为了分析大数据,课程大纲 3.1.H 强调了四个“V”

1. 容量 (Volume): 产生与存储的庞大数据数量(以拍字节 Petabytes 或艾字节 Exabytes 计量)。例子:每天跨社交网络上传的数百万部视频。

2. 速度 (Velocity): 数据实时产生、收集、流式传输与处理的速度。例子:金融交易、实时遥测与即时定位追踪。

3. 多样性 (Variety): 数据的不同形式,涵盖结构化数字表格、半结构化日志,以及非结构化的视频、音频与传感器流。

4. 真实性 (Veracity): 数据的准确性、可靠性、质量与可信度。高真实性代表数据干净且可靠;低真实性则会导致自动化决策出错。

为什么大数据很重要?

处理大数据的目的在于找出人类分析师可能忽略的规律 (Patterns) 与关联。这些规律推动了算法预测、个性化服务与自动化治理(这将数据直接链接到了权力 (Power) 的概念)。


3. 数据收集与数据生命周期

数据从何而来?它在数字系统中又经历了怎样的路径?

主动 vs. 被动数据收集

数据收集机制与价值观与道德 (Values and Ethics) 的伦理概念直接相关,特别是在知情同意与透明度方面。

主动数据收集:
使用者在自觉意识下刻意提供数据。
例子:填写在线注册表单、回答问卷调查、上传媒体文件。

被动数据收集:
在每次互动中,未经使用者明确、主动输入的情况下自动收集数据,从而留下数字足迹。
例子:追踪 Cookies、设备遥测数据、GPS 定位记录、网页浏览元数据 (metadata)。

数据生命周期

数据在技术系统 (Systems) 内经历结构化的阶段:

1. 收集: 从主动输入或被动传感器中获取原始数据。

2. 存储: 将数据安全地保存在云端存储库、数据库或本地磁盘中。

3. 处理/分析: 对数据进行清理、筛选并运行算法,以提取规律。

4. 信息/洞察: 产生情境化的结果,为人类或机器的决策提供依据。

5. 使用/行动: 在现实世界情境中应用洞察,例如个性化推荐或公共卫生政策。

6. 消除/销毁: 当数据达到其生命周期终点时,安全地处置或进行去标识化处理(例如数据遮蔽或加密擦除)。


4. 数据在数字社会的影响

数据的收集与运用对个人与体制产生了深远影响,将内容 3.1 直接链接到核心概念(身份、权力、系统、价值观与道德)。

数据所有权、治理与控制

一个核心争论围绕在:由使用者产生的数据,所有权与控制权归谁?

当使用免费数字服务时,使用者通常以个人数据换取平台访问权。这种不对等在商业平台中造成了高度集中的权力 (Power),并引发了数据主权的问题。

数据保护法规: 欧盟的《通用数据保护条例》(GDPR) 等框架确立了个人在同意、访问及删除(“被遗忘权”)方面的法定权利。

数据可移植性 (Data Portability): 赋予使用者在不同服务提供商之间转移个人数据的法律与技术权利,从而减轻厂商锁定 (vendor lock-in) 的问题。

隐私与身份建构分析

汇总的数据档案使机构能够对行为、偏好与社会经济地位做出预测性推断,直接影响个人的数字身份 (Identity)

数据偏见与可靠性

由于数据反映了人类的过程与既有的社会现状,数据集可能会使系统性偏见持续存在:

收集偏见 (Collection Bias): 当抽样方法系统性地低估或排除特定的群体或地理区域时产生。

代表性偏见 (Representation Bias): 当训练数据集中固有的历史偏见导致算法系统产生不公或歧视性结果时发生。

重点总结: 有偏见的数据会损害数据的真实性与公平性,引发关于自动化决策中价值观与道德 (Values and Ethics) 的关键辩论。


第 3.1 章 数据总结

数据构成了数字世界的基础基石。跨越 DIKW 连续体(数据、信息、知识、智慧),大数据生态系统中的数据具有四个“V”的特征:容量 (Volume)、速度 (Velocity)、多样性 (Variety) 和真实性 (Veracity)。理解数据如何被收集、存储、分析与治理,为我们下一个主题“算法 (内容 3.2)”奠定了必备的基础。