欢迎来到大数据的世界!
你好!欢迎来到 CFA Level I 课程中量化方法(Quantitative Methods)最现代、最令人兴奋的章节之一。如果你曾经好奇投资公司如何通过停车场的卫星图像来预测零售销售,或者 Netflix 如何精准地知道你下一部想看什么电影,那你绝对来对地方了!
如果你不是“科技挂”的也不用担心。在这一章中,我们不是要学习写程序,而是要掌握大数据的概念与专业术语,让你了解大数据如何改变金融世界。让我们开始吧!
1. 到底什么是大数据?
在“旧时代”,数据大多是指电子表格里的数字。今天,数据无处不在。大数据(Big Data)指的是那些规模极大且复杂,以至于传统数据处理软件无法应付的数据集。
要记住大数据的特征,只要记得三个 V:
1. 容量(Volume):数据的绝对量。我们讨论的是 TB(太字节)和 PB(拍字节),而不仅仅是 MB(兆字节)。例子:纽约证券交易所(NYSE)历史上的每一笔交易记录。
2. 速度(Velocity):数据产生和移动的速度。在金融领域,价格以毫秒计在变动。例子:财报会议期间实时更新的社交媒体信息流。
3. 多样性(Variety):数据的形式多种多样。它不仅仅是数字,还包括文字、视频和音频。例子:PDF 报告、推文(tweets)和卫星照片。
快速复习:3 个 V
Volume(容量) = 大小
Velocity(速度) = 速度
Variety(多样性) = 类型
2. 这些数据都从哪儿来?
课程将数据来源分为三大类。你可以把它们想成数据产生的“谁”和“哪里”:
A. 金融市场:这是由交易所产生的数据。包括股票价格、交易量和“限价订单簿(limit order books)”。这些数据通常非常快速(高速度/Velocity)。
B. 个人:这是你和我产生的数据!每当你在 Instagram 发文、在 Google 搜索或是刷信用卡时,你都在产生数据。这些数据通常是非结构化(Unstructured)的(例如文字或照片)。
C. 企业/商业流程:这包括“废气数据(exhaust data)”(作为商业运作副产品产生的数据),例如库存记录,或是来自货柜或工厂机器传感器的物联网(IoT)数据。
类比:想象一家超市。“金融市场”数据是货架上的标价。“个人”数据是顾客在 Twitter 上对产品的评价。“企业”数据是牛奶冷藏柜里的传感器,提醒经理温度正在升高。
3. 结构化 vs. 非结构化数据
这是考试非常喜欢出的题目,了解数据组织方式的差异至关重要。
结构化数据(Structured Data):这种数据以高度定义的方式组织,通常是行列形式(如 Excel 电子表格)。计算机很容易读取。例子:财务报表、股票价格。
非结构化数据(Unstructured Data):这类数据杂乱无章,无法放入整齐的表格中。绝大多数大数据都是非结构化的。 例子:社交媒体贴文、新闻报道、公司通话记录和卫星图像。
半结构化数据(Semi-Structured Data):介于两者之间。它具备一定的组织性,但无法完美契合标准表格。例子:HTML 网页。
重点总结
投资经理正越来越努力将非结构化数据转化为结构化的见解,以便在竞争中获得优势!
4. 机器学习(ML)简介
如果说大数据是“燃料”,那么机器学习就是“引擎”。机器学习是人工智能(AI)的一个领域,计算机在没有针对每一个步骤进行明确编程的情况下,学习如何在数据中寻找规律。
课程将机器学习分为三大类。别让这些名字吓倒你,概念其实相当简单:
A. 监督式学习(Supervised Learning)
在监督式学习中,计算机被给予“已标注(labeled)”的数据。这意味着我们给予计算机输入内容以及正确答案,它学习两者之间的关系。就像学生在老师提供答案卷的情况下学习一样。
例子:你给计算机 1,000 张标记为“猫”的照片和 1,000 张标记为“狗”的照片。最终,它学会了自己识别猫。在金融领域,我们可以用它来根据过去破产公司的数据,预测一家公司是否会破产。
B. 非监督式学习(Unsupervised Learning)
在非监督式学习中,没有标签,也没有提供“正确答案”。计算机观察数据并试图自己找出隐藏的规律或分组。就像给小孩一盒随机的积木,看他们如何将其分类一样。
例子:你给计算机 500 只不同股票的数据,它根据它们的表现将它们分成不同类别,而不需要你告诉它哪些股票是“科技股”或“能源股”。
C. 深度学习(Deep Learning)
深度学习是一种更复杂的机器学习类型,使用神经网络(Neural Networks)。这些网络受到人类大脑的启发,非常擅长处理语音识别或图像处理等杂乱的非结构化数据。
记忆口诀:S.U.D.
Supervised(监督式) = Shown the answer(被告知答案)
Unsupervised(非监督式) = Unknown patterns(未知规律)
Deep Learning(深度学习) = Digital brain(数字大脑,即神经网络)
5. 数据分析的步骤
即使拥有最强大的计算机,你也必须遵循一定的程序。如果输入的是“垃圾”,得到的也会是“垃圾”!以下是典型的流程:
1. 设定目标:我们想解决什么问题?(例如:“预测苹果公司下季的销售额”)。
2. 数据收集:从各种来源收集数据(API、网页抓取等)。
3. 数据准备(清洗/整理):这通常是最困难的部分!你必须清洗数据、处理缺失值,并确保一切格式正确。
4. 数据探索:可视化观察数据,找出异常值或有趣的趋势。
5. 模型训练:这就是机器学习发挥作用的地方!执行算法来寻找规律。
6. 解释与评估:检视结果。模型真的有效吗?它的准确度如何?
常见错误:学生常以为“模型训练”是第一步。其实它是最后几步之一!你大部分时间都花在清洗数据上(步骤 3)。
6. 神经网络:深入观察
你可能会看到关于神经网络结构的问题。只要记住这三个部分:
1. 输入层(Input Layer):数据进入系统的地方。
2. 隐藏层(Hidden Layers):这是魔法(以及数学)发生的地方。可以有很多层。它们分阶段处理信息。
3. 输出层(Output Layer):最终的结果或预测。
类比:想象一个厨房。原始食材就是输入。在后台工作的厨师和助理就是隐藏层。端给顾客的成品餐点就是输出。
7. 最后总结清单
在进行练习题之前,确保你能回答以下问题:
- 我能说出 3 个 V 吗?(容量 Volume、速度 Velocity、多样性 Variety)
- 我知道结构化数据与非结构化数据的区别吗?
- 我能解释监督式(已标注)与非监督式(未标注)学习的区别吗?
- 我理解“数据准备”是整个过程中非常重要的一部分吗?
你能做到的!大数据听起来可能很可怕,但它只是一套帮助我们做出更好投资决策的新工具。继续努力吧!