← 返回全书概述
第 4 章

数据收集

页码范围:约第 108-134 页 | 食材采购

数据新闻的"食材采购"环节。数据按类型分为结构化和非结构化,按来源分为公开数据和自采数据。核心原则:够用、可靠、合法。

四大核心框架

从数据分类到来源矩阵,从采集方法到注意事项——四个框架构成了数据收集的完整体系。

数据分类框架

按来源:公开数据 vs 自采数据 vs 购买数据;按结构:结构化(表格/数据库)vs 非结构化(文本/图片/视频)。分类决定了后续处理方式。

数据认知基础

公开数据来源矩阵

政府统计部门(权威性最高)→ 学术研究机构(专业性最强)→ 行业报告/企业数据(针对性最好)→ 开放数据平台(可及性最优)。

公开数据在哪找

自采数据五法

网络爬虫(Python/Scrapy/八爪鱼)→ API接口调用 → 问卷调查 → 传感器/IoT采集 → 众包收集。五种方法覆盖了自采数据的全部场景。

自采数据怎么做

数据收集五注意事项

版权合规、隐私保护、数据时效性、数据完整性、跨来源交叉验证。五项注意事项是数据收集的"安全带"。

合规与质量

数据类型对比

结构化数据

以行和列组织的数据(如Excel表格、数据库),便于量化分析。是最理想的数据新闻素材。

非结构化数据

文本、图片、视频等没有预定义格式的数据,需要额外处理(如NLP文本分析)才能使用。

公开数据来源矩阵(按优先级排序)

权威性最高

政府统计部门

国家统计局、各部委公开数据。权威、免费、覆盖面广,但更新频率可能较慢。

专业性最强

学术研究机构

高校、研究所的公开数据集。方法论严谨,适合深度分析,但主题可能较窄。

针对性最好

行业报告/企业数据

咨询公司报告、企业年报。数据具体、有商业洞察,但可能存在立场偏差。

可及性最优

开放数据平台

如Kaggle、天眼查开放数据等。获取便捷,但需要验证数据质量和来源。

自采数据五法

🐜

网络爬虫

Python/Scrapy/八爪鱼

🔗

API接口

程序间数据调用

📋

问卷调查

定制化收集

📡

传感器/IoT

物理环境数据

👥

众包收集

公众协作

关键概念词典

点击任意术语展开详细定义。

结构化数据
以行和列组织的数据(如Excel表格),便于量化分析。是最理想的数据新闻素材,可以直接导入分析工具处理。
第4章 · 约第110页
非结构化数据
文本、图片、视频等没有预定义格式的数据,需要额外处理(如NLP文本分析、OCR图像识别)才能提取有用信息。
第4章 · 约第111页
API (应用程序编程接口)
允许程序间调用数据的标准接口,是获取互联网数据的重要通道。如微博API、天气API等。优势是数据格式规范、获取效率高。
第4章 · 约第128页
网络爬虫
自动抓取网页数据的程序,Python + Scrapy/BeautifulSoup 是常用组合。非编程用户可使用八爪鱼、集搜客等可视化工具。必须遵守robots.txt和法律法规。
第4章 · 约第127页
众包 (Crowdsourcing)
借助大量公众力量共同完成数据收集任务。适合大范围、分散性的数据采集,如各地空气质量上报。优势是覆盖面广,劣势是数据质量参差不齐。
第4章 · 约第131页

两个思维模型

用类比理解数据收集的本质。

🧩

用数据当积木

不同来源的数据是不同形状的积木,收集的过程就是寻找并匹配正确积木的过程。一块积木盖不了房子,多种来源的组合才能构建完整的数据故事。

📚

公开数据如公共图书馆

数据就在那里,但要知道去哪找、怎么借、如何用。政府数据是"百科全书",学术数据是"专业期刊",企业数据是"行业杂志"——不同需求去不同"书架"。

三个反面警示

数据收集环节最常犯的三个错误。

无差别爬取

不加限制地爬取网站数据,不顾及robots.txt协议和网站反爬机制。

失败原因:可能触碰法律红线(《网络安全法》《个人信息保护法》)。爬虫不是想爬就能爬。

数据来源单一

仅依赖一个数据源做报道,不进行交叉验证。

失败原因:单一来源可能存在系统性偏差。至少两个独立来源交叉验证才可靠。

忽视数据时效性

使用过时数据做当下报道,不检查数据的更新时间。

失败原因:数据已过期,结论不可信。收集数据时必须记录数据的生成时间和更新频率。

实战案例深度拆解

多源数据收集的典型场景。

多源数据收集

城市空气质量报道的数据收集

一则关于城市空气质量的报道需要从多个来源收集数据,每个来源的类型和获取方式都不同:

环保部门监测数据气象数据交通流量数据标准化处理统计分析

数据来源拆解:

① 环保部门历史空气质量监测数据——公开数据,权威性最高;
② 气象数据(温度、湿度、风速)——公开数据,用于分析气象条件对污染的影响;
③ 交通流量数据——可能需要自采或购买,用于分析尾气排放与污染的关联。

处理步骤:将不同来源的污染物浓度数据标准化(统一单位和格式)→ 合并时间序列 → 使用统计方法识别污染物与气象条件的关系。这个案例展示了"多源收集 + 标准化处理 + 交叉分析"的标准流程。

本章要点回顾

五个核心要点。

  1. 数据收集核心原则:公开优先、自采补充、购买是最后手段。
  2. 网络爬虫和API是自采数据的两大技术支柱。
  3. 数据收集必须合法合规——遵守《个人信息保护法》《网络安全法》《著作权法》。
  4. 跨来源交叉验证是确保数据可靠性的最佳实践。
  5. 数据收集不仅是技术活,也是判断力——什么数据值得收、什么数据收集后有用。