数据分类框架
按来源:公开数据 vs 自采数据 vs 购买数据;按结构:结构化(表格/数据库)vs 非结构化(文本/图片/视频)。分类决定了后续处理方式。
数据认知基础从数据分类到来源矩阵,从采集方法到注意事项——四个框架构成了数据收集的完整体系。
按来源:公开数据 vs 自采数据 vs 购买数据;按结构:结构化(表格/数据库)vs 非结构化(文本/图片/视频)。分类决定了后续处理方式。
数据认知基础政府统计部门(权威性最高)→ 学术研究机构(专业性最强)→ 行业报告/企业数据(针对性最好)→ 开放数据平台(可及性最优)。
公开数据在哪找网络爬虫(Python/Scrapy/八爪鱼)→ API接口调用 → 问卷调查 → 传感器/IoT采集 → 众包收集。五种方法覆盖了自采数据的全部场景。
自采数据怎么做版权合规、隐私保护、数据时效性、数据完整性、跨来源交叉验证。五项注意事项是数据收集的"安全带"。
合规与质量以行和列组织的数据(如Excel表格、数据库),便于量化分析。是最理想的数据新闻素材。
文本、图片、视频等没有预定义格式的数据,需要额外处理(如NLP文本分析)才能使用。
国家统计局、各部委公开数据。权威、免费、覆盖面广,但更新频率可能较慢。
高校、研究所的公开数据集。方法论严谨,适合深度分析,但主题可能较窄。
咨询公司报告、企业年报。数据具体、有商业洞察,但可能存在立场偏差。
如Kaggle、天眼查开放数据等。获取便捷,但需要验证数据质量和来源。
Python/Scrapy/八爪鱼
程序间数据调用
定制化收集
物理环境数据
公众协作
点击任意术语展开详细定义。
用类比理解数据收集的本质。
不同来源的数据是不同形状的积木,收集的过程就是寻找并匹配正确积木的过程。一块积木盖不了房子,多种来源的组合才能构建完整的数据故事。
数据就在那里,但要知道去哪找、怎么借、如何用。政府数据是"百科全书",学术数据是"专业期刊",企业数据是"行业杂志"——不同需求去不同"书架"。
数据收集环节最常犯的三个错误。
不加限制地爬取网站数据,不顾及robots.txt协议和网站反爬机制。
失败原因:可能触碰法律红线(《网络安全法》《个人信息保护法》)。爬虫不是想爬就能爬。
仅依赖一个数据源做报道,不进行交叉验证。
失败原因:单一来源可能存在系统性偏差。至少两个独立来源交叉验证才可靠。
使用过时数据做当下报道,不检查数据的更新时间。
失败原因:数据已过期,结论不可信。收集数据时必须记录数据的生成时间和更新频率。
多源数据收集的典型场景。
一则关于城市空气质量的报道需要从多个来源收集数据,每个来源的类型和获取方式都不同:
数据来源拆解:
① 环保部门历史空气质量监测数据——公开数据,权威性最高;
② 气象数据(温度、湿度、风速)——公开数据,用于分析气象条件对污染的影响;
③ 交通流量数据——可能需要自采或购买,用于分析尾气排放与污染的关联。
处理步骤:将不同来源的污染物浓度数据标准化(统一单位和格式)→ 合并时间序列 → 使用统计方法识别污染物与气象条件的关系。这个案例展示了"多源收集 + 标准化处理 + 交叉分析"的标准流程。
五个核心要点。