第五章 数据怎么来:多源采集与汇入
章首:一切数据应用,都始于一次采集
数据不是被"制造"出来的,它是这个世界本来就有的痕迹,我们只是把它"采集"了起来。中国信息通信研究院在《大数据白皮书》中指出,大数据的产生源于物理世界的感知与人类活动的记录,其规模与价值随数字化进程持续增长[1]。如果把数据比作矿藏,那么采集就是开矿——但这是一座奇怪的矿:别的矿越挖越少,数据之矿却越用越多,每一次采集、每一次分析,都在为这座矿增添新的矿石。
这份"记录世界的渴望",最终落在一个个具体的数据应用上:一个指数、一张地图、一条趋势线。人们常常被应用的形态吸引——图表很直观,报告很精美,问答很聪明——却容易忽略一个事实:任何呈现在应用界面上的数字,无论最终以何种形态出现,其生命都始于某个地方的某次记录:一份年报、一条评论、一次交易。数据应用看似从"展示"开始,实则从"采集"开始;只有理解了数据从何而来,才能真正理解数据为何可信、为何可用。这是本章要建立的第一层认知。
本书配套ABI实训平台上的数字化转型指数应用,正是这一认知的可复现路径:从巨潮资讯网下载1999—2023年间数万份上市公司年报,转文本、统计词频、构造指数,最终建成可供任何人一键查询的数字化转型指数平台1[2]。这条路径揭示了一个朴素的次序——先有采集,后有处理,再有应用。无论终端形态是图表、报告还是智能问答,任何数据应用都逃不出这个次序:没有采集,处理无米下锅;没有处理,应用空有其表。理解这个次序,就理解了本章的主线:数据采集不是数据应用的一个环节,而是它的起点与地基。这一次序在数据应用的实践中反复得到印证:应用的形式可以千变万化,逻辑骨架始终如一——采集、处理、应用,三步依次展开,缺一不可。
物理世界与人类活动,是数据的两大源头;传感器、接口、文件与人工,是采集的四条通道——这些来自国家标准的框架,回答了"数据从哪来";而这一应用的足迹,回答了"数据怎么变成应用":下载→转文本→词频统计→PCA降维→可视化。两条线索合起来,指向同一个判断:应用上的每一个数字,都对应着一次真实的采集,以及一条从原始记录到最终呈现的完整链条。 数据采集,就是把这个"望而却步"变成"一键可得"的环节——它让"数据从哪来"这个认知问题,有了可操作的答案。
值得先想清楚的是,数据采集不是技术行为,而是认知行为。数据在哪里、以什么形式存在、如何合法高效地获取——这三个问题想清楚了,工具只是顺手的事。数据采集的关键不是"会爬虫",而是"懂来源"。
第一节 数据来源方法论
这一节的核心主张:数据应用的质量,取决于数据来源与接入方式的选择——知道数据在哪、以什么形式存在、如何合法高效地获取,比掌握某一种抓取工具更重要;这是对大数据来源理论的继承。
数据在哪里:物理世界与人类活动
回答数据从哪里来这个问题,第一步不是打开任何工具,而是回到源头。从数据的产生机制看,当今的大数据主要来自两个方面:物理世界与人类活动。这一分类在产业界与学术界已成为共识——中国信息通信研究院在历年《大数据白皮书》中均以数据来源与产生方式作为大数据分析的起点[1]。这个分类,为数据来源划出了两条基本路径。
物理世界。数学与物理规律支配了人类存在的三维世界。传感器、摄像头、卫星遥感、射频识别,让物理世界的状态能够被自动获取并存储下来——土壤的湿度、路灯的能耗、一辆货车的位置,都在以数字信号的形式被记录。数据可以为物理世界万事万物进行画像,是记载物理世界特征的一份"数字写真"。本书第十章将要分析的沪深300成分股行情数据,本质上是市场参与者集体行为在交易系统里的数字化投影——它来自"人类活动",却以"物理世界"的方式被记录。
人类活动。人的社会属性决定了其根本特征是要进行社会活动。我们每一个动作都会留下相应的数字轨迹——打电话、发邮件、刷卡购物、拍照、阅读一篇在线文章,甚至在大街上行走,都会创造出结构化或非结构化数据。全球数据量的增长印证了这一判断:据国际数据公司(IDC)的测算,全球数据量已从2010年的2ZB(泽字节)增长至2025年的175ZB,人类活动是其中最主要的贡献者[17]。本书的跨境电商评论数据(速卖通平台7589条公开评论、覆盖134个国家/地区),就是人类活动数据的典型——每一条评论背后,都是一个真实消费者的真实选择,而它们最终会变成一张反映消费足迹的国家分布图。
这两类来源对应着两种截然不同的采集哲学:物理世界的数据要靠"感知"(传感器去测量),人类活动的数据要靠"记录"(系统去留存)。理解这一点,你就理解了为什么有的数据接口是公开的、有的却要申请授权——数据的可获取性,取决于它是在哪里、被谁、以什么目的产生的。
数据采集方式:来自国家标准的规范
数据采集不是随心所欲的行为,它有国家标准可依。2022年发布、2023年实施的国家标准《智能制造 工业数据 采集规范》(GB/T 42127—2022)对数据采集的流程、方式与技术要求作出了系统规定[15];在此基础上,工业领域的数据采集可归纳为四种典型方式:传感器采集、接口采集、文件导入与人工录入——这四种方式恰好覆盖了从物理世界到数字世界的完整光谱,也是数据来源的四条基本通道。
传感器采集面向物理世界——温度、湿度、压力、振动、电流等物理量通过传感器转化为数字信号。一台智能手机里就装着GPS、加速度计、陀螺仪、光线传感器、近场通信芯片等十余种传感器;城市里联网部署的交通、治安摄像头,能获得更大规模的实时数据。传感器采集的意义在于:它把大量物理世界的状态"自动化"地获取并存储下来,极大减轻了人工采集的劳动量,提高了采集的精准度——这是工业数据采集最典型的形态。
接口采集面向软件系统与开放服务——通过API、数据库连接等程序化接口获取数据。行情数据、地图数据、天气数据是典型:数据提供方开放了程序化访问通道,调用接口即可获取。本书的数字化转型指数数据服务(digital-index-api)、股票行情接口(腾讯/东方财富)都属于此类。接口采集的关键是协议与鉴权:接口约定返回格式(JSON/XML),调用方需持有合法的访问凭证——这是"开放不等于任意访问"在技术层面的体现。
文件导入面向离线与批量数据——Excel、CSV、PDF等文件通过导入工具进入数据系统。年报PDF、商品表格、业务导出文件都属于此类。本书的巨潮资讯网年报采集,正是"下载PDF→转文本→结构化入库"的文件导入流程;该应用把词频统计表导入BI平台,也是文件导入的标准动作[2]。文件导入的挑战在于格式解析:PDF版式各异、Excel字段不一,需要解析规则与校验逻辑。
人工录入面向无法自动获取的数据——问卷、表单、现场记录通过人工方式录入系统。数据众包(crowdsourcing)是人工录入的规模化形态:"众包"一词最早由《连线》杂志记者杰夫·豪(Jeff Howe)在2006年提出,指机构把过去由员工执行的工作任务,按照自由自愿的原则分发给非特定的大众网络去完成[5]。搜狗输入法通过大量用户参与设计,已获取19354种皮肤和12008个细胞词库;贵阳的"众采客"平台发动市民利用空闲时间领取任务、采集数据,让政府低成本、高效率地获取高质量数据源。人工录入的价值在于覆盖自动化采集触及不到的角落,代价是需要质检来保证一致性。
图5-1 数据采集的四种方式:传感器、接口、文件与人工
这四种方式之间并非泾渭分明:年报采集是"文件导入",但下载年报PDF用的是爬虫(接口采集的变体);评论数据既可以通过接口获取,也可以人工标注。国家标准的价值不在于规定"必须用哪种方式",而在于为每一种方式立下质量底线——采集流程可追溯、采集结果可校验、采集行为合规——这正是本章后续质检环节的制度依据[15]。
三类数据源与接入方式
把采集方式落实到操作层面,数据源按获取方式可分为三类。公开网页:数据在网页里,需要采集(爬虫)——年报、评论、新闻都属于此类。开放接口(API):数据提供方开放了程序化访问通道,调用接口即可获取——行情数据、地图数据、天气数据是典型。离线与专有数据:光盘、内部系统、商业数据库——需要专门工具或授权。三类来源对应三种接入方式:采集器(八爪鱼等可视化工具)、API调用(几行代码)、导入工具(平台上传)。选择哪种方式,取决于数据源的开放程度,而不是你的编程水平。
图5-2 三类数据源与接入方式
这里藏着一层值得品味的哲学:数据源是"开放"还是"封闭",本质上是数据权属的制度安排,而不是技术问题。 巨潮资讯网之所以能批量下载年报,是因为《上市公司信息披露管理办法》要求上市公司"充分披露与投资者价值判断和投资决策有关的信息"[8]——披露是义务,采集才有依据。这也解释了为什么本书所有实训数据要么来自公开披露、要么来自平台自有业务:合规,是数据采集的第一条底线。
数据治理:采集之后的第一道秩序
采集回来的数据,如果直接使用,几乎必然出问题。数据治理并非无章可循——国家标准对数据治理作出了系统规定:《信息技术服务 治理 第5部分:数据治理规范》(GB/T 34960.5—2018)明确了数据治理的组织、制度与流程[16];《数据管理能力成熟度评估模型》(GB/T 36073—2018,简称DCMM)则把数据管理能力划分为数据战略、数据治理、数据架构、数据应用、数据安全、数据质量、数据标准、数据生存周期八个能力域,并设置了从初始级到优化级的五个成熟度等级,为数据治理提供了可评估的标尺[9]。这一框架回答了数据来源问题的另一半——数据不仅要"抓得到",还要"可信"。
数据标准管理解决"数据如何统一"的问题,对应DCMM的"数据标准"能力域。国家、地区、行业和企业都有相应的数据标准,国际上有国际数据管理协会(DAMA)编制的《DAMA数据管理知识体系指南》,国内有国家标准《数据管理能力成熟度评估模型》(GB/T 36073—2018)[9]。在实践过程中,需要结合业务实际对数据集进行规范化,包括格式、编码规则、字典值等内容——数字化转型指数里"行业代码""注册地省份"这些字段,如果不按统一标准编码,PCA计算和地图可视化都会出错。
标准不是孤立的条文,而是一套需要体系化设计的系统——陈娴等(2025)的研究指出,我国大数据标准长期存在"领域分散、层级混乱"的问题:政务数据与工业数据的分类分级标准互不兼容,跨领域共享成本高企,企业平均需适配5—8种不同数据格式[11]。破解之道是体系化设计:构建"基础—技术—管理—应用—安全"的统一框架,让基础标准统一通用规则、行业标准适配细分需求,实现"数据语言统一、技术流程规范、安全边界清晰"[11]。标准体系化设计的价值,恰恰在数据汇合之处体现:采集自不同来源的数据,只有在统一的标准框架下才能被顺畅地比较、合并与流通。 该应用的词频统计表之所以能顺利进入PCA环节,正是因为"年份""股票代码""行业"等字段在入库前就按统一口径完成了编码——标准不是采集之后的事,而是采集之前就应当想清楚的事。
数据质量管理解决"数据可信不可信"的问题,对应DCMM的"数据质量"能力域。数据质量管理贯穿数据采集、存储、共享、维护、应用、消亡等生命周期,对准确性、合规性、一致性、重复性、及时性、完备性等质量指标进行检测,通过数据清洗等一系列加工管理活动,建立数据资源原始库、资源库、主题库,形成数据质量闭环管理。数据质量问题有多普遍?陈娴等(2025)的研究援引调研显示,我国企业数据质量合格率不足70%——也就是说,平均每十条数据里,就有超过三条不准确、不完整或不一致[11]。值得强调的是,数据质量并非一个笼统的说法——Wang与Strong在1996年对数据消费者的大规模调查中,把数据质量拆解为内在质量(准确性、客观性)、情境质量(相关性、及时性)、表征质量(可理解性、一致性)与可访问性质量四类维度,这一框架至今仍是数据质量研究的经典坐标[6]。"垃圾进、垃圾出"(Garbage in, garbage out)是数据领域最古老的定律:再好的模型也救不了脏数据。
元数据管理解决"数据是什么"的问题,对应DCMM的"数据架构"能力域中的元数据管理。元数据是"关于数据的数据"——没有它,在数据仓库里查找数据将像在大海里捞针一样困难。元数据管理的任务可以从六个角度概括:"向前看"——我是谁加工出来的;"向后看"——我又支持了谁的加工;"看历史"——过去的我长什么样子;"看本体"——我的定义和格式是什么;"向上看"——我的父节点是谁;"向下看"——我的子节点是谁。本书平台的每一次查询都会记录数据来源与采集时间,正是元数据管理在生产环境里的样子。
数据资产管理是数据治理思想的新发展阶段,对应DCMM的"数据应用"能力域。数据治理强调将数据作为台账进行管控,数据资产管理则强调数据价值的发挥,其价值体现简单来说就是"更省更快更准""降本增效提质"。数据中台,就是"汇"的规模化形态——把采集到的数据统一存储、统一口径、统一服务,让"有哪些数据可用""到哪里可以找到数据"成为一句话就能回答的问题;本书第十八章把这一形态概括为"ABI三层"架构,正是数据中台理念在零代码平台上的投影。陈娴等(2025)则从价值释放的角度补上了最后一环:数据要素要完成从"资源"到"资产"的转化,必须依靠标准激活其潜在价值——汉源花椒数字化种植项目将种植数据转化为"可评估、可交易"的资产,带动产品溢价20%[11]。抓取让数据成为资源,治理让资源成为资产——本章负责前者,而后者从数据入库的那一刻就已经开始。
在平台上验证:查看数据口径
打开数字化转型指数平台(数字化转型指数平台),在数据说明里查看5467家的采集口径与数据来源;再打开工作流画布(工作流画布,数字化转型指数项目),查看"采集"节点:它如何按行业分组、如何调用下载接口、如何把PDF转成文本。你会理解:平台上的每一个数字,背后都有一条真实的数据采集流水线。

图5-3 workflow-demo 工作流画布页面渲染
第二节 商业大数据的数据来源:以数字化转型指数为例
这一节的核心主张:商业大数据是数据要素在商业世界的集中形态,按性质可分为财务数据、行情数据、文本数据与属性数据四类,来源覆盖公开披露、开放接口与商业数据库;以数字化转型指数为例,可以完整看到"年报文本+属性数据"如何经由词频统计与降维成为指数,最终通过数据服务接口以财务数据、年报文本数据、词频与指数数据等形式被应用调用。
商业大数据从哪里来
商业大数据,是数据要素在商业世界的集中形态。企业的经营行为——披露年报、上市交易、发布公告、开展业务——每时每刻都在产生数据。按数据性质,商业大数据可分为四类:财务数据(资产负债表、利润表、现金流量表,反映企业的经营结果)、行情数据(股价、成交量,反映市场对企业价值的即时判断)、文本数据(年报、公告、研报、新闻,反映企业做了什么、说了什么)、属性数据(注册地、行业、股权结构,反映企业的基本画像)。
这四类数据的来源各不相同:财务数据来自上市公司公开披露(巨潮资讯网、交易所网站);行情数据来自交易所与行情服务商(腾讯、东方财富等开放接口);文本数据来自信息披露平台与新闻媒体;属性数据来自企业登记信息与商业数据库。商业大数据的数据来源,本质上是"公开披露+开放接口+商业数据库"三种通道的组合——这与第一节的"三类数据源与接入方式"完全对应。理解商业大数据从哪里来,是理解一切企业分析应用的前提;而数字化转型指数,是这一领域最具代表性的数据产品。
以数字化转型指数为例:一个双轨数据产品
在商业大数据的四类数据中,文本数据与属性数据的结合,催生了一个典型的双轨数据产品——数字化转型指数(Digital Transformation Index,DTI)。它的构建逻辑可以追溯到一条清晰的学术脉络:Salton与Buckley在1988年提出的词频加权方法,为"从文本中提取信息"奠定了理论基础[3];唐松等(2020)在《管理世界》的实证研究表明,数字金融与企业技术创新之间存在显著的正向关联[4],数字技术应用的可度量性由此获得权威佐证。其核心思想是:企业年报中频繁出现的"人工智能""大数据""云计算""区块链""数字技术应用"等词汇,是企业在实质性地推进数字化转型的"痕迹"——年报里的词频,就是企业数字化转型的"数字写真"。
企业之所以密集披露这些词汇,背后是数字化转型的真实业绩逻辑:杨德明与刘泳文(2018)的实证表明,"互联网+"显著提升了企业业绩[18]——数字化不是成本,而是产出;肖静华(2020)则从管理适应性变革的视角指出,企业跨体系的数字化转型伴随着组织与管理层面的同步调整[19],转型成效取决于系统与组织的协同。年报词频之所以能成为可靠的度量,正是因为这些文本背后有真实的战略与组织动作。
本书配套ABI实训平台上的数字化转型指数应用,把这一学术方法变成了工程实践:在官方网站下载上市公司1999—2023年的历年年报,依据文献中的词频目录构建词频挖掘Python代码,将一级构建指标分为五类词频(人工智能、大数据、云计算、区块链、数字技术应用),生成Excel格式的词频统计表,再借助主成分分析(PCA)把多个相关词频压缩为单一综合指数——这一降维方法由Hotelling在1933年提出,至今仍是多指标合成的主流工具[7][2]。最终呈现的指数,就是这张"数字写真"被压缩后的画像。从商业大数据到数据产品,数字化转型指数完整走过了"采集→处理→应用"的链条——它是本章最好的案例,也是全书的"数据心脏"。
数据来源一:年报文本
数字化转型指数的基础数据,来自证监会指定的上市公司信息披露网站——巨潮资讯网(cninfo.com.cn)。这里的数据属于第一节所说的"公开网页"型数据源,采集方式是典型的主题爬虫:目标明确——年报PDF;范围清晰——5467家上市公司(2024年报)与1999—2023年全量年报;规则固定——按年度与行业检索。采集的三大挑战也在这里集中体现:量(数千份文件)、格式(PDF版式各异)、质量(扫描件、乱码、缺页)。工程上的解法是分块与并行:按行业分组、多线程下载、断点续传。
年报文本只是"原料",要变成指数,还需要两步加工。词频统计:将PDF转为文本,统计五类词频,生成词频统计表——这一步有严格的质检要求,PDF转文本可能产生乱码与缺页,扫描件需要OCR,同义词需要统一("数字化"与"数智化")、停用词需要过滤("我们""公司"这类高频但无信息量的词),原始文本直接进词频统计,得到的一定是噪声。降维合成:对标准化后的词频特征执行PCA,取特征值大于1的主成分,以方差贡献率加权合成指数。项目报告书强调,全量数据量大、字段多、空值复杂,需要在预处理阶段剔除不方便分析的字段和数据[2]。
数据来源二:属性数据
指数本身回答"转型程度多高",但要支撑多维分析,还需要第二类数据——属性数据。项目报告书在年报数据之外,整合了三类属性信息[2]:企业属性(证券简称、股票代码、注册地城市与省份)、行业属性(所属行业代码,支持行业对比分析)、ESG指数(量化上市公司可持续发展能力的指标,与数字化转型指数形成印证)。这三类属性数据与年报词频数据合并,形成"事实+维度"的完整数据结构:词频与指数是事实,企业、行业、地区、年份是维度。
属性数据的采集与年报文本不同:它来自上市公司公开信息与商业数据接口,结构化程度高、质量相对稳定,主要工作在于编码统一——注册地省份按统一行政区划编码、行业代码按统一标准编码。这里体现了第一节所讲的数据标准管理:如果"行业代码""注册地省份"这些字段不按统一标准编码,PCA计算和地图可视化都会出错[1][9]。
API数据:财务数据、年报文本数据等如何被调用
数据采集与加工完成后,通过数据服务接口(API)对外提供。本书的数字化转型指数数据服务(https://zhenyuonline.cn/digital-index-api)将上述数据组织为多组接口:企业维度——公司列表(/api/company/list)、公司指数趋势(/api/company/trend),提供单一企业的财务与指数时序数据;行业维度——行业列表、行业概览、行业TOP(/api/industry/),提供行业对比数据;地区维度——省份、城市(/api/region/),提供地理分布数据;维度相关——数字化转型指数与ESG的相关性(/api/dimensions/correlation);BI查询——面向看板的聚合查询(/api/bi/query、/api/bi/dashboard)与全国地图数据(/api/map/china)。
这些接口共同回答了一个问题:财务数据、年报文本数据、词频数据、指数数据、ESG数据、行业与地区属性数据,如何从"采回来"变成"调得到"。 前端应用(数字化转型指数平台、工作流部署页)调用这些接口,用户输入一家公司代码,页面即返回该公司的真实指数序列——这正是第一节所讲的"开放接口(API)"接入方式在自建数据上的完整落地:采集端是主题爬虫,服务端是API,应用端是看板,中间由数据层贯通。
在平台上抓取:画布节点与真实数据源
实训平台的工作流画布(https://zhenyuonline.cn/workflow-demo/)把数据抓取做成了画布上的一个节点——采集节点(Skill Collector)。与数据服务接口对应,采集节点支持多种真实数据源模式:股票行情(stock-api,调用腾讯/东方财富真实行情接口)、数字化转型指数(digital-index-api,调用本书自建的指数数据服务)、沪深300成分股(hs300-api)、年报词频(annual-report-keywords,本书自建词频库)等。你不需要写爬虫代码,只需在节点配置里选择数据源、填入参数(如股票代码600519、年份2024),运行时节点就会真实地发起请求、取回数据。
关键的一点是:画布上的采集不是演示,而是真实的数据获取。 当工作流运行时,采集节点通过API调用真实数据源——股票节点拉取的是腾讯/东方财富当天的真实行情,指数节点返回的是本书61410行×33列面板中的真实记录。本书第一章说"LLM+Agent+Skill",这里的采集节点就是Skill层最朴素的一次落地:它封装了"取数"这个标准动作,输入是参数,输出是真实数据。
不止数字化转型指数——本书平台上的每一个应用,都能在画布上以同样的方式编排出来。 股票估值预设走"采集行情与财务→整理DDM/CAPM参数→模型计算→估值判断→部署页面"的节点链;沪深300选股预设走"成分股行情采集→多策略评分→策略融合→风险评估→部署排名页"的节点链;跨境电商分析则从速卖通评论与Kilimall商品页的采集出发,经清洗统计后部署为中非贸易看板。这些预设工作流虽然数据源不同、分析命题不同,但节点骨架完全一致:采集节点取回真实数据,处理节点完成计算,模型节点产出结论,部署节点呈现页面——这就是数据应用的一般骨架,也是本章"先有采集,后有处理,再有应用"次序的工程形态。 实训时不必从零搭建,从预设工作流出发,观察每个节点如何把上游输出交给下游,再动手替换数据源或调整处理逻辑——这是理解全流程最快的路径。

图5-4 四个预设工作流:数字化转型指数(6节点)、股票估值(7节点)、沪深300选股(6节点)、多维BI看板(2节点)——数据源与命题各异,采集→处理→建模→编排→部署的骨架却完全相同。打开"模板"市场即可载入任一预设工作流,节点与连线即真实呈现在画布上。
上下文引用:让 LLM 节点"看到"采集到的数据
画布上仅仅有采集节点还不够——数据抓回来要给谁用?答案是下游的 LLM 节点。工作流引擎会把上游所有节点的输出收集为通道上下文,并以"上游数据:……"的形式注入 LLM 节点的提示词。这一机制在技术上被称为"上下文的 MCP 引用":LLM 并不直接访问数据库,而是通过上下文获得采集节点取回的真实数据,再基于这些数据完成解读、分析或生成。换言之,数据的传递不是靠人工搬运,而是由工作流的结构本身完成——上游的每一次采集,都自动成为下游分析的输入。
图5-5 画布上的真实数据获取:采集→上下文→LLM→部署
这条链正是章首所说的那个次序——先有采集,后有处理,再有应用——在画布上的具象形态:采集节点取回真实数据,LLM节点基于真实数据完成解读,部署节点把结果呈现为页面。画布上的一次"拖拽—连线—运行",就是一次完整的"采集→处理→应用":数据应用的表象千变万化,逻辑骨架始终如一。
数据导入与维度准备:让数据"就位"
数据抓取完成后,要让数据能被后续应用调用,还需要完成两件事:导入与维度准备。
导入解决"数据在哪"的问题。项目报告书展示了SmartBI平台的本地数据连接流程:进入"数据连接"界面,选择"本地库""文件",在"自助数据集"界面点击"加载文件数据",将上市公司数字化转型指数与ESG表格导入高速缓存库或关系数据源[2]。数据导入后,才能在数据连接的对应目录中查看到该数据表,供后续分析调用。本书的数字化转型指数平台(数字化转型指数平台)同样如此——61410行×33列的全量面板数据,正是通过数据服务层被前端应用调用的。
维度准备解决"数据怎么组织"的问题。为了支持多维度查询,需要把数据组织成"事实+维度"的结构:时间维度(年份_year)支持时序分析,地理维度(注册地省份)支持地图分布,行业维度支持行业对比。项目报告书在SmartBI平台中通过右键字段"创建时间维度""新建层次"完成这一组织工作[2]——维度的设计,决定了后续能问出什么问题。 想看数字化转型水平的全国分布?需要地理维度。想看历年变化?需要时间维度。维度没建好,数据再全也画不出那张图。
数据质量保障:入库前的最后一道关卡
抓取与导入之后,数据质量保障是决定后续分析可信度的关卡。项目报告书在分析思路中特别强调:全量上市公司历年年报词频挖掘的数据量比较大、字段比较多,增加的行业、注册地、ESG指数属性也较为复杂,空值的存在会增加后续数据处理的难度,所以需要对数据进行预处理,剔除不方便分析的字段和数据[2]。
质检的标准动作有四步:去重(同一记录多次采集只留一条)、去噪(过滤无关内容)、完整性检查(关键字段缺失率统计)、一致性校验(格式与编码统一)。国家标准给出了一个更系统的视角:DCMM 将数据质量管理纳入"数据质量"能力域,其检查对象是准确性、合规性、一致性、重复性、及时性、完备性六项指标,贯穿数据生命周期[9]。该应用的做法与之完全一致——词频统计表生成后,剔除缺失字段、统一行业代码、补充ESG指数数据,才进入PCA环节。
这四步看似琐碎,却是决定分析成败的关卡。 一个典型的反面教训是:如果年报采集时漏掉了某一年份,PCA构造的指数就会出现断点,时序图就会"断裂"——而这个问题在采集环节就能通过完整性检查发现,等到了可视化阶段才发现,返工成本已经翻了好几倍。
过程评分与通关条件
本节实训采用过程化评分:采集完整性(覆盖率)、数据质量(去重去噪后的有效率)、入库规范性(字段与格式)各占权重,达到通关线才算合格。评分标准的设计意图很明确:让学生把"质量意识"内化为采集习惯——不是"抓完就行",而是"抓完、检完、入库后依然干净"。这套评分逻辑贯彻了"评价过程而非结果"的理念:评价的不是结果,而是过程中的每一步。
具体而言,采集完整性的考核点是覆盖率——年报采集是否覆盖了分配的全部公司?数据质量的考核点是有效率——去重去噪之后,剩下的数据占原始采集量的比例?入库规范性的考核点是字段与格式——年份、代码、词频字段是否齐全,格式是否统一?三个考核点对应第一节的三类挑战:量、格式、质量。
在平台上验证:跑通"采集→上下文→部署"全链路
打开工作流画布(workflow-demo),运行"数字化转型指数"预设工作流,观察节点链的每一步:采集节点真实调用指数数据服务取回数据,LLM节点通过通道上下文拿到上游数据并完成解读,部署节点把结果生成页面。再打开数字化转型指数平台(数字化转型指数平台),输入贵州茅台(600519),观察它的数字化转型指数与历年走势——屏幕上的趋势图与统计卡片,就是本章数据获取的最终形态:界面上的每一个指数数字,都能沿数据链倒查回最初的那份年报。 采集节点就是本章的"抓取",部署节点就是本章的"入库"。

图5-6 上市公司数字化转型指数查询系统页面渲染
再做一个实验:在画布上新建一个工作流,拖入采集节点并选择"数字化转型指数"数据源,填入一家公司的代码,运行——观察采集节点返回的真实数据;接着拖入LLM节点,把它连在采集节点下游,输入提示词"根据上游数据解读这家公司的转型趋势",运行——观察LLM节点输出的解读是否基于上游真实数据(工作流日志里能看到"上游数据:……"的上下文注入)。然后在 Hermes Lite(Hermes Lite)输入"帮我写一段Python代码,调用某公开API获取数据",观察它给出的代码结构(请求、解析、异常处理);再输入"采集到的数据有重复和噪声,怎么处理?"对比两次回答——第一次是"接入",第二次是"质检"。你会看到:5467份年报汇成的指数曲线,每一个数字都经过了抓取与质检两道关,而画布上的每一个节点,都对应着一次真实的数据获取。
第三节 电商数据的采集:以中非贸易为例
这一节的核心主张:电商数据是"人类活动数据"最活跃的形态,按性质可分为评论数据、商品数据、订单数据与流量数据四类,来源以平台公开页面与开放接口为主;以中非贸易为例,可以看到速卖通公开评论与Kilimall商品页如何覆盖东盟、非洲等134个国家/地区,其采集、质检与入库的方法与第二节同源,却通向消费洞察与贸易趋势。
电商数据从哪里来
如果说商业大数据回答的是"企业怎么样",那么电商数据回答的则是"消费者要什么"。电商平台的每一次浏览、下单、评价,都在产生数据。按数据性质,电商数据可分为四类:评论数据(星级、评论内容,反映消费者的满意度)、商品数据(品类、价格、销量,反映供给与市场接受度)、订单数据(成交记录、物流信息,反映交易的真实发生)、流量数据(浏览、点击、转化,反映用户的兴趣与行为路径)。
这四类数据的来源各不相同:评论与商品数据通常在平台公开页面即可获取(速卖通、Kilimall的商品页与评论页);订单与流量数据属于平台内部业务数据,需要授权或开放接口才能获取。电商数据的获取边界,取决于数据是"公开页面"还是"业务系统"——这正是第一节"数据的可获取性取决于它在哪里、被谁、以什么目的产生"的具体体现。本书的教学切片聚焦于公开页面可获取的评论与商品数据,这也是零代码条件下人人可复现的采集对象。
为什么是跨境电商:数据里的贸易图景
如果说数字化转型指数回答的是"企业转型程度",那么电商数据回答的则是"市场在哪里、消费者怎么说"。2022年,《区域全面经济伙伴关系协定》(RCEP)正式生效,全球人口最多、经贸规模最大的自贸区落地,中国与东盟的贸易往来进入新阶段[14];中非贸易同样保持强劲增长,海关总署发布的"中国-非洲贸易指数"显示,中非贸易规模持续攀升[12]。贸易数据很宏观,但要理解贸易背后的消费者,需要微观数据——谁在买、买什么、满意不满意。这类数据,藏在跨境电商平台的公开页面里。
电商评论数据属于第一节所说的"人类活动"数据:每一条评论背后,都是一个真实消费者的真实选择。它的学术价值同样有据可循——Chevalier与Mayzlin在2006年的经典研究以在线书评为样本,实证了在线评论对销售的显著影响,开创了"在线口碑"研究范式[13];此后,在线评论作为消费者行为的直接记录,成为市场洞察的重要数据源。本书采集的教学切片,正是这一学术判断在零代码平台上的落地。
数据来源一:速卖通公开评论
速卖通(AliExpress)是面向全球的跨境电商平台,其公开商品评论页面是评论数据的主要来源。本书的教学切片采集了7589条公开评论、覆盖134个国家/地区(2026-07采集,教学切片,非全量商业数据),字段包括:星级(1-5星,衡量满意度)、国家/地区(买家所在地)、物流方式(平台标准物流/卖家自定义)、评论内容(文字评价)。这组数据的结构简单,却足以支撑丰富的分析:按国家聚合看市场分布,按星级聚合看口碑,按物流聚合看服务体验。
值得强调的是非洲子集:7589条评论中,非洲共21国111条,其中摩洛哥30条、尼日利亚26条、南非14条、毛里求斯9条、加纳3条、肯尼亚3条、马拉维3条。非洲样本量虽小,却是"中非贸易"最微观的证据——单国几条评论不足以代表该国整体,但它们的分布揭示了买家所在的国别结构。样本量小的数据,分析时看结构而不是看总量——这是采集环节就该建立的判断。
数据来源二:Kilimall公开商品页
评论回答"消费者怎么说",商品数据回答"卖家卖什么"。Kilimall是面向非洲市场的跨境电商平台,其公开商品页提供了商品侧数据。教学切片采集了182件商品(2026-07-30采集,教学切片),按品类划分:文化衫56件、运动服45件、男装T恤43件、女装上衣38件;平均单价15.36美元,月销合计45452件。
这组数据与评论数据互补:评论数据是"需求侧",商品数据是"供给侧"。两者合并,可以回答跨境电商分析的核心问题——什么好卖、什么价位的商品接受度高、哪些国家贡献了主要销量。这也解释了为什么采集方案往往不止一个数据源:单一数据源只能回答一半问题,多源合并才能拼出完整图景。
采集、质检与入库:与第二节同源的方法
电商数据的采集方法与第二节的商业大数据同源:评论采集是主题爬虫——目标明确(速卖通公开评论页)、规则固定(星级/国家/物流/内容四字段);商品采集同样是主题爬虫(Kilimall商品页)。质检的四个标准动作一个不少:去重(同一评论多次采集只留一条)、去噪(过滤广告与无关文本)、完整性检查(星级、国家等关键字段缺失率统计)、一致性校验(国家名称与编码统一,如"俄罗斯"与"Russia"归并为同一国家)。数据入库后,按国家、星级、物流等维度组织,供后续分析调用——第十二章电商平台案例中的中非跨境贸易AI数智看板(https://zhenyuonline.cn/workflow-demo/deployed/af_trade_ds8k)正是建立在这批数据之上。
方法同源,命题不同:商业大数据与电商数据,采集的都是公开数据,走的都是"采集→质检→入库"的链条,但一个通向企业转型分析,一个通向消费与贸易洞察。这正是第一章"Skill化思维"的体现——采集Skill是可复用的,换一个数据源、换一个分析命题,链条的骨架不变。
在平台上验证:看评论数据如何变成贸易洞察
打开中非跨境贸易AI数智看板(https://zhenyuonline.cn/workflow-demo/deployed/af_trade_ds8k),对比看板上的数字与本节所述的口径:国家分布、星级占比、物流评价——看板上的每一个数字,都能倒查回速卖通公开评论与Kilimall商品页这两批真实数据。再打开工作流画布,找到"中非跨境贸易"预设工作流,观察它的采集节点如何按国家、星级、物流方式完成清洗与统计。你会看到:7589条评论背后的134个国家分布图,每一根柱子都经过了抓取与质检两道关。

图5-7 中非跨境贸易AI数智看板页面渲染
章末小结与追问
本章回答了"数据从哪来、怎么抓、怎么变成可用的数据"三个问题。第一节建立数据来源的方法论——数据来自物理世界与人类活动两大源头,采集方式有传感器采集、接口采集、文件导入、人工录入四种(依据国家标准GB/T 42127—2022),接入方式取决于数据源的开放程度,而元数据、数据标准、数据质量、数据资产管理构成采集之后的第一道秩序。第二节以商业大数据为领域——先讲财务、行情、文本、属性四类数据及其来源通道,再以数字化转型指数为例,看"年报文本+属性数据"如何经词频统计与PCA降维成为指数,并通过API数据服务把财务数据、年报文本数据、词频与指数数据提供给应用。第三节以电商数据为领域——先讲评论、商品、订单、流量四类数据及其获取边界,再以中非贸易为例,看速卖通公开评论与Kilimall商品页如何覆盖134个国家/地区,采集、质检、入库方法与第二节同源,却通向消费洞察与贸易趋势。数据采集的终点,永远是"干净、可用、入库、可被应用调用的数据"。
这条链的思想源头可以追溯到更深处:数据应用有它自己的次序——先有数据,才有分析;先有质量,才有价值,这一编排次序本身就是一种方法论。2015年国务院印发《促进大数据发展行动纲要》,明确提出"建立标准规范体系"[10];GB/T 36073—2018将数据管理能力成熟度分为五个等级,为数据治理提供了可评估的标尺[9];中国信息通信研究院的系列白皮书则为数据来源与数据要素价值提供了权威的数据支撑[1]。企业愿意投入这场采集与转型,是因为数字化已被反复证明会带来产出:杨德明与刘泳文(2018)发现"互联网+"显著提升了企业业绩[18],肖静华(2020)则提醒,转型成效取决于管理适应性变革的同步跟进[19]。本章所讲的采集,是一切数据应用的第一环:数字化转型指数的5467份年报、跨境电商分析的7589条评论,正是这条链上最朴素的起点。它们将汇入第六章的处理管线,变成可分析的干净面板,最终点亮界面上的每一个数字——而那时,请不要忘记,一切的源头,是本章讲的那一次采集。
留三个问题给你想一想:
- 你身边有哪些"数据源"还没被利用?它们属于物理世界还是人类活动?应该用传感器采集、接口采集、文件导入还是人工录入?采集的授权边界在哪里?
- 数字化转型指数应用把年报PDF变成词频统计表,中间经历了哪些可能出错、可能产生脏数据的环节?如果你是质检员,你的检查清单上会写哪几项?
- 在画布上,"采集节点→LLM节点→部署节点"分别对应什么?如果让你为一个学校的数据应用设计工作流,你会选哪个数据源(stock-api / digital-index-api / hs300-api / 年报词频)?部署后如何验证页面数据是真实的?
参考文献
- [1] 中国信息通信研究院. 大数据白皮书[R]. 北京: 中国信息通信研究院, 2019.
- [2] 数字化转型指数项目. 基于SmartBI的上市公司数字化转型指数可查询报告大数据平台项目报告[R]. 2026.(第十六届三创赛商务大数据分析实战赛获奖作品,见数字教材"参赛获奖"附录)
- [3] Salton G, Buckley C. Term-weighting approaches in automatic text retrieval[J]. Information Processing & Management, 1988, 24(5): 513-523.
- [4] 唐松, 伍旭川, 祝佳. 数字金融与企业技术创新——结构特征、机制识别与金融监管下的效应差异[J]. 管理世界, 2020(5).
- [5] Howe J. The rise of crowdsourcing[J]. Wired, 2006, 14(6): 1-4.
- [6] Wang R Y, Strong D M. Beyond accuracy: What data quality means to data consumers[J]. Journal of Management Information Systems, 1996, 12(4): 5-33.
- [7] Hotelling H. Analysis of a complex of statistical variables into principal components[J]. Journal of Educational Psychology, 1933, 24(6): 417-441.
- [8] 中国证监会. 上市公司信息披露管理办法(2021年修订)[Z]. 2021.
- [9] 国家市场监督管理总局, 国家标准化管理委员会. 数据管理能力成熟度评估模型: GB/T 36073—2018[S]. 北京: 中国标准出版社, 2018.
- [10] 国务院. 促进大数据发展行动纲要(国发〔2015〕50号)[Z]. 2015.
- [11] 陈娴, 任渝, 李佳颖, 苟丹. 数字经济背景下大数据标准体系化建设的理论逻辑与实现路径[J]. 2025.(数字经济高质量时代项目论文,项目编号:SZJJ2024YB-034)
- [12] 海关总署. 中国-非洲贸易指数报告[R]. 2023.
- [13] Chevalier J A, Mayzlin D. The effect of word of mouth on sales: Online book reviews[J]. Journal of Marketing Research, 2006, 43(3): 345-354.
- [14] 商务部. 区域全面经济伙伴关系协定(RCEP)[Z]. 2022.
- [15] 国家市场监督管理总局, 国家标准化管理委员会. 智能制造 工业数据 采集规范: GB/T 42127—2022[S]. 北京: 中国标准出版社, 2022.
- [16] 国家市场监督管理总局, 国家标准化管理委员会. 信息技术服务 治理 第5部分:数据治理规范: GB/T 34960.5—2018[S]. 北京: 中国标准出版社, 2018.
- [17] International Data Corporation. Data age 2025: The evolution of data to life-critical[R]. Framingham: IDC, 2017.
- [18] 杨德明, 刘泳文. "互联网+"为什么加出了业绩[J]. 中国工业经济, 2018(5).
- [19] 肖静华. 企业跨体系数字化转型与管理适应性变革[J]. 改革, 2020(4).
数据与平台:本章实训绑定 zhenyuonline.cn 真实应用(数字化转型指数平台 / workflow-demo 工作流画布 / Hermes Lite / 中非跨境贸易AI数智看板)。页面渲染图均为平台实测截图。
该应用源于学生团队在第十六届全国大学生电子商务"创新、创意及创业"挑战赛商务大数据分析实战赛中的获奖作品,奖项与项目报告详见数字教材"参赛获奖"附录。↩