第二章 大模型:从认知到应用
章首:从"人工智障"到"通用引擎"
十年前,如果你跟一个数据分析师说"让计算机自己看懂报表、自己写分析结论",他大概率会礼貌地摇头。彼时的AI还是"人工智障"的代名词:语音助手听不懂方言,机器翻译翻出病句,所谓"智能"离"好用"隔着十万八千里。而今天,同样一个人打开手机,用自然语言让AI写一段分析代码、总结一份年报、生成一张数据图表,已是稀松平常的事。
变化发生在不到十年之间。2017年,Google团队发表《Attention Is All You Need》,提出Transformer架构[1],为大模型铺下了第一块地基;2020年,GPT-3以1750亿参数的规模证明"大力出奇迹"——模型够大,能力会涌现[2];2022年,ChatGPT把大模型送进普通人的对话框;2023年以来,DeepSeek等开源模型把"顶级能力"的成本打了下来[4]——到2026年,国产大模型已形成从万亿参数通用模型到垂直领域模型的完整谱系。我国数字经济总量从2018年的31.3万亿元增长至2022年的50.2万亿元,而大模型正是数字经济最活跃的生产力引擎:写代码、做分析、出报告、设计流程,大模型正在成为各行各业数智化转型的通用底座——数字经济时代的企业管理变革,正因技术底座的重构而全面展开[7]。
对本书读者——高校学生与教师——理解大模型不是为了训练或部署它,而是为了知道如何用好它。这就像学Excel:你不必会写Excel的源代码,但你需要知道它能做什么、不能做什么、什么场景该用什么功能。第一章建立了"LLM+Agent+Skill"的心智框架,其中大模型被定位为"大脑";本章深入这颗大脑的内部——它从何而来(第一节)、如何工作(第二节)、有哪些关键装备(第三节)、如何在本书平台与大厂应用中落地(第四、五节)、如何选型调用(第六节),以及它的局限如何恰恰引向Agent与Skill的必要性(第七节)。七节走完,你将不仅"见过"大模型,而且"用明白"大模型。
第一节 大模型的前世今生
这一节的核心主张:大模型的十年,是"规模"与"效率"两条曲线交汇的十年——先靠堆规模证明能力,再靠提效率把能力普惠。
从Transformer到"大"模型
2017年的《Attention Is All You Need》解决的是一个具体问题:如何让神经网络更好地处理序列数据(文本、语音)。此前的循环神经网络(RNN)按顺序逐词处理,长句子记不住开头;Transformer用自注意力机制让每个词直接"看见"句子里的所有词,并行计算、长程依赖一次解决[1]。这篇论文最初只是机器翻译领域的一项改进,却意外成为整个大模型时代的起点——今天所有主流大模型(GPT、Gemini、DeepSeek、文心一言)的底层架构,都是Transformer。
架构定了,剩下的问题是"多大才算大"。2020年,OpenAI发布GPT-3,参数量达到1750亿——此前的模型以亿计,它直接跳到千亿级。让人意外的不是参数多,而是涌现:没有专门训练,GPT-3就能写代码、做翻译、答常识题,甚至进行简单的多步推理[2]。研究者意识到,"大"本身就是一种能力——规模上去了,模型在训练数据里"读"出的规律就越多。这催生了"大力出奇迹"的Scaling Law(规模定律):模型越大、数据越多、算力越强,能力越强。
从GPT到DeepSeek:开源与效率的革命
2022年11月,ChatGPT发布,两个月用户破亿——大模型第一次成为大众产品。它的关键不在模型更大,而在对齐:通过"人类反馈强化学习"(RLHF),让模型学会"像人一样回答",而不是"像训练数据一样接话"[3]。ChatGPT之后,竞争从"谁更大"转向"谁更好用、谁更便宜"。
转折发生在2023年之后的中国:DeepSeek等团队在效率上做文章——用更巧妙的架构与训练策略,把千亿级模型的能力压缩到更低的训练与推理成本。2025年初,DeepSeek-R1通过强化学习激发模型的深度推理能力,在数学、代码等任务上比肩国际顶尖闭源模型,而训练成本只有后者的一个零头[4]。这是大模型史上第一次,"顶级能力"与"开源可用"同时成立。到2026年,大模型格局已经清晰:闭源巨头与开源社区并行,通用模型与垂直模型分层,API调用成为像水电一样的基础设施。
为什么大模型改变了数据分析的范式
传统数据分析的瓶颈从来不是算力,而是翻译成本:业务人员说"看看今年哪些行业数字化走得快",数据工程师要把它翻译成SQL、Python、可视化代码。大模型把这段翻译直接消解了——它听懂自然语言,输出代码与结论。数据分析的范式从"人学工具"转向"工具学人":你不再需要先成为工具专家,只需要把问题说清楚。这一转变正是第一章"从工具到技能"判断的技术基础:当工具的门槛被大模型抹平,稀缺的只剩方法。
在平台上验证
打开本书实训平台的对话助手 Hermes Lite(Hermes Lite),输入:"用一句话解释什么是大模型,并举一个它改变数据分析方式的例子。"观察它如何组织回答;再问:"大模型和传统统计软件(如SPSS)有什么区别?"你会发现,它回答的不是死记硬背的定义,而是把概念、对比、场景组织成一段有逻辑的话——这就是"理解与生成"能力在真实应用中的样子。
第二节 核心工作机制:大模型是怎么"变聪明"的
这一节的核心主张:大模型不是被程序员"写"出来的,而是被数据与反馈"教"出来的——理解它的训练过程,就知道它的能力从哪来、边界在哪。
训练三阶段:从"识字"到"懂事"
大模型的成长分三个阶段,像一个人从识字、学会说话、到懂得分寸。
第一阶段,预训练(Pre-training)——海量阅读。 模型被喂入几乎整个互联网的文本(书籍、论文、网页、代码),任务只有一个:预测下一个词。读得够多,模型就从文字里"领悟"出语法、常识、知识结构甚至推理模式。这一阶段决定模型的"底子"。
第二阶段,指令微调(Instruction Fine-tuning)——学会对话。 预训练模型只会"接下文",不会"回答问题"。人类标注员写出大量"指令—回答"对("请总结这段文字"→"这段文字……"),让模型学会按指令办事。
第三阶段,人类反馈强化学习(RLHF)——学会偏好。 这是ChatGPT的杀手锏:人类对模型的多个回答排序(哪个更好),模型据此调整自己,学会"讨人喜欢"——不说废话、不冒犯、给出有用的答案[3]。三个阶段合起来,模型从"能读"到"会答"再到"答得好"。
图2-1 大模型训练三阶段
推理:Token预测与注意力
模型"思考"的过程,本质是逐字预测:把输入切成Token(词元,中文一个字或几个字一组),每次预测下一个最可能的Token,再把预测结果拼回去继续预测,直到生成完整回答。支撑这个过程的,是Transformer的自注意力机制——生成每一个字时,模型都"回顾"输入中的所有关键信息,决定当前这个字该侧重什么。这解释了模型的两个特性:上下文越长,可参考的信息越多;生成有随机性(同一问题可能答得略有不同)。
使用者需要理解的两个关键参数
上下文窗口(Context Window):模型一次能"看见"的输入长度。窗口越大,能喂进去的资料越多——本书后续章节处理长年报、长文档时,这个参数直接决定"能不能一次读完"。温度(Temperature):控制生成随机性。温度低(如0.2)输出稳定、适合数据分析与代码;温度高(如0.9)更有创意、适合文案与故事。记住一条实用法则:要准确就调低温度,要创意就调高温度——选对参数,比换模型更常解决问题。
在平台上验证
在 Hermes Lite(Hermes Lite)连续追问三层问题:"大模型是怎么训练的?"→"用初中生能懂的方式再讲一遍?"→"那它训练花多少钱?"观察它如何在不同深度间切换——第一问给术语,第二问给比喻,第三问给数字。这背后就是"理解需求+组织表达"在连续对话中的运转;再问一次同样的问题,你会发现回答略有不同——那就是温度带来的随机性。
第三节 关键技术组件:RAG、MCP与提示词
这一节的核心主张:RAG给大模型装上"记忆",MCP给它装上"双手",提示词给它装上"方向盘"——三件装备,决定了大模型能走多远。
RAG:让模型"先查再答"
大模型的知识截止于训练时刻,问它"学校今年新政策"它答不上来。检索增强生成(RAG,Retrieval-Augmented Generation)解决这个问题:先到知识库里检索相关资料,把检索结果拼进提示词,再让模型基于资料作答[5]。2020年Lewis等人提出这一框架时,目标是让模型在知识密集型任务上引用外部知识;今天它已成为企业知识库问答的标准做法。第一章里Hermes Lite的"先查后答",就是RAG的落地形态。
MCP:让工具"即插即用"
模型上下文协议(MCP,Model Context Protocol)解决另一个问题:每个应用给大模型接工具,都各写各的接口,换个框架全部重来。MCP把"工具长什么样、怎么被发现、怎么被调用"标准化——工具方按MCP提供能力,模型方按MCP调用能力,两边解耦。打个比方:没有MCP,给电脑接打印机要装各家驱动;有了MCP,插上就能用。本书第8章的Hermes Agent正是通过MCP统一接入工具链。
提示词:与模型对话的"接口规范"
提示词(Prompt)是人与模型之间唯一的接口。同样是"分析销售数据","看看销售数据"与"请按季度汇总销售额、对比去年同期、指出异常月份并给出可能原因"得到的回答质量天差地别。提示词工程有成熟套路:角色(你是数据分析师)、任务(做什么)、输入(给什么数据)、输出格式(怎么呈现)。更进阶的技巧是给示例(Few-shot):写一句"例如:'订单什么时候到'→物流问题",模型的行为立刻稳定下来[6]。第8章会看到,给Agent写系统提示词用的正是同一套方法。
在平台上验证
回到 Hermes Lite,输入一个训练数据之外的问题:"查一下数字化转型指数2024年软件行业的均值。"注意看它先出现"正在检索"的提示,再给出带出处的回答——这就是RAG在真实平台上的运行:模型没有硬编这个数字,它先去知识库查,查到再答。对比一下输入"什么是大模型"(不需要查,直接答)与上面这个问题(需要查),你会直观感受到RAG"该查才查"的边界。
第四节 范式延续:本书平台的大模型层
这一节的核心主张:本书实训平台的四个应用,是同一套"LLM+Agent+Skill"范式的四种变体——同一个范式,四类模型,四种用法。
应用拆解一:Hermes Lite——通用对话推理
Hermes Lite(Hermes Lite)的LLM层是DeepSeek v4-flash,通用对话推理型。它承担"理解需求、组织逻辑、生成表达"的通用职责——你问它任何问题,它先理解、再组织、后回答。三层拆解:LLM层负责理解与生成;Agent层负责"先查后答"的编排(需要知识库就检索);Skill层是背后的知识库检索与报告生成能力。
应用拆解二:HS300 Predictor——规则引擎
沪深300预测工具(HS300预测)的LLM层是规则引擎(轻量级LLM),不负责"理解",只负责按既定逻辑执行:匹配意图、查数据、算指标、出预测。为什么用规则引擎而不是大模型?因为预测任务要的是确定性与速度——同样的输入必须得到同样的输出,规则引擎快而稳,不会"发挥"也不会"发挥失常"。这是选型的重要一课:任务要求确定性,就别用会随机发挥的大模型。
应用拆解三:智绘故事工坊——多模型协作
智绘故事工坊(智绘故事工坊)的LLM层是多模型协作:故事扩写用对话模型,图案生成用文生图模型(即梦API),配音用语音合成模型——一个应用里三个模型各管一段。这说明大模型生态是"组合拳":不同模型擅长不同事,编排起来才是完整产品。
应用拆解四:股票估值——推理+数据双驱动
股票估值工具(股票估值)的LLM层做两件事:理解用户输入(股票代码或问题),生成估值解读。但它不算"算",计算交给DDM/CAPM模型(Skill层)——大模型只负责"把数字翻译成人话"。
四个应用放在一起看,范式的一致性立刻显现:LLM理解与生成、Agent编排流程、Skill封装能力——同样的三层,模型换成对话型/规则型/文生图型/语音型,应用就从问答变成预测、创作、估值。这就是第一章"框架不变,工具可换"的活案例。
在平台上验证
依次打开四个应用(zhenyuonline.cn 首页应用库),各输入一个典型问题:Hermes Lite问"数字化转型指数是什么"、HS300查"300成分股"、智绘故事工坊写"一只小熊的太空冒险"、股票估值输入"600519"。观察四者的LLM层表现差异:谁在理解、谁在执行、谁在创作、谁在解读——用一张表记下差异,你就完成了本书平台LLM层的第一次"普查"。
第五节 范式扩张:大厂AI应用拆解
这一节的核心主张:大厂的AI应用与本书平台同构——LLM+Agent+Skill不是一家之言,而是行业共同的语言。
豆包:字节跳动的全能助手
豆包(字节跳动)的定位是"人人可用的AI助手":对话、写作、翻译、图片生成一体。拆开看:LLM层是字节自研大模型,负责理解与生成;Agent层处理"帮我查一下北京的天气并规划周末行程"这类多步任务;Skill层是内嵌的搜索、图像、语音能力。与本书平台对比:Hermes Lite的"先查后答"与豆包的"搜索增强回答"是同一个机制,只是规模与入口不同。
淘宝AI导购:电商场景的垂直Agent
淘宝AI导购(阿里巴巴)是垂直场景Agent的样板:用户说"帮我找一款5000元以内的轻薄本",AI导购理解需求(品类、预算、偏好)→检索商品库(Skill)→按需求排序推荐→解释推荐理由。它的LLM层是通义千问系列,Agent层是电商导购流程,Skill层是商品检索与比价。这与本书第十一章供应商AI采购系统的"数据检索+评分判断"链路同构。
文心一言:知识增强的中文大模型
文心一言(百度)的特点是"知识增强":在通用大模型之上挂了百度的知识图谱与搜索能力,回答中文问题时能引用更多事实性信息。它的三层拆解同样成立:LLM层是ERNIE系列,Agent层处理多轮任务,Skill层是知识检索。文心一言给本书的启示:中文场景的知识增强(RAG的工业级实现)是中文大模型的重要竞争维度——这与本书"检索增强+AI解读"的设计思路不谋而合。
在平台上验证
选一个你熟悉的场景(购物、出行、写作),分别在大厂应用(豆包/淘宝/文心一言)与本书平台(Hermes Lite/股票估值)上执行同一个任务,记录:谁在"想"、谁在"查"、谁在"做"。你会发现,无论产品形态差多远,背后都是同一套三层协作——这就是范式的力量。
第六节 选型与API实践:如何调用大模型
这一节的核心主张:选模型不是选最聪明的,而是选最合适的——按任务性质、成本、可控性三把尺子选型,是数智分析的基本功。
三种使用方式
使用大模型有三种方式,成本与能力逐级上升。网页对话(ChatGPT、DeepSeek官网):零门槛,适合体验与轻量任务,但无法嵌入自己的系统。API调用:把模型能力嵌入自己的程序或工作流——本书实训平台就是这么做的,按Token计费(输入+输出各计费),适合产品化。本地部署(开源模型如DeepSeek-R1[4]):数据不出内网,适合隐私敏感场景,但需要算力与运维。三种方式不是替代关系,而是按场景选择:体验用网页、产品用API、涉密用本地。
模型选型决策树
选型的本质是三把尺子:任务类型(对话/代码/创作/分析)、知识需求(要不要实时或私有知识——要就配RAG)、约束(成本、延迟、隐私)。一张简化的决策树:
图2-2 模型选型决策树
API调用实战:调一次DeepSeek
以DeepSeek为例,API调用只需三步。第一步,在DeepSeek开放平台申请API Key;第二步,写一段调用代码(Python):
import requests
resp = requests.post("[https://api.deepseek.com/chat/completions](https://api.deepseek.com/chat/completions)",
headers={"Authorization": "Bearer 你的Key"},
json={"model": "deepseek-chat",
"messages": [{"role": "user", "content": "用一句话解释数字化转型指数"}]})
print(resp.json()["choices"][0]["message"]["content"])
第三步,运行并观察返回。注意三个实践要点:系统提示词(System Prompt)里写清角色与约束("你是数据分析师,只回答基于数据的问题");温度按任务设置(分析0.2、创作0.8);错误处理——网络超时重试、返回格式异常时检查参数。本书实训平台的Hermes Lite就是这样一个"封装好"的API调用,你在对话框里的每一次提问,背后都是同样的请求-响应循环。
在平台上验证
打开 Hermes Lite,观察它回答时的速度与稳定性;再对比DeepSeek官网直接对话——两者用同一个模型,但Hermes Lite多了知识库检索(RAG)与Agent编排。这个对比让你理解:模型是引擎,工程是整车——同样的引擎,装在不同的工程里,体验完全不同。这也是本书反复强调"LLM+Agent+Skill"而不仅是"用大模型"的原因。
第七节 局限与应对:大模型的边界
这一节的核心主张:大模型的边界——知识截止、幻觉、不稳定——不是缺陷,而是Agent与Skill存在的理由。
幻觉:一本正经地编造
幻觉(Hallucination)是大模型最著名的毛病:它可能用笃定的语气说出不存在的数字、事件或来源。原因在于,模型的"知识"是统计规律而非事实库——它追求"像样"而非"真实"。缓解手段有三级:提示词约束("不确定就说不确定")、检索增强(让模型基于检索到的真实资料作答,RAG正是为此而生[5])、人工校验(关键结论人工核对)。AI安全研究早就指出,让模型在不确定时"承认不知道",比让它强行作答更重要[8]。
知识截止与上下文限制
模型的知识止于训练时刻——2024年后的事它不知道;上下文窗口有限——长文档装不下。这两条边界直接指向本书的解法:知识截止用RAG补(实时检索),上下文限制用Agent拆(分块处理、多步执行)。第8章的RAG知识库问答、第5章的分块采集,都是对这两条边界的工程回应。
安全与伦理:能力越大,责任越大
大模型的安全议题包括:被提示词注入劫持(用户输入里夹带恶意指令)、生成有害内容、隐私数据泄露、被滥用于虚假信息。学界与产业界的共识是"对齐"(Alignment)——让模型的行为与人类意图一致[8];工程上的做法是权限最小化、输出过滤、人工闸门(第3章安全边界会系统展开)。对使用者而言,记住一条:大模型的输出是"建议"不是"事实",是"草稿"不是"定稿"——决策的责任始终在人。
在平台上验证
在 Hermes Lite 问一个训练数据之外的具体数字:"2025年中国GDP是多少?"观察它的回答——如果它犹豫或承认不知道,说明它"诚实";如果它硬编一个数字,说明它在幻觉。再问"数字化转型指数2024年软件行业均值",对比它与上一个问题的差别——后者经过RAG检索,数字有出处。"有出处"与"无出处",就是本书判断AI输出可信度的分水岭。
章末小结与追问
本章沿着"从认知到应用"的路径走完了大模型的七站:从Transformer到DeepSeek的十年演进(第一节),训练三阶段与推理机制(第二节),RAG/MCP/提示词三件装备(第三节),本书平台的四种LLM用法(第四节),大厂的同构实践(第五节),选型与API调用(第六节),以及最终引向Agent与Skill的局限(第七节)。回到第一章的判断:大模型负责"想",Agent负责"干",Skill负责"标准动作"——大模型是引擎,但它需要车架(Agent)与配件(Skill)才能跑起来。第3章开始,我们把引擎装上车。
留三个问题给你想一想:
- "规模"与"效率"两条曲线——2026年的今天,大模型的竞争更偏向哪条曲线?对你选择学习路径有什么启发?
- 规则引擎与通用大模型,一个"死"一个"活"——在你熟悉的业务里,哪些环节该用"死"的(确定性),哪些该用"活"的(生成性)?
- RAG给模型装上记忆、MCP装上双手——如果让你给大模型再装一件"装备"解决一个现实问题,你会装什么?
参考文献
- [1] Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[C]. Advances in Neural Information Processing Systems 30, 2017.
- [2] Brown T B, Mann B, Ryder N, et al. Language models are few-shot learners[C]. Advances in Neural Information Processing Systems 33, 2020. arXiv:2005.14165.
- [3] Ouyang L, Wu J, Jiang X, et al. Training language models to follow instructions with human feedback[J]. arXiv preprint arXiv:2203.02155, 2022.
- [4] DeepSeek-AI. DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning[J]. arXiv preprint arXiv:2501.12948, 2025.
- [5] Lewis P, Perez E, Piktus A, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks[C]. Advances in Neural Information Processing Systems 33, 2020. arXiv:2005.11401.
- [6] Wei J, Wang X, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models[J]. arXiv preprint arXiv:2201.11903, 2022.
- [7] 戚聿东, 肖旭. 数字经济时代的企业管理变革[J]. 管理世界, 2020(6).
- [8] Amodei D, Olah C, Steinhardt J, et al. Concrete problems in AI safety[J]. arXiv preprint arXiv:1606.06565, 2016.
数据与平台:本章实训绑定 zhenyuonline.cn 真实应用(Hermes Lite / HS300预测 / 智绘故事工坊 / 股票估值)。页面渲染图均为平台实测截图。