【可执行状态】引擎部分现在就能做(lit_card、term_table、docx_polish、translate_pdf 已接);线上深度研究工作台随教学套件接入——接入前,本讲的方法与校验点可直接用;要跑通“拆问题 → 并行搜索 → 查漏补搜 → 成稿”这一整条链,按第 4 讲的做法在画布上自己接一遍
【本讲对应资产】research-assistant 引擎(8 个工具);本讲关键工具 lit_card(出证据)、term_table(统一术语)、docx_polish(成稿排版),配合 translate_pdf(外文材料);线上深度研究工作台、工作流画布
【本讲原理来源】L3 第 25 课《实战项目:DeepResearch 设计与实现》(云帆老师,2026-09-15)、L3 langGraph 专题(状态/节点/边)
先问一句:上一次你交出去的那份调研报告,如果别人挑出三个关键数字,请你当场把来源点开给他看,你能点开几个?
多数人的答案是零个。不是没查,而是当时只是“看见过”:看见过一篇文章说这个行业到处缺人,看见过一个 PPT 说这个市场很大,看见过一份红头文件被人截图发在群里——当时觉得对,就写进稿子了。三个月后要复查:链接打不开,文件名记不清,连那个机构到底叫什么都不敢确定。
这种报告的毛病不在于写得少,而在于每一句话后面都没有一条能追回去的线。这一讲要换掉的正是这个状态:每处引用都要经得起别人顺着线追到原文——追得到,才叫来源;追不到,那只是一张写着字的纸。
教改课题要交申报书,前期调研那一栏还空着。或者更日常一点:下学期的课要换一个新案例,赵老师(化名,智能金融学院讲师)打算先看看这个行业今年的情况。
她打开浏览器,接下来两个小时大概率是这样过的:先搜关键词,开十几个页面;看着有用的复制到文档里;看到第三篇发现数据口径和第一套不一样,回头去核;核完又发现有个关键数字找不到出处;再顺手点开一篇,发现是两年前的政策,文件名上还写着“最新”。比如,她想找一份政策文件的原件,前后打开四个页面——两个是转载、一个是摘要、一个要登录——原件始终没见到。时间过去一半,报告一个字没写。
再比如,她把一篇行业文章里的话抄进草稿,要标来源时才发现那篇文章自己也是转述:写的是“据某机构测算”,而那个机构是谁、报告发在哪,文章里一个字没说。
“查资料”和“整数据”这两件事,占掉的往往是我们八成的有效时间,而它们恰恰最不产生判断力——它们只是让你的判断有依据。
换一种做法会怎样?同样两个小时,产出可以是四样:一份分好小标题的报告初稿、一份能点开的来源清单、一份它自己写“哪里还薄”的自查清单、几张能逐句回原文核的精读卡。就像做菜前的备料:洗好、切好、分盘摆开,真正属于厨师的那一步——怎么炒——才轮到你。区别不在于她查得更快,而在于她把“查”拆成了几道能分别交付的工序。
这一讲练的动作是:交出一个问题,收回一份每句话都能追回去的报告初稿。
第一代,资料室与卡片目录。 卡片按著者、书名、主题三套排开,期刊有卷期索引,政策有年鉴和文件汇编。它解决“东西在哪一册里”,交给你的不是报告,是一张书单。
第二代,联机文献数据库。 二十世纪七十年代起,Dialog 一类联机检索让机器替你在索引里找;九十年代后 CNKI、万方、Web of Science 把这套搬上网页,用“并且/或者/非”收窄范围。但给你的仍是题录与摘要——原句在第几页,还得自己翻。
第三代,通用搜索引擎。 关键词加链接列表,把翻找成本几乎降到零。老问题是:给的是相关页面,不是可信结论,来源与口径全靠你一条条判断。
第四代,检索增强生成(RAG)。 二〇二〇年,Lewis 等人提出把外部语料检索与大模型生成接起来[1]:先取出相关段落,再让模型基于这些段落作答。它把“读”也自动化了,却留下一个毛病——片段被揉成一句看不出出处的话。
第五代,就是这一讲的带溯源深度报告。 它把前几代各接一段:资料室的分类查找、数据库的题录齐全、搜索引擎的随手可得、检索增强的自动读,最后补上最要紧的一条——每处引用都能追回原文,并写清核实到了哪一档。
| 代 | 代表做法 | 解决了什么 | 留下的老问题 |
|---|---|---|---|
| 一 | 卡片目录 / 卷期索引 | 知道东西在哪一册里 | 查到的是书单,不是结论 |
| 二 | 联机文献数据库 | 题录与检索式自动化 | 原句与页码仍要自己找 |
| 三 | 通用搜索引擎 | 翻找成本几乎归零 | 相关不等于可信 |
| 四 | 检索增强生成(RAG) | 连“读”也自动化了 | 出处被“揉掉”,追不回去 |
| 五 | 带溯源的深度研究报告 | 拆问 → 补搜 → 成稿 → 来源清单 | 初稿仍要人逐条核实,不能直接署名 |
最该记住的是最后一列:每一代都留下了老问题,第五代留下的那个——“初稿仍要人逐条核实”——正是本讲最硬那条纪律要处理的事。工具每往前一步,人的核对责任不是变小,而是变得更精确。
| 台阶 | 查几轮 | 它交给你的东西 | 你还要补的活 |
|---|---|---|---|
| 第一级 | 一轮 | 一堆链接加一段话 | 几乎全部:找依据、判真假、成稿 |
| 第二级 | 多轮、多说法 | 材料基本齐 | 判断哪些能用、怎么组织 |
| 第三级 | 多轮 + 自查 + 补搜 | 带来源的初稿 + 自查清单 | 逐条核实、下结论、署名 |
一句话记住差别:第一级给你一堆链接,第三级给你一份报告。
对照第 4 讲学过的画布(状态 = 共享黑板,节点 = 一道工序,边 = 顺序与循环),这条链是四道工序接起来的:
第 3 道工序是分水岭:普通检索查完就交差,这一步是查完之后还问一句“我是不是漏了什么”。打个比方,前两道工序像把菜谱上的东西全买回来,第三步才是站在灶台前清点——盐够不够?姜买了吗?少了哪样,这时还来得及下楼补。
(图号待全篇统一重编:现文件名为 images/fig9-1.svg。)
判“错”靠三招:多源交叉验证(同一结论至少两处独立来源都这么说才敢用)、逻辑一致性检查(前后对不上、时间线不成立处标出来)、主动去找撤稿与勘误。判“不全”靠两招:先列一张“该有的视角”清单(政策、市场、技术、成本、反面意见……)逐条对照,缺哪个角度就补查;二是反思——让它自己回看已查材料,说出“哪里还薄”。
这对应吴恩达反复讲的那个模式:先给出标准,再让系统照着标准检查自己的产出[2]。 好比班里收作业,先发一张评分标准让学生自己勾一遍,交上来的东西往往比埋头誊一遍更完整。
研究工作台负责“查”,research-assistant 引擎负责把材料变成能交出去的东西:
| 交给谁 | 干什么 | 为什么不能让“写”来兼管 |
|---|---|---|
lit_card | 出证据:研究问题/方法与样本/可引用原句/局限 | 报告里每句引用要有原句可核;卡是证据链的一环 |
term_table | 统一术语:英中定译 + 语料频次 | 多来源材料术语各异,一份报告里一个概念只能有一个说法 |
docx_polish | 成稿排版:中文字体/标题层级/图题表题/表格边框/图片缩放/页码 | 报告是给评审、给同事看的正式件,不是聊天记录 |
translate_pdf(配合) | 外文材料转中文 Word,便于吸收 | 读得快,但引用仍回英文原文 + DOI |
lit_card 的卡固定四栏:研究问题、方法与样本、可引用原句、局限(第 14 讲已细讲)。在这条链上,它的角色是把“结论”还原成“一句能核的原话”。例如,报告里写“某研究认为课堂即时反馈能提升参与度”,出处不能只挂一个刊名——要挂上卡里的原句和页码,人家拿去原文一搜就命中。
term_table 管的是一义一译。多来源材料最容易出的丑是同一概念三种译名:一份稿子里同时出现“生成式人工智能”“生成式 AI”“生产式 AI”,读者会以为你在说三件事。好比一份菜单上同一道菜写了三个名字,客人只会以为厨房乱。
报告里凡引用外部材料,每一处都要写清三件:发布单位(部委/省市厅局/学校/期刊/机构)、文号(政策与文件类,照原始文件抄,格式如“×××〔20XX〕XX 号”)、核实状态(分三档)。发文字号的构成(机关代字、年份、序号)在国家标准的公文格式规范里有明确规定[3]——文号只能从原文抄,不能凭记忆写、不能从二手转述里搬。
| 档次 | 什么意思 | 什么时候用 | 能不能进正式稿 |
|---|---|---|---|
| 已核实 | 找到原文,并逐字看过 | 见到原件或官网原文 | 可以,直接引用 |
| 待核实 | 只见到别人的转述 | 二手转载、文章里的“据……” | 写明后可暂放;不得作关键结论的依据 |
| 存疑 | 口径、年份或标题前后对不上 | 同一文件两个文号、两个日期、两个说法 | 查清前不进稿 |
没有这三件,就当作没来源。 一篇报告里只要出现一处“找不到出处”的引用,整份材料的可信度都要重新评估——评审看的就是这个。
不知道——除非你按办法去验。三步可机械执行:第一步抽三个关键数字点开来源,是链接就点开,是文献就查题录,这步不需要专业判断,只要肯点;第二步看数字有没有年份,没标年份的一律当“待核”——举个例子,只写“人才缺口很大”而不写是哪一年的测算,这句话根本追不回去;第三步看有没有反方观点,只说好话的报告必然有偏。
假设你偷了这三步,把初稿直接交上去,评审挑一个数字问“这个数从哪来”,你当场就得承认答不上——那一刻,几万字的材料会一起被怀疑。核实保住的不是某一个数字,是整篇的可信度。
会,而且这是最危险的一种错,因为文号看起来最“像真的”。“×××〔20XX〕XX 号”这种格式机器写起来毫无障碍,但写对格式不等于真有这份文件。办法只有一条:文号回原文抄——见到原件或官网原文,一个字一个字对一遍,标“已核实”;只见转述的,就老实标“待核实”。再比如,同一份文件在两条来源里出现两个日期,几乎一定意味着其中一处是二手转述,甚至把两份文件混成了一份;这时该做的是把两处都列出来去官网核原件,核不到就标“存疑”,不写进正式结论。
不能。它交的是“带来源的初稿”,不是成果。初稿要做完三件事才算你的:读完(不读完不引用、不署名、不提交)、核实(每条引用三件齐、每句可引用原句回原文核)、加判断(哪条材料值得用、结论怎么下,是你的活)。
打个比方:这就像请人替你采买了一批食材、洗好切好摆上案板——省掉的是跑菜场和择菜的时间,但最后那道菜什么味道,还得你自己掌勺。买回来的东西,终究要由你来尝第一口。
lit_card 是服务端去取 PDF(参数名就叫 pdf_url),取到后由模型在页面里找四栏内容;服务端自动抓取有时会截取不合格——抓到封面页、摘要页或版本不对的那一份。出卡后每句“可引用原句”必须人工回原文逐字核,搜不到的删掉或重出。说清这些不是自我贬低,而是把期望放对:这一讲解决的是“查得快 + 引得住”,不是“不用查、不用读”。
第一段(查——研究工作台):不要只丢一个词,一句话里说清四样——问什么(题目 + 时间、地域、行业三个范围)、给谁看(申报书前期调研 / 教研分享 / 课程案例)、要什么产物(带小标题的报告,几页、哪几个部分)、要来源(关键数字带来源与年份;政策类带发布单位与文号;最后附来源清单)。
请做一份关于“县域直播电商人才需求”的调研报告,范围限 2024 年至今的国内材料,
给教改申报书的前期调研栏用,要有政策、市场、人才缺口、典型做法四个部分,不超过两千字,
每个关键数字后面标来源与年份,政策文件标注发布单位与文号,最后附来源清单,
并说明哪些来源是你打开了原文核实过的。
第二段(成稿——引擎,点工具名):
用lit_card给我要引用的这几篇文献各出一张精读卡,pdf_url给公网 PDF 直链
(优先出版社 OA),meta 写清刊/年/DOI/被引/许可;每张卡里给“可引用原句”,我要拿它逐句回原文核。
再用term_table把这份报告涉及的多来源术语统一成一张英中定译表(texts_json传报告要点文本)。
最后用 docx_polish 把定稿 docx 排一遍:中文字体、三级标题、图题表题、表格边框、图片缩放、页码。(实在的经验:自查清单常被忽略,但它最有用——它是你判断“这份初稿能不能用”的第一手依据。)
lit_card 出的原句逐条在 PDF 里搜一遍,搜不到的删掉——服务端抓取有时截取不合格,出卡后必须人工核对term_table 那张表逐词对一遍| 症状 | 查哪里 |
|---|---|
| 报告很空,像百科词条 | 题目太宽(“谈谈数字经济”);加上时间、地域、行业三个范围词 |
| 只有背景没有数据 | 指令里没要求“关键数字带来源与年份”;补上再跑一次 |
| 同一个数字两个版本 | 材料打架:让它把两处出处都列出来,你判断哪个口径可用 |
| 全篇只说好话 | 指令里加一句“必须包含至少一个反方视角或风险” |
| 引用文献找不到 | 别信第二手引用;顺藤摸到原始出处的才引用 |
| 政策只有标题没有文号 | 明确“政策类须标发布单位与文号”并按原文抄;抄不到原文的,核实状态写“待核实” |
| 精读卡里的原句在原文搜不到 | 服务端抓取时截取不合格。改用公网 PDF 直链(优先 OA)重新出卡,再逐句核 |
| 同一政策两个文号或两个日期 | 一定有一处是二手转述。以原文为准,重标核实状态 |
| 术语三种译法 | 没做术语统一。用 term_table 出一张表,写作与统稿都以它为准 |
| 用了好几年前的数据 | 明确写“限 2024 年至今”,并在校验时抽查年份 |
| 排版后图表错位、页码乱 | 内容没定就排了。先定稿再 docx_polish,改完内容重排一次 |
| 直接把初稿当成果交 | 这是红线:署名的人要对每一句话负责 |
例如,报告里写“某年某机构测算,行业人才缺口很大”,来源栏只填了一个机构名。假设换一位老师复核,他既找不到这份报告,也判断不了这个机构是否权威。正确改法不是删掉这句,而是把它降级——标“待核实”,并注明“尚未找到该机构公开发布的报告原文”。
translate_pdf 转中文便于吸收(第 14 讲);查到的政策进入申报书“前期调研”栏时,用第 15 讲的单一数据源(课题字典)统一口径——调研里的数字与正文里的数字必须是同一个;定稿交 docx_polish 排版(第 16 讲同款动作)凡引用必标来源——发布单位、文号、核实状态,三件齐了才叫来源;追不回去的话,就不该写进报告。
| 你要干的活 | 工具全名 | 关键参数 |
|---|---|---|
| 出证据:文献精读卡(含可引用原句) | mcp__research-assistant__lit_card | pdf_url(必填,公网直链)、meta(刊/年/DOI/被引/许可)、zh_docx_url |
| 统一术语:英中定译 + 频次 | mcp__research-assistant__term_table | texts_json(文本或公网 URL 的数组) |
| 成稿排版:字体/标题/图表/页码 | mcp__research-assistant__docx_polish | docx_url |
| 外文材料转中文 Word | mcp__research-assistant__translate_pdf | url、mode(auto/translate/convert)、filename |
lit_card 出证据(原句可核)、term_table 统一术语、docx_polish 成稿排版[1] Lewis P, Perez E, Piktus A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[C]//Advances in Neural Information Processing Systems (NeurIPS), 2020, 33: 9459-9474.
[2] Ng A. Agentic AI(智能体式人工智能)[EB/OL]. DeepLearning.AI, 2024.(“先给标准,再让系统自查产出”这一模式的出处)
[3] 国家质量监督检验检疫总局, 中国国家标准化管理委员会. 党政机关公文格式: GB/T 9704—2012[S]. 北京: 中国标准出版社, 2012.(发文字号的构成与标注方式,是“文号照原文抄”的格式依据)
[4] 中共中央办公厅, 国务院办公厅. 关于进一步加强科研诚信建设的若干意见[Z]. 2018-05-30.
[5] 教育部. 高等学校预防与处理学术不端行为办法:教育部令第 40 号[Z]. 2016-06-16.(抄袭、篡改、伪造等行为的界定依据)
数据与平台:本讲工具能力与限制来自 zhenyuonline.cn 的 research-assistant 引擎(lit_card/term_table/docx_polish/translate_pdf,2026-09-17 核对);“服务端抓取有时截取不合格、必须人工回原文核”“位置粒度到页码不保证到行号”为实测确认的能力边界,如实写出,不作粉饰。