【可执行状态】现在就能做(只需手上有公网可访问的 PDF 直链,优先出版社 OA 链接)
【本讲对应资产】research-assistant 引擎(8 个工具);本讲关键工具 translate_pdf(外文 PDF 译中文 Word)、lit_card(文献精读卡)、term_table(术语表)
【本讲原理来源】L3 第 20 课《Function Calling 深度解析》(工具说明书三要素:叫什么、什么时候用、要什么参数)——本讲落在“给工具喂对参数”这一条上
先问一句:你上一次读完一篇外文文献,合上电脑的时候,手上有几样东西是可以直接放进稿子的?
多数人的答案是零。读了两三个晚上,笔记攒了几百字,可等到真要写“某某(2023)指出……”的时候才发现:笔记里没有页码,没有原句,只有一句自己当时的转述。于是翻回去找,找四十分钟,找到的还未必是那一句。更麻烦的是同一篇材料里同一个词,前一次记成“生成式人工智能”,后一次记成“生成式 AI”,读者会以为你在说两个东西。
问题不在读得慢,而在读的方式没有产出“可引用的东西”。这一讲要换掉的就是这个产出形态:从一篇 PDF 到一张卡,卡上写着能直接进你稿子的一行原句,以及它在原文的哪一页。
赵老师(化名,智能金融学院讲师)下个月要交一篇教改论文,文献综述这一节还没动笔。她手上有三篇英文文献,都是开放获取的 PDF:一篇讲生成式 AI 的教学应用,一篇讲课堂数据的分析方法,还有一篇是同行做的准实验研究。教研室的要求是“综述不能只是罗列,要有比较”。
她上周的实际情况是这样的:晚上七点打开第一篇,二十页,逐句看,看到十点半;合上电脑,记住的是“大概讲了 AI 对教学有帮助”。第二天要引用其中一句话,翻回去找了四十分钟,才在第 7 页一段的中间找到;再往后写,发现同一个词,前一段译成“生成式人工智能”,后一段译成“生成式 AI”,还有一处写成“生产式 AI”。
三篇文献,她花掉两个晚上,最后只得到三条笔记——而且这三条笔记一条都不能直接引用,因为不知道页码。
这样的下午并不稀奇。比如,她上一次写课程小结,想引一句政策原文来说明“为什么这门课要改”,结果翻了半小时,最后引的是某篇公众号文章里的转述——连政策文号都写错了。
换一种做法会怎样?同样是两个晚上,产出可以是三样:三张精读卡(每张四栏齐)、一张术语表(一个术语一个中文定法)、一份中文译文(速读用)。区别不在于她读得更快,而在于她把“读”拆成了三道能分别交付的工序。就像切菜和炒菜分开:一次只干一道工,每道工序都有一样能拿得出手的东西。
这一讲练的动作就是:把“读文献”变成一张可引用的卡。
lit_card 产出的精读卡,固定四栏:研究问题 / 方法与样本 / 可引用原句 / 局限。
这四栏不是随便挑的,它对应你写作时真正会用到的四件事:
| 卡的栏目 | 你写论文时拿它干什么 |
|---|---|
| 研究问题 | 综述里“某某(2023)关注的是……”这一句的主语 |
| 方法与样本 | 比较不同研究时“一篇用问卷、一篇用准实验”的依据 |
| 可引用原句 | 直接进你稿子的那句引文,附页码位置 |
| 局限 | 相当于替你把作者的自我批评挑出来,是你提“研究缺口”的原料 |
前三栏是“别人做了什么”,第四栏是“还差什么”——你的论文有没有价值,靠的正是第四栏。
举个例子:三篇文献里如果两篇都是小样本问卷、一篇是准实验,那么“现有研究以自报式问卷为主,缺少课堂过程数据”这一句,就是从第四栏里长出来的。再比如,三张卡摊在桌上横着读,你一眼就能看出“没人研究过混合式课堂的即时反馈”——研究问题就这么冒出来了。
打个比方:这四栏其实像一份体检报告的四个固定栏目——病因(研究问题)、检查手段(方法与样本)、关键指标(可引用原句)、并发症与风险(局限)。换一家医院看,栏目还是这四个,你比对着看就行。
“读文献、做笔记”不是新鲜事,它换过好几代做法,每一代都在解决上一代留下的一个痛点。看清这条线,你就知道今天这一步走到了哪里。
第一代,摘录本与卡片盒。 十六七世纪欧洲学者用 commonplace book(摘录本):读到好句子就抄进去,按主题分栏。二十世纪把这个做法推到极致的是德国社会学家卢曼——他用一盒盒编号索引卡(Zettelkasten),每张卡只写一个想法,卡与卡互相引用,三十年间攒出七十多本书[1]。卡片盒最要紧的发明不是“记”,而是“每张卡只装一件事,而且能被别的卡引用”。
比如今天还有人保留着这个习惯:读一篇论文,抽出一张 A6 卡,正面写结论,背面写页码与自己的疑问。差别只在于,卢曼当年是手写,我们现在可以让机器把卡片先起草好。
第二代,文献管理软件。 二十世纪八十年代末起,EndNote、RefWorks、Zotero 这类工具出现,解决的是“存和排”:存下题录、自动生成参考文献表、按刊物体例换格式。它把引用格式自动化了,但它不读内容——它管的是“引用长什么样”,不管“这句话在原文哪里”。
第三代,检索增强生成(RAG)。 二〇二〇年,Lewis 等人提出把外部语料检索与大模型的生成接起来[2]:先从资料库里检索出相关段落,再让模型基于这些段落作答。它大幅降低了“翻找”的成本,但模型仍然可能把检索来的片段揉成一句看不出出处的话。
第四代,就是这一讲的精读卡。 它把前三代各接一段:卡片盒的“一卡一事”、文献管理器的“题录齐全”、检索增强的“自动抓取”,最后补上最要紧的一条——每一条可引用原句都要能追回原文的位置。
| 代 | 代表做法 | 解决了什么 | 留下的老问题 |
|---|---|---|---|
| 一 | 摘录本 / 卡片盒 | 内容有处可查 | 页码常丢,全凭手抄,抄错无人发现 |
| 二 | EndNote 一类文献管理软件 | 题录与引用格式自动化 | 不管内容,原句仍要自己找 |
| 三 | 检索增强生成 | 翻找成本大幅下降 | 出处可能被“融掉”,读者追不回去 |
| 四 | AI 精读卡(lit_card) | 抓取 + 原句 + 位置三样一起给 | 抓取可能不合格,必须人工核 |
这张表最该记住的是最后一列:每一代都留下了老问题。第四代留下的那个老问题——“抓取可能不合格”——正好是本讲第一条纪律要处理的事。工具每往前一步,人的核对责任不是变小,而是变得更精确。
这是一条纪律,不是一条便利:引用必须能溯源。
学术写作里的引用,本质是一个可核对的承诺——“这句话在原文里”。承诺能不能兑现,是可以机械验证的:把那一句拿去原文里搜,逐字命中,就算兑现;搜不到,就是没兑现。
打个比方:这就像借条。借条上写“今借到三千元”,你拿着它去找人,账要对得上;如果你手上只有一句“我印象里借过钱”,那这张条子在真要对账的时候什么也证明不了。精读卡上的“可引用原句”,就是学术写作里的那张借条。
所以精读卡的用法有一条铁律:出卡之后,每一句“可引用原句”都要人工回原文核一遍。
核不过的,删掉或者重做——不许“看着像”就放进稿子。这是本讲最硬的一条,本读本后面所有讲都按这个标准来。
会。所以才有上面那条铁律。
lit_card 是服务端去取 PDF 的,取到之后由模型在页面里找“研究问题、方法与样本、可引用原句、局限”。模型做的是语义判断,语义判断有概率性。真实碰到过的情形是:服务端自动抓取时截取不合格——抓到的是封面页、摘要页,或者是版本不对的那一份,于是卡里出现的句子在正文里根本搜不到。
处理办法只有一条,而且不可省:给公网可访问的 PDF 直链(优先出版社 OA 链接),出卡后逐句回原文核。
核对的办法很土,但最有效:把卡里那句原句整段复制,粘进 PDF 阅读器的搜索框,按下回车。能搜到,就是真话;搜不到,删掉重出。允许的差异只有断行和连字符——差一个词就算不过。
假设你偷了这一道懒,把没核过的原句放进稿子。评审只要复制那一句去搜,搜不到,你写了几万字的那篇稿子会一起被怀疑。这就是为什么核对不能省——它保住的不是某一句话,是整篇的可信度。
不能。这是本讲第二容易犯的错。
translate_pdf 把外文 PDF 译成中文 Word(url 给公网 PDF 地址,mode 可选 auto/translate/convert;中文 PDF 保真直转也用同一个工具)。它解决的是读得慢,不解决引什么。
工具说明里写得很直白:引用一律用英文原文 + DOI。
好比看病:你可以请人把一份外文病历翻成中文给你看,但要做医疗鉴定,用的还是那份外文原件。译文“能读懂”不等于“能引用”。
| 用途 | 用什么 | 能不能进稿子 |
|---|---|---|
| 快速读懂一篇外文文献 | 中文译文(translate_pdf) | 不能,仅供自己速读 |
| 写“某某认为……”这类转述 | 英文原文,你自己读懂后写 | 可以,但转述的准确性由你负责 |
| 直接引一句话 | 英文原文原句 + DOI + 页码 | 可以,必须回原文逐字核过 |
不能。这叫转引,是学术写作里最容易被追问、也最容易翻身不及的一类问题。
别人文章里引的那句话,你要回到原始文献去核。理由很实在:中间那个人可能抄错了、可能改了一个限定词、可能引的是预印本而正式版已经改了结论。假设你照着二手转引写进自己的稿子,一旦被问“你读过原文吗”,整段的可信度都会跟着掉。
正确做法是三步:从别人的参考文献里拿到原始文献的题录与 DOI——找到原始文献——自己出卡、自己核句、引原始文献。这一步多花二十分钟,换来的是“我问心无愧”。
term_table 出的是“英中定译 + 语料出现频次”。它输入是一组文本或公网 URL(texts_json),不传就按内置的教育 + AI 术语清单出一张空表。
它的用处只有一个:同一篇论文里,一个术语只能有一个中文说法。
赵老师那篇稿子里同时出现“生成式人工智能/生成式 AI/生产式 AI”,读者会以为你在说三个东西;如果是外文刊的审稿人,他会以为你没认真读过领域内的通用译法。术语表就是那把尺子,后面第 16 讲写论文时,它会被当作 terms 参数传进去,直接约束用词。
它还有个附带好处:这是一份可复用的教研室资产。 一个课程组共用一张术语表,学生作业、教案、论文里的译名就统一了;这张表也能直接进课程资源包。好比一个厨房共用一份配料表,谁来做都是同一个味道。
讲到这儿,应该把这一讲的短板交代清楚,免得读者踩坑。
lit_card 的参数名就叫 pdf_url,是服务端去取的。服务端取不到你硬盘上的文件。你给一个需要登录的下载页、或者一个普通的论文详情页,它就只能在页面上自动抓取能抓到的部分,而抓下来的截取有时是不合格的。meta 里的 DOI、年份、刊名要照你要引的那一版写,并在自己的笔记里注明。说清这些不是自我贬低,而是把期望放对:这一讲解决的是“读得快 + 引得住”,不是“不用读”。 判断这篇值不值得用、这个结论能不能撑起你的论点,永远是你的活。
第一段(译):
用 translate_pdf 把这篇 OA 论文译成中文 Word,PDF 地址是 https://……/…….pdf,mode 用 translate,文件名保留原标题。第二段(卡):
用lit_card给这篇 PDF 出一张精读卡,pdf_url同上;meta按“刊=……|年=……|DOI=……|被引=……|许可=……”的格式写全;把刚译好的中文 Word 地址放进zh_docx_url,附中文要点,方便我速读。卡里每一条“可引用原句”都要标出在原文的位置。
第三段(术语表):
把这三篇文献的要点文本交给term_table(texts_json传这三段文本),出一张英中定译 + 频次的术语表,我写论文时要用它统一译名。
(文件名以工具返回的链接为准;下载到本机时保留原文件名,不要另起中文名,否则日后对不上 DOI。)
meta 里的年份、刊名、许可要照正式版写。| 症状 | 查哪里 |
|---|---|
| 卡里的原句在原文搜不到,或明显不是这篇的句子 | 服务端自动抓取时截取不合格。改用公网 PDF 直链(优先出版社 OA 链接)重新出卡,再逐句核 |
| 工具取不到文件、卡出不来 | 给的是本机路径或需要登录的详情页。pdf_url 必须是公网可访问的直链;先去找合法可访问的 OA 版 |
| 译文读得通,但引用有问题 | 译文是辅助阅读的,不是引用依据。引用回英文原文 + DOI |
| 同一篇文献出现两个版本(预印本/正式版) | meta 里的 DOI 与年份要对准你要引的那一版,并在笔记里写明 |
| 术语三种译法混用 | 没有把术语表带进写作环节。第 16 讲写草稿时,把术语表作为 terms 传进 paper_draft |
| 直接把精读卡拼成综述交上去 | 这是红线,见下一栏。卡是原料,综述要有你的比较与判断 |
| 卡里数据看着“很整”,比如样本量恰好是 1000 | 回原文核。对不上就是错的,不要因为“看着顺眼”就留下 |
materials;术语表是那一讲的 terms;找政策、找行业的资料是第 17 讲的事。精读卡不是笔记,是借条——引一句能追回原文,才叫真的读过了。
| 你要干的活 | 工具全名 | 关键参数 |
|---|---|---|
| 外文 PDF 译成中文 Word(或中文 PDF 保真直转) | mcp__research-assistant__translate_pdf | url(公网 PDF 地址)、mode(auto/translate/convert)、filename |
| 出一张文献精读卡 | mcp__research-assistant__lit_card | pdf_url(必填,公网直链)、meta(刊/年/DOI/被引/许可)、zh_docx_url(译文地址,可附中文要点) |
| 出英中定译 + 频次的术语表 | mcp__research-assistant__term_table | texts_json(文本或公网 URL 的数组;不传则出内置清单的空表) |
lit_card 要公网 PDF 直链(优先出版社 OA),出卡后逐句人工回原文核term_table 管的是一义一译:同一篇稿子里一个术语只能有一个中文说法[1] Schmidt J F K. Niklas Luhmann's Card Index: The Fabrication of Serendipity[J]. Sociologica, 2018, 12(1): 53-60.(卢曼卡片盒工作法的系统梳理)
[2] Lewis P, Perez E, Piktus A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[C]//Advances in Neural Information Processing Systems (NeurIPS), 2020, 33: 9459-9474.(检索增强生成的开创性论文)
[3] 中华人民共和国国家质量监督检验检疫总局, 中国国家标准化管理委员会. 信息与文献 参考文献著录规则: GB/T 7714—2015[S]. 北京: 中国标准出版社, 2015.
[4] 教育部. 高等学校预防与处理学术不端行为办法(教育部令第 40 号)[Z]. 2016-06-16.(抄袭、篡改、伪造等行为的界定依据)
数据与平台:本讲所述工具能力与限制来自 zhenyuonline.cn 的 research-assistant 引擎(lit_card/translate_pdf/term_table,2026-09-17 核对);文中“服务端抓取有时截取不合格、必须人工回原文核”为实测使用中确认的能力边界,如实写出,不作粉饰。