← 返回目录

第 14 讲 文献:从一篇 PDF 到一张可引用的精读卡

【可执行状态】现在就能做(只需手上有公网可访问的 PDF 直链,优先出版社 OA 链接)

【本讲对应资产】research-assistant 引擎(8 个工具);本讲关键工具 translate_pdf(外文 PDF 译中文 Word)、lit_card(文献精读卡)、term_table(术语表)

【本讲原理来源】L3 第 20 课《Function Calling 深度解析》(工具说明书三要素:叫什么、什么时候用、要什么参数)——本讲落在“给工具喂对参数”这一条上


引子:读了三个晚上,为什么一条都引不了

先问一句:你上一次读完一篇外文文献,合上电脑的时候,手上有几样东西是可以直接放进稿子的?

多数人的答案是零。读了两三个晚上,笔记攒了几百字,可等到真要写“某某(2023)指出……”的时候才发现:笔记里没有页码,没有原句,只有一句自己当时的转述。于是翻回去找,找四十分钟,找到的还未必是那一句。更麻烦的是同一篇材料里同一个词,前一次记成“生成式人工智能”,后一次记成“生成式 AI”,读者会以为你在说两个东西。

问题不在读得慢,而在读的方式没有产出“可引用的东西”。这一讲要换掉的就是这个产出形态:从一篇 PDF 到一张卡,卡上写着能直接进你稿子的一行原句,以及它在原文的哪一页。

一、场景:两个晚上,三条不能用的笔记

赵老师(化名,智能金融学院讲师)下个月要交一篇教改论文,文献综述这一节还没动笔。她手上有三篇英文文献,都是开放获取的 PDF:一篇讲生成式 AI 的教学应用,一篇讲课堂数据的分析方法,还有一篇是同行做的准实验研究。教研室的要求是“综述不能只是罗列,要有比较”。

她上周的实际情况是这样的:晚上七点打开第一篇,二十页,逐句看,看到十点半;合上电脑,记住的是“大概讲了 AI 对教学有帮助”。第二天要引用其中一句话,翻回去找了四十分钟,才在第 7 页一段的中间找到;再往后写,发现同一个词,前一段译成“生成式人工智能”,后一段译成“生成式 AI”,还有一处写成“生产式 AI”。

三篇文献,她花掉两个晚上,最后只得到三条笔记——而且这三条笔记一条都不能直接引用,因为不知道页码。

这样的下午并不稀奇。比如,她上一次写课程小结,想引一句政策原文来说明“为什么这门课要改”,结果翻了半小时,最后引的是某篇公众号文章里的转述——连政策文号都写错了。

换一种做法会怎样?同样是两个晚上,产出可以是三样:三张精读卡(每张四栏齐)、一张术语表(一个术语一个中文定法)、一份中文译文(速读用)。区别不在于她读得更快,而在于她把“读”拆成了三道能分别交付的工序。就像切菜和炒菜分开:一次只干一道工,每道工序都有一样能拿得出手的东西。

这一讲练的动作就是:把“读文献”变成一张可引用的卡。

二、原理一页:读文献的产出不是笔记,是“能引用的一行字”

2.1 精读卡只有四栏

lit_card 产出的精读卡,固定四栏:研究问题 / 方法与样本 / 可引用原句 / 局限。

这四栏不是随便挑的,它对应你写作时真正会用到的四件事:

卡的栏目你写论文时拿它干什么
研究问题综述里“某某(2023)关注的是……”这一句的主语
方法与样本比较不同研究时“一篇用问卷、一篇用准实验”的依据
可引用原句直接进你稿子的那句引文,附页码位置
局限相当于替你把作者的自我批评挑出来,是你提“研究缺口”的原料

前三栏是“别人做了什么”,第四栏是“还差什么”——你的论文有没有价值,靠的正是第四栏。

举个例子:三篇文献里如果两篇都是小样本问卷、一篇是准实验,那么“现有研究以自报式问卷为主,缺少课堂过程数据”这一句,就是从第四栏里长出来的。再比如,三张卡摊在桌上横着读,你一眼就能看出“没人研究过混合式课堂的即时反馈”——研究问题就这么冒出来了。

打个比方:这四栏其实像一份体检报告的四个固定栏目——病因(研究问题)、检查手段(方法与样本)、关键指标(可引用原句)、并发症与风险(局限)。换一家医院看,栏目还是这四个,你比对着看就行。

2.2 历史纵深:这件活,四百年换过四次姿势

“读文献、做笔记”不是新鲜事,它换过好几代做法,每一代都在解决上一代留下的一个痛点。看清这条线,你就知道今天这一步走到了哪里。

第一代,摘录本与卡片盒。 十六七世纪欧洲学者用 commonplace book(摘录本):读到好句子就抄进去,按主题分栏。二十世纪把这个做法推到极致的是德国社会学家卢曼——他用一盒盒编号索引卡(Zettelkasten),每张卡只写一个想法,卡与卡互相引用,三十年间攒出七十多本书[1]。卡片盒最要紧的发明不是“记”,而是“每张卡只装一件事,而且能被别的卡引用”。

比如今天还有人保留着这个习惯:读一篇论文,抽出一张 A6 卡,正面写结论,背面写页码与自己的疑问。差别只在于,卢曼当年是手写,我们现在可以让机器把卡片先起草好。

第二代,文献管理软件。 二十世纪八十年代末起,EndNote、RefWorks、Zotero 这类工具出现,解决的是“存和排”:存下题录、自动生成参考文献表、按刊物体例换格式。它把引用格式自动化了,但它不读内容——它管的是“引用长什么样”,不管“这句话在原文哪里”。

第三代,检索增强生成(RAG)。 二〇二〇年,Lewis 等人提出把外部语料检索与大模型的生成接起来[2]:先从资料库里检索出相关段落,再让模型基于这些段落作答。它大幅降低了“翻找”的成本,但模型仍然可能把检索来的片段揉成一句看不出出处的话。

第四代,就是这一讲的精读卡。 它把前三代各接一段:卡片盒的“一卡一事”、文献管理器的“题录齐全”、检索增强的“自动抓取”,最后补上最要紧的一条——每一条可引用原句都要能追回原文的位置。

代代表做法解决了什么留下的老问题
一摘录本 / 卡片盒内容有处可查页码常丢,全凭手抄,抄错无人发现
二EndNote 一类文献管理软件题录与引用格式自动化不管内容,原句仍要自己找
三检索增强生成翻找成本大幅下降出处可能被“融掉”,读者追不回去
四AI 精读卡(lit_card)抓取 + 原句 + 位置三样一起给抓取可能不合格,必须人工核

这张表最该记住的是最后一列:每一代都留下了老问题。第四代留下的那个老问题——“抓取可能不合格”——正好是本讲第一条纪律要处理的事。工具每往前一步,人的核对责任不是变小,而是变得更精确。

2.3 为什么一定要有“可引用原句”

这是一条纪律,不是一条便利:引用必须能溯源。

学术写作里的引用,本质是一个可核对的承诺——“这句话在原文里”。承诺能不能兑现,是可以机械验证的:把那一句拿去原文里搜,逐字命中,就算兑现;搜不到,就是没兑现。

打个比方:这就像借条。借条上写“今借到三千元”,你拿着它去找人,账要对得上;如果你手上只有一句“我印象里借过钱”,那这张条子在真要对账的时候什么也证明不了。精读卡上的“可引用原句”,就是学术写作里的那张借条。

所以精读卡的用法有一条铁律:出卡之后,每一句“可引用原句”都要人工回原文核一遍。

核不过的,删掉或者重做——不许“看着像”就放进稿子。这是本讲最硬的一条,本读本后面所有讲都按这个标准来。

2.4 设问自答一:AI 抓的那句原句,会不会是它自己编的?

会。所以才有上面那条铁律。

lit_card 是服务端去取 PDF 的,取到之后由模型在页面里找“研究问题、方法与样本、可引用原句、局限”。模型做的是语义判断,语义判断有概率性。真实碰到过的情形是:服务端自动抓取时截取不合格——抓到的是封面页、摘要页,或者是版本不对的那一份,于是卡里出现的句子在正文里根本搜不到。

处理办法只有一条,而且不可省:给公网可访问的 PDF 直链(优先出版社 OA 链接),出卡后逐句回原文核。

核对的办法很土,但最有效:把卡里那句原句整段复制,粘进 PDF 阅读器的搜索框,按下回车。能搜到,就是真话;搜不到,删掉重出。允许的差异只有断行和连字符——差一个词就算不过。

假设你偷了这一道懒,把没核过的原句放进稿子。评审只要复制那一句去搜,搜不到,你写了几万字的那篇稿子会一起被怀疑。这就是为什么核对不能省——它保住的不是某一句话,是整篇的可信度。

2.5 设问自答二:中文译文能不能直接拿来引?

不能。这是本讲第二容易犯的错。

translate_pdf 把外文 PDF 译成中文 Word(url 给公网 PDF 地址,mode 可选 auto/translate/convert;中文 PDF 保真直转也用同一个工具)。它解决的是读得慢,不解决引什么。

工具说明里写得很直白:引用一律用英文原文 + DOI。

好比看病:你可以请人把一份外文病历翻成中文给你看,但要做医疗鉴定,用的还是那份外文原件。译文“能读懂”不等于“能引用”。

用途用什么能不能进稿子
快速读懂一篇外文文献中文译文(translate_pdf)不能,仅供自己速读
写“某某认为……”这类转述英文原文,你自己读懂后写可以,但转述的准确性由你负责
直接引一句话英文原文原句 + DOI + 页码可以,必须回原文逐字核过

2.6 设问自答三:别人的综述里引过的那句话,我能直接搬吗?

不能。这叫转引,是学术写作里最容易被追问、也最容易翻身不及的一类问题。

别人文章里引的那句话,你要回到原始文献去核。理由很实在:中间那个人可能抄错了、可能改了一个限定词、可能引的是预印本而正式版已经改了结论。假设你照着二手转引写进自己的稿子,一旦被问“你读过原文吗”,整段的可信度都会跟着掉。

正确做法是三步:从别人的参考文献里拿到原始文献的题录与 DOI——找到原始文献——自己出卡、自己核句、引原始文献。这一步多花二十分钟,换来的是“我问心无愧”。

2.7 术语表是干什么的

term_table 出的是“英中定译 + 语料出现频次”。它输入是一组文本或公网 URL(texts_json),不传就按内置的教育 + AI 术语清单出一张空表。

它的用处只有一个:同一篇论文里,一个术语只能有一个中文说法。

赵老师那篇稿子里同时出现“生成式人工智能/生成式 AI/生产式 AI”,读者会以为你在说三个东西;如果是外文刊的审稿人,他会以为你没认真读过领域内的通用译法。术语表就是那把尺子,后面第 16 讲写论文时,它会被当作 terms 参数传进去,直接约束用词。

它还有个附带好处:这是一份可复用的教研室资产。 一个课程组共用一张术语表,学生作业、教案、论文里的译名就统一了;这张表也能直接进课程资源包。好比一个厨房共用一份配料表,谁来做都是同一个味道。

2.8 一个必须如实说的能力边界

讲到这儿,应该把这一讲的短板交代清楚,免得读者踩坑。

说清这些不是自我贬低,而是把期望放对:这一讲解决的是“读得快 + 引得住”,不是“不用读”。 判断这篇值不值得用、这个结论能不能撑起你的论点,永远是你的活。

三、动手三件套

一句话指令(三段,按顺序跑)

第一段(译):

用 translate_pdf 把这篇 OA 论文译成中文 Word,PDF 地址是 https://……/…….pdf,mode 用 translate,文件名保留原标题。

第二段(卡):

用 lit_card 给这篇 PDF 出一张精读卡,pdf_url 同上;meta 按“刊=……|年=……|DOI=……|被引=……|许可=……”的格式写全;把刚译好的中文 Word 地址放进 zh_docx_url,附中文要点,方便我速读。卡里每一条“可引用原句”都要标出在原文的位置。

第三段(术语表):

把这三篇文献的要点文本交给 term_table(texts_json 传这三段文本),出一张英中定译 + 频次的术语表,我写论文时要用它统一译名。

预期产物

(文件名以工具返回的链接为准;下载到本机时保留原文件名,不要另起中文名,否则日后对不上 DOI。)

校验点(逐句核,不许跳)

  1. 原句逐字命中:把卡里每一条“可引用原句”复制到 PDF 阅读器里搜一遍,必须能搜到。允许的差异只有断行和连字符;差一个词就算不过,删掉或重出卡。
  2. 位置能定位:每条原句要能说清在第几页、哪一小节——写脚注时要用。
  3. 引用形态正确:进稿子的引用一律英文原文 + DOI;译文只留在你自己的阅读笔记里。
  4. 方法与样本对得上:卡里写的样本量、研究方法,回原文核一遍。这两项最容易被压成一句话,压错就会变成“篡改别人的研究设计”。
  5. 局限分清来源:哪几条是作者自己承认的局限,哪几条是工具归纳的,要分得开——前者能引,后者要你判断。
  6. 术语一义一译:术语表里同一个英文词只能对应一个中文定译,全表扫一遍。
  7. DOI 对准正式版:预印本和正式版的结论可能不同;meta 里的年份、刊名、许可要照正式版写。

四、常见错误与排错

症状查哪里
卡里的原句在原文搜不到,或明显不是这篇的句子服务端自动抓取时截取不合格。改用公网 PDF 直链(优先出版社 OA 链接)重新出卡,再逐句核
工具取不到文件、卡出不来给的是本机路径或需要登录的详情页。pdf_url 必须是公网可访问的直链;先去找合法可访问的 OA 版
译文读得通,但引用有问题译文是辅助阅读的,不是引用依据。引用回英文原文 + DOI
同一篇文献出现两个版本(预印本/正式版)meta 里的 DOI 与年份要对准你要引的那一版,并在笔记里写明
术语三种译法混用没有把术语表带进写作环节。第 16 讲写草稿时,把术语表作为 terms 传进 paper_draft
直接把精读卡拼成综述交上去这是红线,见下一栏。卡是原料,综述要有你的比较与判断
卡里数据看着“很整”,比如样本量恰好是 1000回原文核。对不上就是错的,不要因为“看着顺眼”就留下

五、边界与红线

六、拓展与学科迁移


带走一句话

精读卡不是笔记,是借条——引一句能追回原文,才叫真的读过了。

背后的引擎(本讲速查)

你要干的活工具全名关键参数
外文 PDF 译成中文 Word(或中文 PDF 保真直转)mcp__research-assistant__translate_pdfurl(公网 PDF 地址)、mode(auto/translate/convert)、filename
出一张文献精读卡mcp__research-assistant__lit_cardpdf_url(必填,公网直链)、meta(刊/年/DOI/被引/许可)、zh_docx_url(译文地址,可附中文要点)
出英中定译 + 频次的术语表mcp__research-assistant__term_tabletexts_json(文本或公网 URL 的数组;不传则出内置清单的空表)

本讲要点(速记)

参考文献

[1] Schmidt J F K. Niklas Luhmann's Card Index: The Fabrication of Serendipity[J]. Sociologica, 2018, 12(1): 53-60.(卢曼卡片盒工作法的系统梳理)

[2] Lewis P, Perez E, Piktus A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[C]//Advances in Neural Information Processing Systems (NeurIPS), 2020, 33: 9459-9474.(检索增强生成的开创性论文)

[3] 中华人民共和国国家质量监督检验检疫总局, 中国国家标准化管理委员会. 信息与文献 参考文献著录规则: GB/T 7714—2015[S]. 北京: 中国标准出版社, 2015.

[4] 教育部. 高等学校预防与处理学术不端行为办法(教育部令第 40 号)[Z]. 2016-06-16.(抄袭、篡改、伪造等行为的界定依据)

数据与平台:本讲所述工具能力与限制来自 zhenyuonline.cn 的 research-assistant 引擎(lit_card/translate_pdf/term_table,2026-09-17 核对);文中“服务端抓取有时截取不合格、必须人工回原文核”为实测使用中确认的能力边界,如实写出,不作粉饰。