← 返回目录

第 7 讲 课堂互动:一次测验变成一组数据

【可执行状态】需教学套件(建题需口令,随套件发放);学生端零安装,当天就能用

【本讲对应资产】测验服务(/quiz-api/,含学生答题页、投影讲评页、成绩页)、题库解析工具

【本讲原理来源】吴恩达《Agentic AI》设计模式·反思(评估优先)、L3 第 20 课《Function Calling》(确定性解析)


引子:一句问了千百遍、却几乎从来没得到过答案的话

每节课最后五分钟,很多老师都会问同一句话:“都听懂了吗?”底下通常是一片点头——然后期中卷子发下来,一半人不及格。

后来你才想明白:点头不是答案,只是社交。 学生不想当众说“没懂”,老师也不想当场难堪,于是一句问句,两方都体面地过去了。也有的老师换个问法:“谁还有问题?”教室安静得能听见空调声,因为问“有没有问题”比问“听懂没有”更难回答。

真问题是:课上最该拿到的那条信息,偏偏是最拿不到的一条。 谁跟上了、哪一段卡住了、下一节课该从哪儿重讲——这些信息在教室里的每一分钟都在产生,却一条也没有被留下来。

这一讲要练的动作,就是把一次课堂练习,变成一组能看懂的数据。

一、场景:七十八分能告诉你什么

第一章第三、四节讲完了。你想知道一件事:学生到底听懂没有。

王老师(化名)的办法,是很多老师的办法。课上随机点两个学生问——问到的会,没问到的不清楚,而且被点到的学生会紧张;课后留一次小测,收上来判两小时,第二天课上她只能看到一句话:“平均分七十八。”

七十八分能告诉你什么?告诉你“大概是听懂了一半”,但不知道是哪一半。第十一题全班错了七成,这是全班的问题,还是这道题本身有歧义?是概念没讲透,还是选项设计得容易混?不知道。因为手判卷子时,你只记分数,不记每道题。

李老师(化名)的办法不一样。她把自己写的题库稿放进文件夹,说清三件事:卷子编号、卷面标题与课程名、带上口令建题。几分钟后,她拿到的不是一个分数,是一页能看懂的数据:交了多少人、每题正确率多少、哪三题错得最多、有谁重名、有谁交了两遍。她做的判断只有一件——下一节课的前十分钟,重讲哪一段。

同一件事,两种过法。差别不在判卷快慢:王老师拿到的是一个结果,李老师拿到的是一份地图。 这一讲练的就是后者。

做法从布置到拿到结果最容易出错的地方数据能不能核对能拿到什么
举手/点名问当场只有被点到的人发声,沉默的大多数没信息没法核对,全凭印象一个模糊的感觉
纸质小测手判两小时以上判错、加错分、登分串行能复核,但复核一次又要一小时一个分数,最多加个平均分
机读答题卡半节课以上涂串行、卡纸、机器不在身边要重新过机器一个分数 + 总分分布
扫码答题学生交卷即出二维码发错、题稿体例不对每题正确率都能当场点开看四样:交没交、对不对、哪题错得多、下节课讲什么

二、原理:出题与判分必须分开

2.1 一次测验值不值,看它产出几样东西

一次测验如果只产出“一个分数”,它就只是一次点名。一次值钱的测验要产出四样:交没交、对不对、哪道题错得多、下一节课讲什么。

前三样是机器能算的,第四样是只有你能判断的——所以这条链的终点不是成绩表,是下一节课的教案。打个比方:这就像体检和诊断的区别。体检报告会给出一串数字(血压、血糖、各项指标),但“这说明什么、接下来怎么办”是医生的事。一次测验的分数是体检报告,哪一段要重讲,才是诊断。

教育研究里管这种“用评价信息反过来改教学”的做法叫形成性评价:评价的目的不是给学生排队,而是让老师知道下一步该做什么[3]。例如,同样是看到“平均分七十八”,形成性评价问的是“哪几题错得多、下节课怎么补”,终结性评价问的是“这个班排第几”——两种问法,同一份数据,走向完全不同。

(顺带说一句教育研究里的另一条老结论:测验不只是“检查学过没有”,它本身就是一种学习。让学生把学过的东西取出来用一次,比再读一遍记得更牢——教育心理学把这个现象叫“提取练习效应”[1]。例如,同样是复习二十分钟,让学生做十道选择题,比让他们再读二十分钟讲义,一周后的留存明显更好。所以课堂练习不是额外负担,它是学习环节本身。)

2.2 这件事,从举手到扫码走了多久

“课上查一查学生懂没懂”这件事,手段换过好几代,但目的从来没变过:

手段时间做法解决了上一代什么痛点留下了什么新问题
提问与举手一直有点名问、举手答当场就能知道只有少数人发声;答错的人紧张,沉默的人没数据
纸质小测一直有出题、印卷、收卷、手判覆盖全班,人人要答判卷两小时;只统计总分,看不到每题
机读答题卡二十世纪八十年代起涂卡、光标阅读机批量读判卷快了很多要先印卡、要有机器;题目只能出成客观题
扫码答题今天学生用手机打开一个网页,点选提交题由你出、判分与统计即时完成、每题正确率保留下来得先把题库稿按固定体例写好

这条线上有一个值得记住的转折:机读答题卡把“判分”交给了机器,但没有把“每道题”交给人。 老师拿到的是总分和分布,想知道“第十一题错得像不像话”,还得回头翻卷子抽样。扫码答题这一代补上的恰恰是这一点——每一道题的正确率都留下来了,而且是当场留的。 于是“下节课讲什么”第一次变成了一个可以看着数据决定的问题,而不是凭印象猜的问题。

2.3 题由你定,判分交给机器

这是本讲最重要的一条分界。

换句话说:凡是需要教学判断的,一样都不许交出去;凡是只要照规则执行的,一样都不该留在手上。 判一道客观题、统计一次正确率,这里面没有任何教学判断,它只是重复劳动;而“这道题该不该出”“这个干扰项是不是在考学生的误解”,机器不知道你的班上学期错在哪。

环节归谁为什么出错时谁负责
题干、选项、正确答案人考点与干扰项是教学判断你
题稿体例与解析人决定机器能不能读懂你
判对错、算正确率机器答案唯一,规则清楚拿题目核对
标重复提交、重名、缺交机器查重是算术,不是判断你复核后处理
下一节课重讲哪一段人教学决策你

吴恩达的四大设计模式里,“反思”的意思是:先给出评估标准,再让系统自己对着标准看结果[2]。放到测验这件事上,就是先把评判标准定死(题干、选项、答案是唯一的),然后才能让机器判、让机器统计。标准说得越死,机器能干的事越多——这跟考核是一样的道理:评分标准写得含糊,交给谁判都会有争议。

2.4 为什么题库稿要写“固定体例”

我们不用模型现编题,也不用模型猜你的答案。做法是:你的题库稿按固定体例写,解析工具逐题读懂,变成一份题库数据,再一次性建成一份题卷。

这条路看起来笨,其实是最稳的:同一份稿子今天解析和明天解析结果一样,题目不会被“改写”,答案不会被“猜”——可复现,才谈得上当考核依据。 这里的道理跟上一讲的填制是同一个:内容由人定,搬运由机器做,两件事分开,才不会互相污染。

体例是这样的,每一题五样东西,缺一不可:

要素怎么写长什么样
题号与考点两个井号 + 序号 + 方括号里写考点两个井号、序号 1、方括号内写“考点:代理权的终止”
题干以“案例:”起头,可以写多行案例:甲委托乙代购一批原材料,乙……
选项每条一行,字母加内容,至少两个减号、字母 A、空格、选项内容
答案单独一行,写明选哪个答案:B
解析单独一行,说清为什么选它、别的为什么不对解析:本题考的是……

为什么体例要这么严? 因为工具是逐条读的,不是靠“猜意思”的。例如,题干里一旦出现“答案”二字,很可能被当成答案行;缺失“答案:”这一行,这一题就会被跳过并在报告里列出来。再比如,选项只有一个,题就没法判——工具会直接把它标成有问题的题,让你回去改稿,而不是硬建一份残缺的卷子。这就像填快递单:地址、电话、姓名三格都得填,少一格,件就走不了——不是快递员不通融,是流程确实缺了必需的信息。

2.5 两个码要分开

一张二维码走遍全班是错的——学生扫到讲评页,答案当场就露了。另外,成绩表里有三样东西是判卷最容易出错的地方,机器会标出来:同一学号重复提交、姓名重名、谁没交。

这三样恰好是手判时代最容易漏掉的:比如两个同名学生,手判时你分不清谁交了;再比如一个学生交了两遍,手判时你把两份都收着,最后按哪一份算全凭运气。机器把这三件事标出来,不是因为它更聪明,是因为它不会累。

图 8-1 一次测验的闭环:出题、建题、两个码、自动判分、每题正确率回到下一节课
图 8-1 一次测验的闭环:出题、建题、两个码、自动判分、每题正确率回到下一节课

2.6 有人要问:学生拿手机答题,不就能查答案、能互相抄吗?

这个问题问得非常对,值得正面回答,而不是绕过去。

先说清楚一件事:任何课堂练习都防不住铁了心要作弊的人,问题不在于“能不能防死”,在于“作弊的收益有多大”。 课堂练习按“过程性数据”用,不计入最终考核,学生的收益本来就很小——抄一个满分,得到的只是一个假的“我听懂了”,亏的是他自己。

再说实际的做法,有三条:

(技术上还有一层:学生端页面看不到答案,提交后也不显示分数与解析——这也是校验点里那条“在学生答题页里搜你的答案字母,搜不到才对”。)

2.7 还有人要问:机器判的分,准吗?能当真吗?

分两个层面答。

判得准不准:客观题的判分是确定性解析——你写“答案:B”,它就记 B;A、C、D 都是错的。它不会发挥,也不会看错行。真正会出错的地方在两头:题稿本身写错了(比如答案标错、选项少一个),或者学生身份信息出问题(重名、学号填错)。所以校验的重点不在“它对不对”,而在“我的稿子和名单对不对”。

能不能当真:一次课堂练习不是评价一个学生的依据,它是给老师的过程性数据,用来看教学哪里没讲透。要计入平时分,得你自己在教务系统里登记;要作为正式考核依据,必须事先向学生说明。别把“我看到了数据”当成“我可以给它打分”——这是两件事。

三、动手三件套

一句话指令(点名工具,可直接改数字用)

把题库稿放进文件夹,然后说清三件事:建哪一份卷(编号)、卷面标题与课程章节叫什么、带上口令建题。

用第一章第三、四节那份题库稿,调 quiz_create 建题,编号 jjf-ch1-s34,标题写经济法基础第一章第三、四节课堂练习,课程写经济法基础;建好把学生答题页和投影讲评二维码给我;出完再用 quiz_scores 把成绩页读给我。

编号为什么要规矩一点?因为它会进链接和二维码。例如编号写成 jjf-ch1-s34(经济法基础,第一章,第三、四节),下学期你想调出上学期的卷子,一看编排就找到了。

预期产物

(实测题卷示例:经济法基础·第一章第三、四节课堂练习,十五题,学生页与二维码页均已在线;另有一份三题的自检卷,仅用于检测服务通不通。)

校验点(照这六条量)

  1. 题数一致:建出来的题数与你题库稿的题数一致;有问题的题号会被列出来(选项少于两个、没写答案),别硬建,先改稿
  2. 答案不在学生端:在学生答题页里搜你的答案字母,搜不到才对
  3. 能提交、能查状态:自己先交一遍试试,提交后状态要能查到
  4. 成绩页只在老师通道:把链接发给别人前,确认那是带口令的那一条
  5. 异常能暴露:故意用同一个学号交两次,看成绩表是否标出“提交两次”;重名是否标出
  6. 数据只用于教学改进:作为正式考核依据前,必须事先向学生说明

第 1 条和第 5 条是最值得花五分钟的:一条管“题对不对”,一条管“人对不对”。 这两条过了,中间那张正确率表才值得信——就像报账前先核对发票和名单,中间那个数字才有意义。

四、常见错误与排错

症状查哪里
解析出 0 题标题体例不对:必须是两个井号 + 序号 + 方括号里写考点
有几题被跳过那几题选项少于两个,或者漏写答案行
解析文字混进题干题干里出现了“答案”字样;题干与答案之间空一行,答案单独成行
学生说“不知道交没交上”让学生用状态查询;或者当场看一眼成绩页的提交人数
一个学号好几条记录那是重复提交;成绩表按最新一条取,并标出来
学生当场对答案学生页的“显示分数”开关必须是关的
二维码扫开是空页题卷编号写错;编号只能用小写字母、数字、连字符
讲评时发现题目本身有问题不是判分错,是题稿错;当场说明并按正确解法讲,别把错题当结论用

五、边界与红线

最后一条常被忽略,但它是底线中的底线:技术方便了一部分人,不能同时排除另一部分人。 比如,一个手机坏了的学生,不能因此在本节课上“没有数据”;给他一张纸、让他课后补答,都是应有的兜底。

六、拓展与学科迁移


带走一句话

出题归你,判分归机器;你要的不是分数,是下一节课讲哪儿。

背后的引擎(本讲速查)

你要做的事工具全名一句话作用
把你的题库稿建成一份卷mcp__lesson-agent__quiz_create按固定体例解析题稿、建题,出学生答题页与投影讲评页
读成绩与每题正确率mcp__lesson-agent__quiz_scores给成绩页:交没交、对错、每题正确率、重名与重复提交
看引擎通不通mcp__lesson-agent__kb_status报告引擎状态与已建知识库
把结论带回下一节课mcp__lesson-agent__lesson_gen按新发现重讲的那一段,改出一版教案

本讲要点(速记)

参考文献

[1] Roediger H L, Karpicke J D. Test-enhanced learning: Taking memory tests improves long-term retention[J]. Psychological Science, 2006, 17(3): 249-255.(提取练习效应:测验本身即是一种有效的学习方式)

[2] Ng A. Agentic AI(智能体式人工智能)[EB/OL]. DeepLearning.AI, 2024.(反思设计模式:评估优先,先定标准再看结果)

[3] Black P, Wiliam D. Assessment and classroom learning[J]. Assessment in Education: Principles, Policy & Practice, 1998, 5(1): 7-74.(形成性评价:把评价所得的信息用于调整教学,而非仅用于排序)

数据与平台:本讲实测数据来自 zhenyuonline.cn 的 lesson-agent 引擎与测验服务(2026-09-17 实跑):题卷示例《经济法基础·第一章第三、四节课堂练习》十五题,学生答题页与二维码页均已在线;另有一份三题自检卷,仅用于检测服务连通性。工具名以「事实底座」所列为准,一个不编。