【可执行状态】需教学套件(建题需口令,随套件发放);学生端零安装,当天就能用
【本讲对应资产】测验服务(/quiz-api/,含学生答题页、投影讲评页、成绩页)、题库解析工具
【本讲原理来源】吴恩达《Agentic AI》设计模式·反思(评估优先)、L3 第 20 课《Function Calling》(确定性解析)
每节课最后五分钟,很多老师都会问同一句话:“都听懂了吗?”底下通常是一片点头——然后期中卷子发下来,一半人不及格。
后来你才想明白:点头不是答案,只是社交。 学生不想当众说“没懂”,老师也不想当场难堪,于是一句问句,两方都体面地过去了。也有的老师换个问法:“谁还有问题?”教室安静得能听见空调声,因为问“有没有问题”比问“听懂没有”更难回答。
真问题是:课上最该拿到的那条信息,偏偏是最拿不到的一条。 谁跟上了、哪一段卡住了、下一节课该从哪儿重讲——这些信息在教室里的每一分钟都在产生,却一条也没有被留下来。
这一讲要练的动作,就是把一次课堂练习,变成一组能看懂的数据。
第一章第三、四节讲完了。你想知道一件事:学生到底听懂没有。
王老师(化名)的办法,是很多老师的办法。课上随机点两个学生问——问到的会,没问到的不清楚,而且被点到的学生会紧张;课后留一次小测,收上来判两小时,第二天课上她只能看到一句话:“平均分七十八。”
七十八分能告诉你什么?告诉你“大概是听懂了一半”,但不知道是哪一半。第十一题全班错了七成,这是全班的问题,还是这道题本身有歧义?是概念没讲透,还是选项设计得容易混?不知道。因为手判卷子时,你只记分数,不记每道题。
李老师(化名)的办法不一样。她把自己写的题库稿放进文件夹,说清三件事:卷子编号、卷面标题与课程名、带上口令建题。几分钟后,她拿到的不是一个分数,是一页能看懂的数据:交了多少人、每题正确率多少、哪三题错得最多、有谁重名、有谁交了两遍。她做的判断只有一件——下一节课的前十分钟,重讲哪一段。
同一件事,两种过法。差别不在判卷快慢:王老师拿到的是一个结果,李老师拿到的是一份地图。 这一讲练的就是后者。
| 做法 | 从布置到拿到结果 | 最容易出错的地方 | 数据能不能核对 | 能拿到什么 |
|---|---|---|---|---|
| 举手/点名问 | 当场 | 只有被点到的人发声,沉默的大多数没信息 | 没法核对,全凭印象 | 一个模糊的感觉 |
| 纸质小测手判 | 两小时以上 | 判错、加错分、登分串行 | 能复核,但复核一次又要一小时 | 一个分数,最多加个平均分 |
| 机读答题卡 | 半节课以上 | 涂串行、卡纸、机器不在身边 | 要重新过机器 | 一个分数 + 总分分布 |
| 扫码答题 | 学生交卷即出 | 二维码发错、题稿体例不对 | 每题正确率都能当场点开看 | 四样:交没交、对不对、哪题错得多、下节课讲什么 |
一次测验如果只产出“一个分数”,它就只是一次点名。一次值钱的测验要产出四样:交没交、对不对、哪道题错得多、下一节课讲什么。
前三样是机器能算的,第四样是只有你能判断的——所以这条链的终点不是成绩表,是下一节课的教案。打个比方:这就像体检和诊断的区别。体检报告会给出一串数字(血压、血糖、各项指标),但“这说明什么、接下来怎么办”是医生的事。一次测验的分数是体检报告,哪一段要重讲,才是诊断。
教育研究里管这种“用评价信息反过来改教学”的做法叫形成性评价:评价的目的不是给学生排队,而是让老师知道下一步该做什么[3]。例如,同样是看到“平均分七十八”,形成性评价问的是“哪几题错得多、下节课怎么补”,终结性评价问的是“这个班排第几”——两种问法,同一份数据,走向完全不同。
(顺带说一句教育研究里的另一条老结论:测验不只是“检查学过没有”,它本身就是一种学习。让学生把学过的东西取出来用一次,比再读一遍记得更牢——教育心理学把这个现象叫“提取练习效应”[1]。例如,同样是复习二十分钟,让学生做十道选择题,比让他们再读二十分钟讲义,一周后的留存明显更好。所以课堂练习不是额外负担,它是学习环节本身。)
“课上查一查学生懂没懂”这件事,手段换过好几代,但目的从来没变过:
| 手段 | 时间 | 做法 | 解决了上一代什么痛点 | 留下了什么新问题 |
|---|---|---|---|---|
| 提问与举手 | 一直有 | 点名问、举手答 | 当场就能知道 | 只有少数人发声;答错的人紧张,沉默的人没数据 |
| 纸质小测 | 一直有 | 出题、印卷、收卷、手判 | 覆盖全班,人人要答 | 判卷两小时;只统计总分,看不到每题 |
| 机读答题卡 | 二十世纪八十年代起 | 涂卡、光标阅读机批量读 | 判卷快了很多 | 要先印卡、要有机器;题目只能出成客观题 |
| 扫码答题 | 今天 | 学生用手机打开一个网页,点选提交 | 题由你出、判分与统计即时完成、每题正确率保留下来 | 得先把题库稿按固定体例写好 |
这条线上有一个值得记住的转折:机读答题卡把“判分”交给了机器,但没有把“每道题”交给人。 老师拿到的是总分和分布,想知道“第十一题错得像不像话”,还得回头翻卷子抽样。扫码答题这一代补上的恰恰是这一点——每一道题的正确率都留下来了,而且是当场留的。 于是“下节课讲什么”第一次变成了一个可以看着数据决定的问题,而不是凭印象猜的问题。
这是本讲最重要的一条分界。
换句话说:凡是需要教学判断的,一样都不许交出去;凡是只要照规则执行的,一样都不该留在手上。 判一道客观题、统计一次正确率,这里面没有任何教学判断,它只是重复劳动;而“这道题该不该出”“这个干扰项是不是在考学生的误解”,机器不知道你的班上学期错在哪。
| 环节 | 归谁 | 为什么 | 出错时谁负责 |
|---|---|---|---|
| 题干、选项、正确答案 | 人 | 考点与干扰项是教学判断 | 你 |
| 题稿体例与解析 | 人 | 决定机器能不能读懂 | 你 |
| 判对错、算正确率 | 机器 | 答案唯一,规则清楚 | 拿题目核对 |
| 标重复提交、重名、缺交 | 机器 | 查重是算术,不是判断 | 你复核后处理 |
| 下一节课重讲哪一段 | 人 | 教学决策 | 你 |
吴恩达的四大设计模式里,“反思”的意思是:先给出评估标准,再让系统自己对着标准看结果[2]。放到测验这件事上,就是先把评判标准定死(题干、选项、答案是唯一的),然后才能让机器判、让机器统计。标准说得越死,机器能干的事越多——这跟考核是一样的道理:评分标准写得含糊,交给谁判都会有争议。
我们不用模型现编题,也不用模型猜你的答案。做法是:你的题库稿按固定体例写,解析工具逐题读懂,变成一份题库数据,再一次性建成一份题卷。
这条路看起来笨,其实是最稳的:同一份稿子今天解析和明天解析结果一样,题目不会被“改写”,答案不会被“猜”——可复现,才谈得上当考核依据。 这里的道理跟上一讲的填制是同一个:内容由人定,搬运由机器做,两件事分开,才不会互相污染。
体例是这样的,每一题五样东西,缺一不可:
| 要素 | 怎么写 | 长什么样 |
|---|---|---|
| 题号与考点 | 两个井号 + 序号 + 方括号里写考点 | 两个井号、序号 1、方括号内写“考点:代理权的终止” |
| 题干 | 以“案例:”起头,可以写多行 | 案例:甲委托乙代购一批原材料,乙…… |
| 选项 | 每条一行,字母加内容,至少两个 | 减号、字母 A、空格、选项内容 |
| 答案 | 单独一行,写明选哪个 | 答案:B |
| 解析 | 单独一行,说清为什么选它、别的为什么不对 | 解析:本题考的是…… |
为什么体例要这么严? 因为工具是逐条读的,不是靠“猜意思”的。例如,题干里一旦出现“答案”二字,很可能被当成答案行;缺失“答案:”这一行,这一题就会被跳过并在报告里列出来。再比如,选项只有一个,题就没法判——工具会直接把它标成有问题的题,让你回去改稿,而不是硬建一份残缺的卷子。这就像填快递单:地址、电话、姓名三格都得填,少一格,件就走不了——不是快递员不通融,是流程确实缺了必需的信息。
一张二维码走遍全班是错的——学生扫到讲评页,答案当场就露了。另外,成绩表里有三样东西是判卷最容易出错的地方,机器会标出来:同一学号重复提交、姓名重名、谁没交。
这三样恰好是手判时代最容易漏掉的:比如两个同名学生,手判时你分不清谁交了;再比如一个学生交了两遍,手判时你把两份都收着,最后按哪一份算全凭运气。机器把这三件事标出来,不是因为它更聪明,是因为它不会累。
这个问题问得非常对,值得正面回答,而不是绕过去。
先说清楚一件事:任何课堂练习都防不住铁了心要作弊的人,问题不在于“能不能防死”,在于“作弊的收益有多大”。 课堂练习按“过程性数据”用,不计入最终考核,学生的收益本来就很小——抄一个满分,得到的只是一个假的“我听懂了”,亏的是他自己。
再说实际的做法,有三条:
(技术上还有一层:学生端页面看不到答案,提交后也不显示分数与解析——这也是校验点里那条“在学生答题页里搜你的答案字母,搜不到才对”。)
分两个层面答。
判得准不准:客观题的判分是确定性解析——你写“答案:B”,它就记 B;A、C、D 都是错的。它不会发挥,也不会看错行。真正会出错的地方在两头:题稿本身写错了(比如答案标错、选项少一个),或者学生身份信息出问题(重名、学号填错)。所以校验的重点不在“它对不对”,而在“我的稿子和名单对不对”。
能不能当真:一次课堂练习不是评价一个学生的依据,它是给老师的过程性数据,用来看教学哪里没讲透。要计入平时分,得你自己在教务系统里登记;要作为正式考核依据,必须事先向学生说明。别把“我看到了数据”当成“我可以给它打分”——这是两件事。
把题库稿放进文件夹,然后说清三件事:建哪一份卷(编号)、卷面标题与课程章节叫什么、带上口令建题。
用第一章第三、四节那份题库稿,调quiz_create建题,编号 jjf-ch1-s34,标题写经济法基础第一章第三、四节课堂练习,课程写经济法基础;建好把学生答题页和投影讲评二维码给我;出完再用quiz_scores把成绩页读给我。
编号为什么要规矩一点?因为它会进链接和二维码。例如编号写成 jjf-ch1-s34(经济法基础,第一章,第三、四节),下学期你想调出上学期的卷子,一看编排就找到了。
(实测题卷示例:经济法基础·第一章第三、四节课堂练习,十五题,学生页与二维码页均已在线;另有一份三题的自检卷,仅用于检测服务通不通。)
第 1 条和第 5 条是最值得花五分钟的:一条管“题对不对”,一条管“人对不对”。 这两条过了,中间那张正确率表才值得信——就像报账前先核对发票和名单,中间那个数字才有意义。
| 症状 | 查哪里 |
|---|---|
| 解析出 0 题 | 标题体例不对:必须是两个井号 + 序号 + 方括号里写考点 |
| 有几题被跳过 | 那几题选项少于两个,或者漏写答案行 |
| 解析文字混进题干 | 题干里出现了“答案”字样;题干与答案之间空一行,答案单独成行 |
| 学生说“不知道交没交上” | 让学生用状态查询;或者当场看一眼成绩页的提交人数 |
| 一个学号好几条记录 | 那是重复提交;成绩表按最新一条取,并标出来 |
| 学生当场对答案 | 学生页的“显示分数”开关必须是关的 |
| 二维码扫开是空页 | 题卷编号写错;编号只能用小写字母、数字、连字符 |
| 讲评时发现题目本身有问题 | 不是判分错,是题稿错;当场说明并按正确解法讲,别把错题当结论用 |
最后一条常被忽略,但它是底线中的底线:技术方便了一部分人,不能同时排除另一部分人。 比如,一个手机坏了的学生,不能因此在本节课上“没有数据”;给他一张纸、让他课后补答,都是应有的兜底。
出题归你,判分归机器;你要的不是分数,是下一节课讲哪儿。
| 你要做的事 | 工具全名 | 一句话作用 |
|---|---|---|
| 把你的题库稿建成一份卷 | mcp__lesson-agent__quiz_create | 按固定体例解析题稿、建题,出学生答题页与投影讲评页 |
| 读成绩与每题正确率 | mcp__lesson-agent__quiz_scores | 给成绩页:交没交、对错、每题正确率、重名与重复提交 |
| 看引擎通不通 | mcp__lesson-agent__kb_status | 报告引擎状态与已建知识库 |
| 把结论带回下一节课 | mcp__lesson-agent__lesson_gen | 按新发现重讲的那一段,改出一版教案 |
[1] Roediger H L, Karpicke J D. Test-enhanced learning: Taking memory tests improves long-term retention[J]. Psychological Science, 2006, 17(3): 249-255.(提取练习效应:测验本身即是一种有效的学习方式)
[2] Ng A. Agentic AI(智能体式人工智能)[EB/OL]. DeepLearning.AI, 2024.(反思设计模式:评估优先,先定标准再看结果)
[3] Black P, Wiliam D. Assessment and classroom learning[J]. Assessment in Education: Principles, Policy & Practice, 1998, 5(1): 7-74.(形成性评价:把评价所得的信息用于调整教学,而非仅用于排序)
数据与平台:本讲实测数据来自 zhenyuonline.cn 的 lesson-agent 引擎与测验服务(2026-09-17 实跑):题卷示例《经济法基础·第一章第三、四节课堂练习》十五题,学生答题页与二维码页均已在线;另有一份三题自检卷,仅用于检测服务连通性。工具名以「事实底座」所列为准,一个不编。