
做在线教育产品这些年我参与过不少练习类模块的设计和迭代。拿到“专项智能练习中国古代文学”这个项目时很多同事的第一反应是“这不就是个题库加了个随机出题”但我很清楚如果真这么干这项目大概率活不过三个月。古代文学这个学科表面上是背作家、记作品、认流派实际上考察的是学生能不能把文学史脉络、文本细读、文体知识和鉴赏术语全部串起来。一套有价值的专项智能练习拼的不是题量而是能不能准确判断“这个学生到底卡在哪个环节”——是记不住名句还是读不懂诗歌意境还是压根理不清唐宋文学的流变关系。这篇文章我想把这个项目从设计逻辑到落地执行的全过程拆开聊一聊。不管是做教育产品的同行还是在一线教古代文学的老师或是打算自己搭一套智能练习系统的技术同学应该都能从中找到一些可以直接用的思路和坑点。我会把内容架构、知识点标注、组题策略、解析标准化、数据回收这些环节逐一展开尽量讲清楚每一步“为什么这么做”以及“实际做的时候会碰到什么问题”。1. 专项智能练习的整体设计与思路拆解1.1 为什么是“专项”而不是“大而全”“专项”这两个字是整个项目最核心的定位。市面上很多练习产品喜欢把题库按“章节”或“教材目录”直接切分学生选一个章节系统随机抽二十道题做完给个分数就结束了。这种设计对理工科可能勉强能用因为物理、数学的知识点边界相对清晰但古代文学不一样它的知识点是高度网状的。你单独考一道“李白诗风特点”的题学生可能答得上来但要是把李白放到初盛唐文学发展的脉络里问他为什么李白和杜甫的创作路径完全不同很多学生就懵了。专项练习的思路是把古代文学这个大领域拆成若干条清晰的训练主线。每条主线对应一个“专项”比如“先秦散文专题”“唐诗发展脉络专题”“宋词婉约与豪放对比专题”“古代文体演变专题”等等。每个专项内部再按“知识点认知—文本理解—鉴赏分析—综合运用”四个层级组织题目。这样做的好处是学生每次进入练习时脑子里有一个明确的目标练完之后也知道自己到底在练什么、练到了什么程度。而不是像无头苍蝇一样刷完五十道题只得到一个“正确率67%”的冷冰冰的数字。1.2 智能练习的“智能”到底体现在哪里这个项目立项时我们对“智能”做了一个内部定义不是说用了什么神秘算法才叫智能而是看系统能不能做到三件事第一判断学生当前的能力短板在哪里第二根据短板动态调整下一道题的难度和考察方向第三在练习结束后给出足够具体的提升路径而不是一句笼统的“要加强古诗文阅读”。为了实现这三件事整个系统从底层就要搭得不一样。题库里的每一道题不能只是“题干四个选项答案”的简单结构它必须携带足够多的元信息考察了哪个专项下的哪个知识点、属于哪个认知层级、难度系数是多少、常见错误选项对应的是哪种典型误解。这些元信息才是系统做智能判断的数据基础。这里我想打一个比方。传统题库像一个摆满了书的仓库你想要什么书自己进去翻智能练习则像一个经验丰富的图书管理员你告诉他最近在研读杜甫他会根据你上一次借书时的批注情况帮你挑几本难度适中的评论集再提醒你“你对七律的了解还比较浅建议先补一补格律基础”。这个效果靠随机抽题是永远无法实现的。1.3 内容设计优先于技术实现做这类项目技术和算法只是工具真正的灵魂在于内容设计。如果知识点图谱本身是乱的标签体系是糊的题目质量是水的那再高级的算法也救不回来。所以在项目启动时我们花了将近一半的时间在“磨内容结构”上而不是急着写代码、搭系统。我带团队复盘时反复强调一句话智能练习的目标不是让学生“做对题”而是让学生“从不会到会”。如果一道题做完学生只知道对错不知道为什么对、为什么错那这套练习本质上还是电子化刷题谈不上“智能”。因此内容设计阶段就需要把每个专项的“学习路径”画出来明确“先练什么、再练什么、最后练什么”并且确保系统能通过学生的答题表现判断他处于这条路径的哪个位置。2. 中国古代文学的内容架构与知识点标签体系2.1 五大知识模块的划分逻辑中国古代文学内容极其庞杂如果不做结构化处理题目的组织会非常混乱。我在项目里把所有内容拆成了五个一级模块每个模块下再分二级主题和具体知识点。第一个模块是“文学史脉络”核心是从先秦到明清把各个时期的文学思潮、代表性作家作品、文学流派的前后承继关系梳理清楚。这个模块考的是学生的“时间轴意识”。第二个模块是“作家作品常识”包括作家字号、籍贯、代表作、创作风格、文学主张、文学史评价等。第三个模块是“文体知识”比如诗、词、曲、赋、骈文、散文各自的特征和演变。第四个模块是“名句名篇理解与默写”这个偏记忆类但难点在于理解性默写光会背不会用一样丢分。第五个模块是“鉴赏与评价”重点考察学生对具体作品的思想情感、艺术手法、语言风格的分析能力。我记得在设计这个模块时教研团队发生过分歧。有老师认为“鉴赏与评价”应该单独成为一个体系不是所有专项都涉及也有老师坚持文学史脉络应该放在最前面。最后我们定下来的原则是五大模块是知识维度而专项练习的“专项”是以能力目标为维度的两者形成交叉也就是说一个专项可能同时涵盖多个知识模块的题目但会侧重于某个能力目标。2.2 标签体系一道题身上的七张标签智能练习系统能否做得好很大程度取决于题目标签的完整度和统一度。我们规定题库里每道题都必须携带七个维度的元信息标签缺一不可。这个规范听起来简单实际操作时执行起来非常痛苦因为出题老师一开始总会漏填导致系统上线时数据不完整后面排查专门花了两周时间。七个标签分别是所属专项、所属知识模块、具体知识点、认知层级识记、理解、应用、分析、综合、难度系数1-5、题型类别单选、多选、判断、填空、简答、典型错因标签。其中“典型错因标签”是我特别强调加的比如一道考察《离骚》艺术特色的题错误选项可能对应“对比手法认识不清”“浪漫主义特征记忆模糊”“与《诗经》写实风格混淆”等不同错因。只有记录到这一层系统才能给每个学生输出有意义的诊断报告。标签体系统一之后组题算法的逻辑就变得非常清晰了。系统只需要根据学生的历史答题记录找到“最近连续出错的知识点”和“正确率低于60%的专项”再从题库中筛选具备对应标签的题目按照由易到难的顺序排列就能生成一套针对性极强的专项练习。没有这套标签任何智能算法都是空谈。2.3 专项设计示例一个完整的“唐诗分期”专项我举一个具体例子帮助大家理解专项和标签的关系。我们在系统里设计了一个“唐诗分期与风格演变”专项面向目标是高中及以上水平的学习者。这个专项的训练目标有三个第一能准确判断一首诗属于初唐、盛唐、中唐还是晚唐第二能说出每个时期代表诗人的创作共性第三能结合具体诗歌文本解释风格变化的原因。围绕这个目标教研组出了80道题覆盖四个时期的代表作家、典型作品、时代背景、风格特征。每道题除了基础知识问答还要有文本分析类的题目比如给出王维和杜甫的两首山水诗让学生比较两位诗人观察自然的角度有何不同。在做专项标注时题目会被标记为“盛唐诗歌风格”或“中唐诗歌风格”同时打上“对比分析”的能力标签。这样系统在推题时就能根据学生的表现精准判断他到底是对唐朝分期脉络不清楚还是对“风格比较”这个能力点薄弱。3. 从题目到训练核心环节的实操实现3.1 题目的分层设计与难度控制设计题库时最忌讳的一件事就是把所有题目混在一起不分难易。我在项目里引入了一套“三层难度”体系基础题、进阶题、挑战题。基础题主要考查识记类知识比如“《诗经》中‘风’是指什么”这类题的作用是激活学生的既有知识建立信心。进阶题开始加入理解与应用成分比如给出某首诗的一个句子让学生判断它运用了哪种抒情手法。挑战题则通常是综合分析题比如提供两首题材相近但风格迥异的诗歌要求学生写出比较赏析。难度系数的赋值不是拍脑袋出来的我们做了一轮“试做校准”。每道题上线前会请不同水平的学生各做一遍根据正确率反推难度系数正确率在90%以上设为1级70%-89%设为2级50%-69%设为3级30%-49%设为4级30%以下设为5级。这个数据要持续收集因为初始值可能不准确等真实做题样本超过200条之后再进行一次校准。我听很多同行说他们会用IRT项目反应理论模型来精确计算难度但那种精细度对一般的专项练习产品来说未必划算按比例校准已经能保证组题效果。3.2 组题策略如何生成一套高质量的专项练习真正开始组题时算法与产品逻辑是深度耦合的。我们设定了一套较为稳健的组题规则首题永远从“最近一次练习中正确率处于中位数的知识点”里选一道难度2级的题目这种做法的用意是让题目既不太难吓退学生又不太简单触发无聊感。如果学生答对下一题在相同知识点上提高难度或者切到下一薄弱知识点如果答错则降低难度并在同知识点下换一道考察角度不同的题再试一次。这套逻辑听起来简单但有一个细节需要注意的是同一知识点下的连续出题不能使用重复度太高的题目。比如《红楼梦》人物关系这个知识点第一道题考了“林黛玉进贾府时贾宝玉的表现”下一道就不能立刻考“贾宝玉初见林黛玉时的心理活动”因为答案信息重叠学生只要记住前一道题的答案后一道题根本不动脑也能答对。于是我们给每个知识点设置了“最小间隔数”同一知识点在一套练习中最多出现三次且每次出现之间至少隔开五道题。3.3 解析与讲解文案的标准化很多研发团队容易忽略解析文案觉得答案是A就完事了。但专项智能练习的核心价值之一恰恰在练习后的“即时反馈”上。我们的标准是每道题的解析必须包含四个部分——正确答案、考查知识点、解题思路、错误项分析。我拿题目举例子。问“下列诗句中属于李白创作的是哪一项”正确答案是B选项“君不见黄河之水天上来”。解析部分就不能只写“该句出自《将进酒》”还得说明为什么A选项“感时花溅泪”不是李白的——那是杜甫《春望》里的句子代表的是沉郁顿挫的风格而李白的特点是豪放飘逸、想象奇崛。这个对比能帮助学生在做对这道题的同时顺带理清李杜风格的差异。所以我们内部有个不成文的规矩一道题如果没有写出至少80字的解析就没资格进入正式题库。4. 教研侧的落地细节与质量控制4.1 出题与审校流程三审一校到底在审什么内容类项目最怕的就是“粗制滥造”。古代文学这个领域知识准确性要求极高一个问题给错答案在专业圈内传开产品口碑直接崩掉。我们的出题流程分成四步初稿出题、交叉审校、试题试做、终审入库。初稿出题由擅长相应断代的老师负责比如先秦方向就不出明清的题。交叉审校是让另一位老师从零开始独立作答重点检查题目有没有歧义、答案有没有争议、错误选项设置是否合理。试题试做是把定稿后的题目随机交给5-8名目标水平的学生做一遍既要看正确率也要收集学生反馈——“这个题干读起来费劲”这类意见很常见。终审入库由学科主编负责最后检查一遍知识表述是否严谨再填入七个维度的标签。整个流程走下来一道题从初稿到入库通常需要一到两周。听起来很慢但实际产出远比“快糙猛”的方式更可控。我记得有一次审校老师发现一道关于《史记》“本纪”体例的题目答案选项里把“项羽列入本纪”当作错误说法但实际上项羽确实被列入本纪了只是因为“本纪”主要记帝王而项羽并未称帝很多初学者会误解。这种细节如果不审校就会造成知识性误导。4.2 数据回收练完不是结束是又一次数据采集练习做完大部分产品会给个正确率就结束了但做专项智能练习真正的工作才刚开始。我们会把学生的每一道答题记录都回收到数据池中不仅记录对错还记录答题时长、是否修改过答案、错误选项指向的错因标签、连续答错的题目序列等信息。这些数据分成两个用途。第一即时更新学生的个性化知识画像。比如一个学生在“元曲”专项中连续做错了四道关于“散曲与杂剧区别”的题那系统就会调整他的薄弱知识点排序把“文体辨析”类题目往前提。第二反向校验题目质量。如果一道题被大量学生做错但错因标签分布非常分散说明题目本身可能有问题要么题干表述不清要么错误选项设置的干扰性不合理。我们每周会跑一次“争议题报告”把那些“高手做错、低分做对”的题目挑出来人工复审。4.3 防刷题与随机化的平衡智能练习最怕学生“刷题”。这里的刷题指的是学生不看题目内容直接根据系统出题规律去猜答案或者反复刷新直到遇到自己会的题。我们采取了三重防刷策略。第一同一知识点在短时间内的出题数量设上限避免学生通过重复做同一知识点来“刷正确率”。第二正确答案的分布不固定系统在生成练习时会做随机化处理保证AB C选项的出现频率大致均衡减少学生靠位置猜对的概率。第三对作答时长异常短的题目做标记比如一道正常需要45秒的鉴赏题学生3秒就提交了系统会在诊断报告中提醒教师“存在猜测作答可能”而不是直接把数据计入能力评估。其实这些策略并不能完全杜绝刷题但能减少对诊断结果的污染。我始终认为智能练习系统的最高原则是数据可信度——如果回收上来的数据本身是脏的那所谓的“学情分析”就是自欺欺人。5. 常见问题与排查技巧实录5.1 学生连续练了十套题成绩却没有明显提升这个问题是项目上线第一个月收到最多的反馈。我们排查后发现有相当比例的学生陷入了“会的不练、不会的不见”的困境。原因在于组题算法过于保守系统为了防止学生挫败大量推送学生已经掌握的知识点导致练习表面上一套接一套在做实际上只是反复做自己熟悉的内容。解决这个问题我们在算法里加了一个“探索系数”每五道题中强制插入一道来自未知知识点或薄弱知识点的题目难度控制在合理范围内。哪怕学生做错了也比永远不接触要好。这件事给我的教训是智能练习不能一味追求“爽感”适度的挑战和错误本身就是学习的一部分。5.2 诊断报告和学生的真实水平对不上有次一个学生提交了一套练习系统报告显示他在“明清小说”部分掌握得很好正确率达到85%但线下老师测试时发现这个学生连《儒林外史》的作者都记不清。核查数据后发现他在做练习时反复修改答案最终选对了但系统默认他答对就算掌握没有记录“修改过答案”这个信号。我们随后的改进是将“首次作答是否正确”和“修改后是否正确”分开记录。如果学生首次作答错误但修改后正确这道题会被标为“不稳定掌握”在后续练习中以较低频率重新出现。类似的坑还有学生凭排除法选对答案虽然正确但并没有真正理解题目考察的知识点。针对这一点我们在部分题目中加入了“请简述你的答题思路”的反馈项供愿意配合的学生填虽然参与率不高但对提升诊断精度很有帮助。5.3 冷门专项的题目长期无人练习古代文学里有一些专项比如“历代赋体演变”在公考、教招中并不是高频考点使用者很少题库增长非常缓慢。但问题是如果做教育产品只盯着大众需求那些真正有深度学习者需要的内容就会长期被忽略。我们的处理方法是把内容生产从“恒定大题库”转向“模块化组装”。把赋体演变的题目拆成更小的知识点单元比如“西汉散体大赋的特点”“抒情小赋的出现时间”“唐宋文赋的革新”这些知识点可以复用到“文学史脉络”“文体知识”等热门专项中。这样既保证了冷门专项未来有内容可用又不增加过多额外出题成本。这也算是一个内容产能优化的思路。5.4 难度曲线突然跳变引发学生流失还有一次事故是系统某次更新后连续很多同学反馈“题目突然变难了”紧接着第二天App的日活出现明显下滑。核查后发现新版本上线时我们调整了难度系数的计算公式导致一批原本被标记为2级的题实际难度接近4级。学生在吃到第一道“假简单题”之后后续题目的挫败感被系统性放大学习意愿急剧下降。这个问题给整个团队上了一课任何对难度计算、组题参数的调整都必须在正式上线前做一次“影子测试”——也就是用历史答题数据模拟出新算法的组题结果检查其难度分布是否与上线前一致。从那以后我们所有涉及算法参数的改动都默认走一遍回归测试流程不再轻易直接上生产环境。一点实际经验做专项智能练习中国古代文学这个项目最深的体会是一个好的练习产品真正要比拼的不是表面上的题目数量而是背后的内容组织能力和数据闭环能力。古代文学本身是很有“人味儿”的学科作家有自己的性格作品有自己的风格流派之间有碰撞也有传承。如果智能系统能把这些微妙关系转化为清晰的知识图谱和精准的能力诊断它就能成为学生学习路上一个真正有用的伴读而不是又一个冷冰冰的刷题工具。这套内容设计的思路不只适用于古代文学稍微调整一下知识分类方式就能平移到古代汉语、现当代文学、外国文学等其他专项里去。