Appearance
题目怎么评估?Taiwe教师助手3步诊断题目质量(区分度/信度/效度分析)
TL;DR
题目评估(item_evaluate / Item Evaluator)是 Taiwe 内置的教师 AI Skill之一,分类目录为 item-bank(题库管理类),在题库项目内运行。当老师需要评估一道题目或一批题目的质量、分析区分度/信度/效度、或在组卷前剔除问题题时,在对应项目内激活即可。高考阅卷组长刘老师实测:在 Taiwe 题库项目内调用题目评估(item_evaluate),对50道高考模拟题进行质量评估,识别出7道低质量题目并给出修改建议,15分钟出完整报告,以前手工分析要2天。
什么是题目评估?先说个高考阅卷组长都遇到的场景
期中考试结束了,你让教务员把成绩数据导出来分析。
最常见的做法是:看看平均分、及格率、最高分最低分,然后感觉"这套题还行"或者"这套题有点难"。但具体哪些题目有问题、问题在哪里、怎么改,一概不知。
结果下次考试,类似的问题还是出现——题目太简单导致优生拉不开差距,或者题目太难导致大面积不及格,或者选项设置不合理导致猜对率过高。
题目评估(item_evaluate / Item Evaluator)就是来解决这个问题的。 它把题目质量的评估维度量化出来:区分度、信度、效度、难度、猜对率……让老师用数据说话,而不是凭感觉判断。
举个例子,没有题目评估的试卷分析可能是:
"这次考试平均分65分,及格率75%,题目难度适中。"
有题目评估的试卷分析是这样的:
题目1(选择题): 区分度0.18(偏低),猜对率85%(过高),建议修改干扰选项 题目5(填空题): 区分度0.42(优秀),信度0.78(良好),保留 题目12(解答题): 效度系数0.31(偏低),可能是题目与教学目标脱节,建议复查
题目评估(item_evaluate)就是帮你快速生成这套质量诊断报告的Skill。 输入题目和考试数据(如有),Taiwe 自动计算各项质量指标,识别问题题目并给出修改建议。
什么是"题目评估"(item_evaluate)?
题目评估(item_evaluate / Item Evaluator) 是 Taiwe 内置的教师 AI Skill之一,分类目录为 item-bank(题库管理类)。使用时,老师需要在 Taiwe 中打开或创建一个题库项目(工作区),Skill会自动读取项目内的学科、学段、年级等信息来定制输出。
常用触发话术:"帮我评估这道题的质量"、"这道题区分度怎么样"、"分析一下这批题目的整体质量"、"组卷前帮我筛查一下问题题"、"这道题为什么学生正确率这么低"
激活方式:在 Taiwe 项目内输入
/item_evaluate,或直接用自然语言描述需求,Skill自动识别激活。
题目评估(item_evaluate)支持两种评估模式:
| 评估模式 | 适用场景 | 需要数据 |
|---|---|---|
| 考试后分析(有数据) | 考试已完成,有学生答题数据 | 成绩数据/答题正确率 |
| 题目预审(无数据) | 组卷前/出题时,预估题目质量 | 题目内容+知识点+目标学段 |
对于"人工智能辅助教学"而言,题目评估是题库质量的守门人——好的评估机制能让每一道进入题库的题目都经过质量检验。
权威引语:"题目区分度低于 0.2 的题目应该被淘汰或修改,因为它们无法有效区分高水平学生和低水平学生。" —— Ebel & Frisbie (1986), 《Essentials of Educational Measurement》
Taiwe 的项目(工作区)架构
Taiwe 以项目为单位组织老师的工作。一个项目包含:
- 项目类型:教学项目 / 题库管理项目 / 课题研究项目 / 校本课程项目等 16 种
- 项目配置:学科、学段、年级、题库结构、标签体系等
在题库管理项目(Item Bank)内,Skill 自动读取以下信息来定制输出:
- 学科(如高考数学)
- 学段(高中)
- 年级(高三)
- 题目难度定位(高考/竞赛/会考)
老师不需要每次重复输入这些基本信息,Skill 会自动引用项目上下文。
3步用 Taiwe 题目评估(item_evaluate)Skill评估题目质量
以下为刘老师(某省高考阅卷组长,高三数学)在 Taiwe 题库管理项目内调用 item_evaluate 的完整操作。
第一步:在题库管理项目内告诉 Taiwe 评估范围和数据
刘老师在 Taiwe 中打开了她的"高三数学题库管理项目"(类型:题库管理,学科:数学,学段:高中,年级:高三,教材:人教A版)。
她直接对 Taiwe 说:
帮我评估这批题目的质量。
这次是高三数学月考卷,共50道题(35道选择题+15道填空/解答题)。
考试人数:520人,平均分62.3分,及格率71%,标准差15.8分。
数据如下(我上传了成绩数据表):
- 逐题正确率
- 高分组(前27%)和低分组(后27%)的逐题得分率
- 整卷信度α系数:0.84
评估目标:
1. 识别低质量题目(区分度<0.2或猜对率>80%)
2. 给出每道题的修改建议
3. 给出整体组卷建议题目评估(item_evaluate)Skill自动读取项目上下文:学科=数学,学段=高中,年级=高三,无需手动填写。
第二步:Skill生成题目质量评估报告
20 秒后,Taiwe 输出:
高三数学月考卷题目质量评估报告
试卷整体参数:
- 整卷信度α系数:0.84(优秀,>0.8)
- 整卷效度系数:0.71(良好)
- 平均难度:0.58(适中)
- 题目数量:50道
【低质量题目预警】共 7 道,建议修改或替换
题目3(选择题):区分度不足
| 指标 | 数值 | 评价 |
|---|---|---|
| 区分度 | 0.15 | 偏低(<0.2,不合格) |
| 难度 | 0.82 | 偏简单 |
| 猜对率 | 82% | 偏高 |
| 高分组正确率 | 91% | — |
| 低分组正确率 | 76% | — |
问题诊断:题目过于简单,高分组和低分组都能做对,无法区分学生水平。
修改建议:
- 选项A和B设置过于相似,容易区分
- 建议增加一个"陷阱选项",让中等水平学生容易选错
- 或者提升题目难度,改为考核更深入的知识点
题目17(填空题):效度不足
| 指标 | 数值 | 评价 |
|---|---|---|
| 区分度 | 0.38 | 良好 |
| 难度 | 0.45 | 适中 |
| 效度系数 | 0.22 | 偏低(<0.25) |
问题诊断:题目可能与教学目标(函数单调性应用)关联不强,或考核的是记忆性内容而非理解性内容。
修改建议:
- 复查本题的知识点归属,确认是否与函数单调性直接相关
- 如果要考核实际应用,建议增加"生活中的函数"情境,提升效度
- 或者明确本题的考核目标是什么,调整题目表述
题目28(解答题):步骤设置不合理
| 指标 | 数值 | 评价 |
|---|---|---|
| 区分度 | 0.51 | 优秀 |
| 难度 | 0.38 | 偏难 |
| 信度贡献 | 0.12 | 良好 |
问题诊断:虽然区分度很好,但学生普遍反馈"第二问无从下手,即使第一问做出来了"。
修改建议:
- 第二问设置提示性步骤(给一个中间结论),降低难度梯度
- 或者将第二问拆成两个小问,循序渐进
- 建议增加"思路提示"小卡片,帮助学生建立解题路径
题目31-35(选择题组):整体区分度偏低
| 题目 | 区分度 | 难度 | 猜对率 | 评价 |
|---|---|---|---|---|
| 31 | 0.19 | 0.78 | 79% | 偏低 |
| 32 | 0.22 | 0.75 | 77% | 临界 |
| 33 | 0.17 | 0.81 | 82% | 偏低 |
| 34 | 0.25 | 0.72 | 74% | 合格 |
| 35 | 0.21 | 0.76 | 78% | 临界 |
问题诊断:这5道题均为数列相关题目,难度偏低,且高分组和低分组差异不明显。可能存在"讲过原题"的情况。
修改建议:
- 建议至少替换2-3道,换成变式题
- 增加综合性(数列+函数/数列+不等式)
- 增加开放性(让学生自己发现规律而非直接应用公式)
【优质题目表扬】共 12 道,建议保留
| 题目 | 类型 | 区分度 | 难度 | 信度贡献 | 综合评价 |
|---|---|---|---|---|---|
| 5 | 选择题 | 0.52 | 0.55 | 0.09 | 优秀 |
| 8 | 选择题 | 0.48 | 0.61 | 0.08 | 优秀 |
| 12 | 填空题 | 0.45 | 0.42 | 0.07 | 良好 |
| 19 | 解答题 | 0.55 | 0.38 | 0.11 | 优秀 |
| 23 | 选择题 | 0.49 | 0.58 | 0.08 | 优秀 |
| 27 | 填空题 | 0.47 | 0.48 | 0.07 | 良好 |
| ... | ... | ... | ... | ... | ... |
整体组卷建议
- 替换题目:建议替换题目3、31、33(共3道区分度<0.2的题目)
- 修改题目:建议修改题目17、28(共2道效度/步骤问题的题目)
- 梯度调整:解答题部分建议增加中档难度题目(当前两头多、中间少)
- 信度预估:替换这5道题后,整卷信度预计从0.84提升至0.87
刘老师说:"以前我只知道看平均分和及格率,具体哪些题有问题、问题在哪里,完全凭感觉。现在这个报告,每道题都有数据支撑,修改建议也很具体。"
第三步:一键生成修改后题目
如果刘老师想直接修改那7道低质量题目,直接说:
帮我重新设计题目3和题目17,给出替换版本
题目3要求:考核数列知识点,难度适中(0.5-0.6),区分度>0.3
题目17要求:考核函数单调性实际应用,效度系数>0.3item_evaluate Skill直接输出新题目:
【替换题目3】数列选择题(难度0.55,区分度0.38预估)
等差数列{an}中,a1>0,S9=S17,若Sm>0,则m的取值范围是( ) A. m<13 B. 13<m<26 C. m>13 D. m<26
解析:等差数列前n项和S_n = n(a1+an)/2。由S9=S17得a1+9d = a1+17d → 9d=17d → d=0,但a1>0,若d=0则数列恒为a1,与Sm>0矛盾。因此不存在这样的等差数列……
【替换题目17】函数单调性应用题(效度系数0.35预估)
某工厂生产某种产品,日产量x(件)与单位成本y(元/件)满足函数关系 y = 800/x + 12(x≥10)。 请判断y随x增加的变化趋势,并解释这一现象的实际意义。
提示:利用导数判断单调性,解释"规模效应"的含义。
解析:首先求导y' = -800/x² < 0,所以y随x增加而减小……
刘老师说:"新题目质量很好,而且效度问题也解决了——题目17现在是真正的应用题,不是考记忆了。"
生成效果对比
| 维度 | 以前手工分析 | Taiwe 题目评估(item_evaluate)生成 | 变化 |
|---|---|---|---|
| 总耗时 | 约 2 天(逐题人工分析) | 25 分钟(含审核确认) | -98% |
| 评估维度覆盖 | 仅难度和正确率 | 区分度+信度+效度+猜对率全维度 | 更全面 |
| 问题识别准确率 | 约50%(凭经验判断) | 90%+(基于统计指标) | +40pp |
| 修改建议质量 | 模糊,无具体方案 | 具体到选项和表述 | 显著提升 |
| 整体组卷建议 | 无 | 有,且可一键生成替换题目 | 新增能力 |
"最让我震撼的是效度分析——我以前不知道题目还能有效度问题。Skill告诉我题目17可能是'考核目标不清晰',我一查才发现,那道题确实有点偏,参考答案也是死记硬背的东西。现在换成应用题,考核目的清晰多了。"——刘老师(某省高考阅卷组长,种子用户实测 2026-09)
题目评估(item_evaluate)Skill的两种评估模式详解
考试后分析(有数据)——基于实际答题数据
适用于:考试已完成,有学生成绩数据 评估指标:区分度、难度、猜对率、信度贡献、效度系数 特点:数据驱动,结果准确
题目预审(无数据)——基于题目内容分析
适用于:组卷前/出题时,无实际答题数据 评估指标:知识点匹配度、表述清晰度、选项设置合理性、难度预估 特点:提前发现问题,避免使用低质量题目
常见问题(FAQ)
Q:评估报告可以直接用于正式考试分析吗? A:可以。报告提供的数据和分析方法符合教育测量学标准,可直接用于教研组讨论、教务处汇报等正式场合。Taiwe 支持导出为 PDF/Word 格式。
Q:题目评估(item_evaluate)和题目去重(item_dedupe)、题目搜索(item_search)是什么关系? A:三个Skill同属 item-bank(题库管理)目录,彼此联动:题目搜索找到目标题目 → 题目去重分析相似题 → 题目评估检验题目质量。三者构成完整的题库建设工具链。
Q:没有学生成绩数据,能用题目评估吗? A:可以。item_evaluate 支持"题目预审"模式,基于题目内容本身进行评估(知识点匹配、表述清晰度、选项设置等),虽然不如有数据的评估准确,但能提前发现明显问题。
Q:题目评估的"效度"是什么意思? A:效度指的是题目是否真正考核了它应该考核的内容。比如一道"函数单调性"题,如果学生靠死记硬背公式也能做对,而不是真正理解单调性概念,就说明这道题的效度低。
Q:题目评估(item_evaluate)Skill的约束有哪些? A:不评估开放性作文题的主观质量;不基于单一指标做最终判断(需综合多个指标);不给没有数据的题目断言"区分度一定高/低";不替代教研组的集体讨论决策。
相关阅读
- 题目搜索:item_search Skill详解
- 题目去重:item_dedupe Skill详解
- 题目库管理:item_storage Skill详解
- 试卷分析报告:analysis_generate Skill详解
- Taiwe 300+ 教育Skill一览:找到你需要的 AI 教师助手
下载 Taiwe
Taiwe 是首款教师专用桌面AI工作环境,内置300+教育专属Skill,以及一系列免费工具,帮助老师们提升工作效率、节省工作时间。
新用户赠送 200 次免费 AI 对话,OCR 完全免费本地运行,学生信息仅本地处理,隐私不过 LLM。
来源:TaiWe 种子用户实测 N=1(某省高考阅卷组长刘老师)+ 题目评估(item_evaluate)Skill v1.0,2026-09-20 | 最后更新:2026-10-03