关于本中文版的说明  /  Note sur cette version chinoise

本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。

L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.

— 《进步者日报》编辑部  /  La rédaction

高强度辅导有效,但90%的美国学生无法获得

一项涵盖89项随机对照试验的荟萃分析证实了教育从业者几十年来的判断:高强度辅导可使学业成绩提升0.29个标准差。这是教育科学文献中证据最充分的干预措施之一。然而,目前只有十分之一的美国学生能够获得这项服务。

障碍不在科学层面,而在政治、财务和组织层面。什么有效,大致花多少钱,如何借助人工智能工具将成本降低三分之一而不损失效果——这些我们都已知道。缺少的是大规模推行的决心。

要点

  • Andre Nickow、Philip Oreopoulos和Vincent Quan(美国国家经济研究局/布朗大学安嫩伯格研究所)完成的荟萃分析,汇集了1985年至2020年间89项随机对照试验的732个效应估计值,测得高强度辅导对学业成绩的平均效应为+0.29个标准差。该研究于2024年发表在《美国教育研究期刊》。
  • 一项针对4,000名学生的随机试验显示,结合人类导师与人工智能的混合模式保留了80%的效果(数学成绩+0.23个标准差),成本降低三分之一。
  • 目前只有10%的美国学生能获得结构化辅导,且主要集中在私立部门的富裕家庭。
  • 主要障碍不再是技术问题,而是政治问题:谁来出钱,谁优先受益,以及如何在不大幅削弱效果的前提下实现规模化。

+0.29个标准差意味着什么

在教育科学领域,干预效果通常不大。大多数经过严格评估的措施产生的增益在0.05到0.10个标准差之间,0.20已被视为显著。高强度辅导达到0.29,属于另一个层级。

具体来说:对于一个处于第50百分位的学生,0.29个标准差的增益会将其提升至第61或62百分位。对于整个学生群体,若将其应用于最落后的学生,这可能是辍学与取得毕业证书之间的差距。起点越低的孩子,每获得一个标准差,价值越大。

Nickow、Oreopoulos和Quan的荟萃分析在平均数值之外还有两个关键发现。第一,效果稳健:跨越年龄、学科、社会经济背景和辅导形式均成立。第二,效果受强度调节:”高强度”辅导——通常定义为每周三次或以上、且纳入在校时间——效果始终优于每周一小时的轻量模式。

第二点至关重要。这解释了为什么许多低成本、分散、课外的辅导项目无法复制文献记录的效果。效果不在于辅导这一原则本身,而在于其规律性和密度。

为何有效:机制

高强度辅导的有效性,不是因为它比一堂好课神秘地更高效。它回应的是大众教育的一个根本问题:一位老师同时管理三十名学生,无法为每个人调整节奏和内容。

与一两名学生合作的导师可以识别出具体的推理错误,立即纠正,第二天再跟进,并实时调整练习难度。这种即时、个性化的反馈正是本杰明·布鲁姆在1980年代所描述的”两个西格玛问题”:接受个性化教学的学生,平均比普通课堂学生高出两个标准差。高强度辅导是在合理成本下最接近这一模式的方案。

研究者还注意到一个不可忽视的关系维度。效果最好的项目,导师是稳定的——每周同一位成年人,了解学生,建立了信任。导师轮换、将师生关系视为次要变量的项目则普遍表现不佳。这种人的维度,使规模化变得困难,也是削减成本时最容易丢失的东西。

人工智能将成本降低三分之一,效果基本保留

芝加哥大学教育实验室与多个学区合作,对4,000名学生开展了随机试验,检验一个具体问题:将人类辅导与人工智能工具结合,能否在不牺牲效果的前提下降低成本?

结果值得仔细解读。混合模式下,数学成绩的效应量为+0.23个标准差,纯人类模式为+0.29个标准差。效果下降21%,成本下降33%,效率-成本比有所改善。对于必须在”100名学生获得完整效果”与”150名学生获得略低效果”之间权衡的公共决策者而言,这个比例有利于更大范围的覆盖。

该试验中的人工智能工具并非取代导师,而是辅助导师:准备与学生水平匹配的练习,标记持续存在的困难点,处理补救教学中的重复性工作,让人类导师能将时间集中在解释和引导上。机器负责它更擅长的任务(一致性、耐心、参数化适应),人类承担不可替代的部分(精细诊断、关系建立、激励)。

这一区分很重要。糟糕的政策决策往往是用自适应软件直接替换人类导师。现有数据不支持这种替代,支持的是增强。关于人工智能技能为工人带来价值的讨论,道理相同:不是取代,而是放大人类已经做得好的事情。

10%:知与行之间的落差

高强度辅导效果如此明确,为何只有10%的美国学生能够获得?答案是:成本、学校系统的结构,以及缺乏改变现状的政治意愿。

成本方面:一个高质量的高强度辅导项目——每周三次、导师受过培训、纳入在校时间——根据配置不同,每名学生每年花费1,500至4,000美元。对于平均每名学生支出13,000美元的学区而言,这是10%到30%的额外成本。对富裕学区尚可承受,对贫困学区则难以实现——而恰恰是这些学区的学生能从中获益最多。

结构方面:将高强度辅导纳入在校时间,需要重新安排课表、培训或招募导师、与教师协调。这些行政摩擦是已承受压力的学校管理层在缺乏资源和明确授权的情况下不愿承担的。

政治意愿方面:新冠疫情以来,美国多个州启动了大规模辅导计划。得克萨斯州利用联邦资金推出”得克萨斯学习加速”项目,目标覆盖数十万落后学生。路易斯安那州、田纳西州和密歇根州也以不同方式跟进。这些项目存在,且产生了有据可查的效果,但它们仍是例外——这个系统在结构上从未决定将高强度辅导视为标准,而非选项。

获取机会的不平等,忠实复制了经济不平等。在私立部门和富裕家庭中,一对一辅导早已普遍:有能力的家长会购买。研究表明,这种长期只属于有钱人的优势,可以在公共层面以相近的单位成本复制。市场为10%的学生解决了问题,公共政策可以为其余90%解决。

正在扩大规模的项目

一些组织没有等政治讨论结束,已经开始行动。它们的工作弥足珍贵,因为不只记录了效果,也记录了规模化的操作条件。

芝加哥大学教育实验室开发了”校本辅导”模式,将辅导纳入常规在校时间,定位为额外课程而非课外辅导。其芝加哥数据显示,最落后的高中生在数学上取得了显著进步,且效果在干预结束两年后仍然持续。

High Dose Tutoring是一个全国性组织,致力于标准化操作协议,降低中等规模学区的实施成本。其方法是共享导师培训工具和课程,让各学区无需从头摸索。

自2021年起,AmeriCorps将学校辅导纳入部署重点,在数百所学校提供经过培训的低成本导师。这是一种替代性资助模式,部分绕过了学区的预算限制:导师薪酬由联邦政府而非学校承担。

Arnold Ventures基金会多年来持续资助上述项目的严格评估,包括本文引用的荟萃分析。其作用不可忽视:通过出资支持学区无力承担的随机对照试验,基金会构建了为公共资助提供依据的科学证据。这是慈善机构与公共政策之间的良性分工——加速进步,但不替代民主决策。

大规模资金问题仍悬而未决。美国疫情后的联邦复苏计划(ESSER)在2020至2024年间向学区注入约1,900亿美元,其中一部分流向辅导项目。这些资金现已耗尽。各州和学区是否会用本地预算将这些项目制度化,还是高强度辅导将退回试点项目的例外状态,目前尚无定论。

工业化过程中如何保留效果

规模化存在一个真实风险,不指出来不诚实。当一个教育项目从试点走向大规模推广,它往往会失去最初解释其有效性的条件。训练有素的导师流向资金充足的试点项目,替代者准备不足;监督松懈;时间表在工会压力或组织约束下缩水;强度下降,效果随之下降。

这不是必然,但在其他公共政策领域,这是有记录的规律——最佳实践在制度化过程中被稀释。德国职业培训就是一例:原始设计精良,但在输出时很难保留使其运转的制度条件。

芝加哥大学教育实验室的研究人员确定了三个预测大规模效果保留的变量:导师初始培训的质量及其定期更新;辅导纳入在校时间而非课外时间,以保证频率;导师与学生关系的稳定性,至少持续一个完整学期。

这三个条件都有成本,但也有可衡量的回报:遵守这些条件的项目,效果接近试点;以节省成本为名放弃这些条件的项目,效果趋近于零。真正的风险不是不做大规模推广,而是推广时放弃了让它有效的条件。

人工智能若使用得当,可以帮助维持这些条件。即使导师经验不足,它也能保持练习质量。它能在导师察觉之前标出掉队的学生。它能减少行政负担,让辅导时间真正用于学习。这些都是实实在在的贡献——前提是不把它和替代人际关系混为一谈。

决策者现在能做什么

障碍不是技术性的。工具存在,操作协议有据可查,成本明确,替代性资助来源(AmeriCorps、慈善机构、联邦资金)均已可用。大多数美国州所缺少的,是一个明确的决定:将高强度辅导视为基本教育基础设施,与教科书、教师、校舍同等对待。

这需要三个具体选择。第一,将稳定资金写入州预算,而非依赖一次性应急资金。第二,明确优先覆盖资源匮乏学区中的落后学生——他们受益最大,获取机会却最少。第三,建立以严格评估为基础的结果问责机制,防止资金流向那些中途放弃有效性条件的项目。

在美国高度分权的教育体系中,学区自主权较大,联邦资金存在政治争议,推行这样的政策并不容易。但多个州已经证明可行,它们的数据正在说服邻州跟进。

未来几年,真正的问题不是高强度辅导是否有效——这已有定论。问题是:下一代学生中,有多少人会成长在一个决定提供这种辅导的学区,又有多少人会成长在一个知道有效、却没有行动的系统里。


来源

  1. Nickow, Oreopoulos & Quan (2024) — 关于高强度辅导的89项随机对照试验荟萃分析,《美国教育研究期刊》:https://journals.sagepub.com/doi/10.3102/00028312231208687
  2. 芝加哥大学教育实验室 — 技术/导师混合模式随机对照试验(4,000名学生):https://educationlab.uchicago.edu/resources/nber-working-paper-can-technology-facilitate-scale-evidence-from-a-randomized-evaluation-of-high-dosage-tutoring/
  3. 芝加哥大学教育实验室 — 校本辅导项目,芝加哥结果:https://educationlab.uchicago.edu
  4. 本杰明·布鲁姆 — “两个西格玛问题”,《教育研究者》,1984年:https://journals.sagepub.com/doi/10.3102/0013189X013006004
  5. Kraft (2020) — 解读教育干预的效应量:https://journals.sagepub.com/doi/10.3102/0013189X20912798
  6. 国家教育统计中心学校脉搏小组 — 10%的美国学生获得高强度辅导:https://www.nea.org/nea-today/all-news-articles/high-impact-tutoring
  7. AIBM — 引用Nickow荟萃分析的文章(2026年1月):https://aibm.org/research/the-strong-positive-effects-of-high-dose-tutoring-for-boys-and-girls/
  8. 得克萨斯州教育局 — 得克萨斯学习加速补助金
  9. AmeriCorps — 全国学校辅导项目
  10. Arnold Ventures — 教育随机对照试验评估资助