不仅仅是答案:人工智能辅助数学课程学习

概括: 人工智能辅助的学习伴随可以支持数学学习,但也可能剥夺儿童从中学习所需的思维劳动。本文梳理了研究现状,并为小学数学教学推导出了四个设计原则:学科教学法基础、自适应剂量、元认知激活以及课堂嵌入。文章指出了何时应放弃使用人工智能学习伴随、教师可以审查系统的哪些方面,以及这对技术实现意味着什么。由于绝大多数实证研究结果来自中等教育、高等教育或成人样本,因此这些针对小学阶段的原则应被理解为基于研究的设计假设,而非确凿的效果断言。.

Übersichtsgrafik zum Beitrag: Befunde, das Prinzip „Erst du – dann ich“, Prüffragen für Lehrkräfte und Verzichtsfälle

内容

起点

生成式人工智能在教育讨论中伴随着巨大的期望或同样巨大的担忧。目前已有大量在方法论和内容上截然不同的研究,为人工智能学习辅导的设计提供了初步的启示。元分析报告称,人工智能辅助系统对学习成绩、动机和更高阶思维过程具有积极影响(Wang & Fan, 2025; Deng et al., 2025; Alemdag, 2025; Wu & Yu, 2024; Zheng, Niu, et al., 2023)。一项关于数学中生成式人工智能的元分析涵盖了22项研究和46个独立样本,发现其平均效应量为 g = 0.53(Liu et al., 2026)。作为参考:g和d是标准化效应量,其中0.2被视为小效应,0.5为中等效应,0.8为大效应;r是介于-1和1之间的相关系数。然而,同一项分析报告称,在较小样本中效应更大,这是发表偏倚的一个已知迹象。此外,这些积极效应出现在非常不同的条件下,且部分研究设计在方法论上存疑。因此,在进行解释时,必须考虑可能的偏差以及纳入研究的质量。.

此外,根据系统类型和比较条件的不同,效果评估结果也会有很大差异。针对作为当今AI学习伴侣基于规则的前身——智能辅导系统,Steenbergen-Hu和Cooper(2013)对1至12年级数学中34个独立样本的元分析发现,与常规教学相比,其平均效应非常小(g = 0.01至0.09)。Ma等人(2014)报告称,在所有年龄段中,与教师主导的课堂教学相比,g = 0.42,但与一对一的人工辅导相比则没有优势(g = −0.11);Steenbergen-Hu和Cooper(2014)发现,对于大学生而言,g = 0.32至0.37。由于比较条件不同,这些数字不具有直接可比性。无法从中推导出随年龄增长的简单梯度变化;研究结果具有异质性,而且恰恰是方法严谨的学校分析最能降低人们的期望。.

此外,一项关于学校领域人工智能辅助辅导系统的系统综述(Létourneau 等,2025)还表明,在纳入的28项研究(14 %)中,仅有4项涉及小学生。 现有研究中的绝大多数都是针对年龄较大的中小学生或大学生开展的(Liu 等,2026;Son,2024)。不过,关于小学阶段的研究确实存在。 Hwang(2022)对2000年至2022年间关于小学数学的21项研究(共30个样本)进行了元分析汇总,发现其效应量较小(g = 0.35), 不过这些研究均完成于生成式语言模型普及之前;相关研究主要涉及基于规则的自适应系统。目前,针对小学儿童进行长期对话式、基于语言模型的学习辅助,并以学习进步作为结果指标的研究仍较为罕见(Kuo 等,2026; Liu等人,2025;Listyaningrum等人,2024)。因此,下文中的许多推论并非主要基于针对该目标群体的直接研究结果,而是更多地依赖于理论模型以及针对更高年龄组的研究发现。 凡是源自初中、高校或成人抽样调查的研究结果,均会在正文中予以注明。本文对现有研究成果进行了梳理和归纳,并将其应用于小学数学教学。.

数字媒体本身不具有学习效果,人工智能也是如此。„借助人工智能的学习效果“并非该技术的属性。我们需要探究的是各自的学习环境及其教学法的前期结构化设计(Dinsmore & Fryer, 2026; Weidlich et al., 2025)。因此,本文探讨了在何种条件下,人工智能辅助的学习陪伴能够支持小学阶段的数学学习过程,以及在何种情况下应放弃使用人工智能。.

在下文中,„AI学习伴随“指代系统、任务与教学的整体安排,„AI学习伴侣“指代与儿童共同使用的具体系统。„智能辅导系统“指的是较早的、基于规则的系统族群,部分引用的研究涉及此类系统。如果某文献使用„AI导师“或„Chatbot(聊天机器人)“,则保留其原称。.

这些考量构成了该项目中应用集成式人工智能学习伴随系统开发与测试的基础 普里玛基. 它们明确不是最终定论,而是将随着新的人工智能模型、新的实证发现以及建立在此基础上的教育应用而不断发展。.

理论框架

以下设计原则由四个理论视角构成:认知负荷理论、包含支架概念的最近发展区、程序性知识与概念性知识的区分,以及自我调节学习模型。此外还有一个总括视角:支持作用并不局限于单一的媒介,而是作用于整个学习安排之中。.

认知负荷理论与专长逆转效应

认知负荷理论(Sweller, 2020; Sweller et al., 2019)将工作记忆的有限容量描述为设计学习媒介的基本条件。对于人工智能辅助系统而言,这一局限性会带来直接的影响。生成式人工智能能够以极高的速度和规模呈现信息:文本、图像、解释、可视化以及动画。如果学习者被信息和刺激淹没,而无法对其进行与学习相关的加工,那么即使内容再好的信息也将无法达到预期的目标。.

设计这种剂量(或:如何把控这种“度”)是设计人工智能学习伴随(系统)中最困难的任务之一。分步脚手架(Scaffolding),即按需适度提供帮助和解释,从认知负荷理论(Cognitive Load Theory)的角度来看,是最重要的手段。人工智能学习伴随系统必须以这样的方式来调节脉冲、帮助和支持的剂量,即把工作记忆的负荷控制在能够进行学习的范围内(Cosentino et al., 2025)。.

适 多少支持才是合适的,取决于已有的知识基础。専門知识倒转效应(Expertise-Reversal-Effect)指出,对初学者有用的帮助,对进阶学习者会失效并最终成为阻碍,因为将多余的解释与现有知识进行比对本身就会占用工作记忆容量(Kalyuga 等,2003;Kalyuga,2007)。因此,从认知负荷理论(Cognitive Load Theory)中可以得出两点结论。支持必须适量,并且一旦孩子变得更有把握,就必须按计划撤回支持。对于辅导系统而言,科丁格和阿莱文(Koedinger & Aleven,2007)将这种微妙的张力描述为„援助困境“(assistance dilemma)。过早的帮助会阻碍自主建构,而缺乏帮助则会让学习者陷入毫无成效的死胡同。最佳点在哪里,会随着能力的提升而发生偏移。.

例题效应也源于同一理论:对于没有某种任务先前经验的学习者来说,研读做好的例题优于独立解决问题(Renkl, 2014; Renkl & Atkinson, 2003)。这一点将在„先你后我“原则中再次提及。.

最近发展区与脚手架

最近发展区(Vygotsky, 1978)描述了儿童在独立能够完成的事物与在更有能力的人帮助下才能完成的事物之间的范围。对于人工智能学习伴侣的设计而言,这带来了一个严苛的要求:系统必须持续评估儿童什么是能够独立完成的、什么是需要支持才能完成的,然后恰好在这一领域提供引导,既不太容易,也不太困难。.

最近发展区并非一个可以从儿童身上读取的难度指标,而是对互动中所可能发生的事的一种描述。系统无法对其进行测量,只能持续进行评估,并根据儿童的反应来修正这种评估。将该概念转移应用于任务难度的校准,这是一种解读,而非维果茨基的观点。.

相关行动概念是支架式教学(Scaffolding)。Wood、Bruner和Ross(1976)用该词来描述成年人对儿童解决问题过程的支持,并列举了其功能,包括激发兴趣、简化任务、保持方向、突出关键特征以及控制挫折感等。支架良好性的一个特征是权变性:支持建立在对当前水平诊断的基础上,根据该水平进行调整,并且一旦儿童能够自己承担责任就会撤回(van de Pol et al., 2010)。自适应系统不仅需要进行一次性评估,还需要进行持续评估(Wu et al., 2026; Kuo et al., 2026)。它们必须从学习者的输入中推断出其理解所在、导致错误的观念是什么,以及下一个具有成效的提示应该是什么。适应性是否对学习有效,取决于诊断基础以及由此推导出的帮助的质量。需要注意的是,支架式教学最初描述的是两人之间的互动。将其转移到软件上是一种类比,其适用范围仍存争议。.

程序性知识与概念性知识

适当的支持取决于当前追求的学习目标是什么。程序性知识(如何解决这个问题?)与概念性知识(为什么会这样运作?)需要不同的支持。.

正在练习运算流利度(如快速加减法)的孩子会从即时、简短的结果反馈中受益,前提是他已经通过推理而不是数数来解决问题。这有助于巩固自动化过程,并防止错误程序化。在练习过程中穿插详细的解释会打断自动化过程,并给工作记忆带来负担,使孩子无法在此时处理这些信息。相反,正在发展数感(对数字的理解)的孩子必须通过有针对性的问题和行动机会受到启发,以自主构建和发展其理解能力。他们应该开发、展示和证明自己的解题方法。无法做出这种区分的人工智能系统可能会导致其支持产生反作用,例如在概念学习中过快地提供答案,或者在程序练习中用不必要的提示负担工作记忆。Makransky 等人(2025)的研究表明,具有教学预设结构的模型比通用语言模型更能促进概念理解;关于理论基础的章节将对此进行重新探讨。.

自主调节学习与元认知

自我 Reguliere学习模型将学习描述为由计划、监控和评估构成的循环(Zimmerman, 2002)。学习者设定一个目标,选择一种方法,在过程中检查自己是否取得了进展,并在最后对结果进行评估。对于AI学习伴随系统来说,这个模型具有双重意义。系统可以通过询问计划、提示检查并将结果的评估留给儿童来激发这些过程。然而,系统也可以接管这些过程,从而让学习者养成依赖性。Molenaar (2022) 针对自适应学习环境指出,它们在很大程度上自行执行学习的调节,从而可能危及自我调节能力的发展,这就是为什么必须逐步将控制权交还给学习者。.

对于小学阶段,还有一个发展心理学方面的保留意见。元认知监控在小学阶段才刚刚发展起来。年幼的儿童经常会高估自己的理解能力,而且在语言表达上也很难说出详细的理由。因此,在小学阶段,激发元认知并不意味着去要求反思;而是必须通过针对刚刚执行完的操作提出简短、具体的问题来进行练习。.

系统为此所需的内容

这些视角构成了一个框架,随后的设计原则便置于其中。它们同时也表明了,为什么AI学习陪伴并非一个简单的技术问题。它需要系统具备关于学习者、学习对象和学习过程的模型。在智能辅导系统的研究中,这一要求长期以来被描述为三个部分:关于学习对象的领域模型、关于当前知识水平的学习者模型,以及关于干预决策的辅导模型。针对学习者模型,目前已有经过验证的方法,例如知识追踪(Knowledge Tracing,Corbett & Anderson, 1995),它们能够通过完成作业的情况持续评估知识水平。大型语言模型并不自带这样的模型。它们具备的是语言能力,而不是对某个特定儿童随时间所学内容的表征。这种表征必须由语言模型之外的应用来维护。.

最终,支架支持并非产生于单一的媒介中。庞塔姆贝卡和许布舍(Puntambekar & Hübscher, 2005)认为,只有在保留诊断性、应变性和撤除性这三个要素的前提下,将“支架”(Scaffolding)概念迁移到软件中才是合理的,并且他们与塔巴克(Tabak, 2004)一同将支架描述为“分布式的”:软件、教师、学习材料以及同伴共同应对相同的学习需求,它们既可以相互强化,也可以相互干扰。这就是第四个原则——嵌入性——的理论基础。.

外包思考工作风险

以往对研究现状的描述可能会给人一种印象,即人工智能辅助的学习伴随主要具有积极的潜力,只需在技术上进行优化即可。然而,实际情况更为矛盾。多项研究表明,在学习过程中失控地使用生成式人工智能,不仅可能不如预期般有效,还会缩短基本能力的构建过程,从而阻碍学习。.

认知卸载:外包认知努力

认知卸载(Cognitive Offloading)描述了结构上最重要的问题:学习者将认知努力卸载给人工智能,而不是自己去完成。格利希(Gerlich, 2025)在一项针对666名成人的横断面调查中报告称,人工智能使用的频率与批判性思维测试中的得分呈负相关(r = −0,68),认知卸载的程度与批判性思维也呈负相关(r = −0,75)。较年轻的受访者使用人工智能的程度更高,且得分更低。该研究显示的是相关性,而非因果关系。它部分基于自我报告(这会高估如此幅度的相关性),且研究对象是成年人,而非学龄儿童。它确立了一个卸载假说,该假说有待通过实验和纵向研究进行检验。.

Bastani等人(2025年)在一项针对土耳其学校约1000名9至11年级学生的对照干预研究中展示了这一风险。在练习阶段,拥有无限制访问完整解答聊天机器人权限的学生,正确解答了明显更多的练习题。在随后的无人工智能测试中,该组的成绩比无人工智能的对照组低17%。作者将其称为能力获得的减少。第三组使用的是一种提供提示而非解答的变体。他们在练习阶段比自由访问组取得更大的成功,并在测试中达到了对照组的水平,但并未超越对照组。因此,损害并非由人工智能本身造成,而是由无限制获取解答造成的,而且在这项研究中,设计良好的变体也没有产生学习优势。这一发现涉及该研究设计,并未证明永久性的能力丧失。来自基于人工智能的辅导系统的学习分析进一步表明,一部分学习者试图„点穿“任务序列,而不去深入探讨其内容(Jančařík等人,2023年)。.

Dinsmore和Fryer(2026)从学习心理学的角度论述道,非预结构化聊天室形式的生成式AI会诱使用户走捷径,从而避开艰难的自主知识构建过程。那些未经深思熟虑就直接接受现成答案的人节省了精力,却没有建立起稳固的知识结构。这与有针对性地研究一个已解答的例题并非一回事。在研究例题时,解答会与解释的要求相结合,思维工作也从搜索转移到了理解上。许多聊天机器人提供商目前都提供了一种„学习模式“,在这种模式下,聊天机器人不会直接给出答案,而是提出反问。这些模式是否具有学习效果,目前尚未得到研究。从技术上讲,它们只是同一模型之上的一个指令层,在对话中通常是可以被绕过的。.

语言模型的礼貌度与教育质量

除了这种结构性风险之外,还存在第二种风险。Abdulsalam和Aroyehun(2025)在一篇尚未经过同行评审的预印本中,分析了数学辅导对话。在这些对话中,经验丰富的导师、新手以及七个语言模型对相同的学生错误作出了回应。较大的模型在质量评估中几乎达到了专家的水平,但在其画像上有所不同:它们的回答更长、更多元化且更有礼貌,但较少使用追问理由和准确性等典型的专家策略。礼貌的语言与评估出的教学质量呈负相关。学习成果未被收集。.

这种倾向被称为谄媚,即过度的赞同。它并非一种偶然的特性,而是训练过程的结果:语言模型在后期训练中被优化以给出人类评价良好的回答,而人类对赞同的评价系统性地优于反驳(Sharma et al., 2024)。对于设计而言,这意味着这种倾向可以通过系统提示词中的指令(即给模型的固定基本指令)来减弱,但无法被可靠地根除。.

楚德西亚克和科斯特卡(Chudziak und Kostka,2025)描述了一个相关的问题:许多当前的AI系统倾向于采用一种指令式的、规定性的(即说教式的)交互风格。它们越俎代庖、进行引导并直接给出解答,而不是为独立思考过程留出空间。那些对每次输入都立即给予反馈的系统,存在着抑制其本应促进的思考和控制过程的风险。一项对真实人类辅导对话的计算机辅助分析(Wang等人,2025)表明,小学生对启发式问题反应积极,但总体而言,他们的积极参与度低于年龄较大的学习者。该研究记录的是交互模式,而非学习成果,且其描述的是人类辅导。这一模式只能作为一种假设迁移到AI系统上。.

由此并不意味着人工智能学习伙伴应该是不友好的。特别是在面对较小的儿童时,亲切的语气是他们愿意暴露错误的前提。问题不在于友好本身,而在于用友好取代了信息:即用赞同来取代实质性的反馈。.

有效帮助与独立思考之间的张力

这些研究结果汇聚成了一种张力,可以将其理解为设计AI学习辅助的核心难题:系统越是慷慨地提供现成答案,就越是可靠地剥夺了学习者本应通过思考来进行学习的机会。问题不在于系统的性能,而在于它被用于做什么。根据Bastani等人(2025年)的研究,带有提示的练习阶段变体比自由访问更有效,且在测试中也没有产生负面影响。.

一个好的AI学习伴侣因此有时必须刻意少做一些它本能做到的事。它必须允许孩子在一段时间内卡壳。Mason等人(1982)将这种„卡壳“(being stuck)描述为数学学习过程中的一个正常组成部分,并将其与识别和处理该状况的策略联系起来:记录已知和所求信息、考虑一个更简单的特例、写下一个猜想。对一个AI系统而言,这意味着不让挫败感滋生,而是指出卡壳的状态并提供一种行动可能。它保留答案、给出不完整的提示并留出处理时间。从某种意义上说,这与其说是在利用,不如说是在对抗那些让生成式AI如此令人惊叹的机制。.

一个没有预先构建的聊天机器人,例如一个没有教育框架的自由访问语言模型,会变成一台答题机器,比起促进理解的学习,它更可能阻碍学习。以下原则旨在适度提供支持,并让孩子自己进行思考。.

四大设计原则

自适应人工智能学习伴随的潜力与所述认知外包风险之间的张力,催生了四个必须协同作用的设计层面。系统的专业教学法基础是诊断和促进的前提。在此基础上构建了帮助的自适应剂量。元认知激活则横跨这两者,描述了互动应激发哪些思维过程。有人工监督的混合嵌入是基本框架:没有它,前三个层面在课堂教学中将无法发挥作用。.

Vier Gestaltungsprinzipien für KI-Lernbegleitung: Fundierung, Dosierung, Aktivierung, Einbettung

基础:学科教学知识作为前提

第一个设计层面涉及系统的知识库。生成式人工智能能够产生语言和形式上令人印象深刻的输出,但如果不加以针对性控制,这些输出在学科教学法上往往显得肤浅、缺乏问题导向或存在错误。关于在数学教育中使用生成式人工智能的文献分析一再指出,许多系统存在理论基础薄弱和容易出错的问题(Almheiri 等,2025;Awang 等,2025;Holmes & Tuomi,2022;Opesemowo & Adewuyi,2024)。这并不是一个可以通过顺便修复来解决的实施缺陷,而是这些模型被优化方向的结果。虽然训练数据经过了筛选并针对数学进行了专门汇编,但其优化目标是正确的解,而在后续训练中则是被人类评估为有帮助的回答。学科教学法的恰当性,即“在此时此刻什么样的引导对孩子最有帮助”这一问题,并不是训练的目标。.

Cárdenas 等人(2025)在其系统性分析中指出,缺乏理论框架是阻碍 AI 导师系统实现有效学习的主要障碍之一。学科教学论基础不仅关乎系统正日益改进的习题和解释的内容正确性,还关乎系统对学习者的反应方式。学科专业知识与辅导专业知识并非一回事。Macina 等人(2025)通过一项针对语言模型教学能力的标准评估方法(基准测试)表明,能够正确解题的模型并不自动意味着它们能够识别学习者的难点所在、错误背后的错误观念是什么,或是哪种启发在特定的学习情境中是富有成效的。因此,在给模型的提示词(Prompt)中仅包含专业知识是远远不够的。系统必须具备学科教学法知识,即了解儿童如何建构数学概念、存在哪些典型的错误路径以及在学习过程的哪个节点采取哪些干预措施是有效的。.

Makransky等人(2025)在一项预先注册实验(分析方案预先确定)中纳入了175名大学生,并对234名高中生进行了重复实验,结果表明这种差异在实践中具有重要意义。他们将一个基于理论设计的AI导师(ChatTutor)与一个通用语言模型进行了对比。在两项研究中,经过教学法预先结构化的导师在即时概念知识以及信心和乐趣方面均取得了更高表现;在延迟测试中,优势仅在第二研究中得以保持,但在自我效能感方面未出现差异。这也表明,大型语言模型不会自动应用学科教学法知识。因此,几个最新的教育智能体框架明确借鉴了教育理论;Cohn等人(2026)将其智能体的反馈建立在最近发展区、自我效能感和目标设定的基础之上,并在104名初中生中进行了测试。这种借鉴是否会带来更好的学习效果,对于大多数系统而言尚未得到研究。一项关于GeoGebra和AI辅助学习环境的研究表明,只有将学科内容和学科教学法融入系统设计中,而不是仅仅生硬地套用技术,概念理解和自信心才会提升(Canonigo, 2024)。.

面向小学数学教学的AI学习伴侣至少需要具备以下学科教学法知识基础。如何在技术上提供这些基础,将在实施一节中进行讨论。.

首先是针对各个内容领域的数学能力发展模型。系统必须„知道“,数理理解不是通过死记硬背事实产生的,而是通过构建概念形成的,并且这种构建过程存在典型的发展轨迹和前驱能力。没有这些知识,任何自适应都只是表面化的。系统充其量只能调整难度等级,而无法根据理解水平调整其引导的质量。.

其次是错误和策略分类法,它们映射了儿童典型的思维路径和思维误区(Padberg & Benz, 2021; Gaidoschik, 2010)。错误观念的诊断属于学科教学法的基本功,如果系统要超越„正确/错误“的判断,就必须专门被赋予这样一套体系。例如缺乏对进位/成组概念的理解——儿童将数字 24 中的 2 解读为„二“而不是„两个十“,或者将数数计算作为一种固化的策略。此外,将儿童的具体表述归类到某个错误类别中可能会失败,而错误的诊断产生的将不是非特异性的、而是精确指向错误方向的引导。因此,系统应该携带其置信度,并在低于某个阈值时选择追问,而不是盲目解读。在 PRIMA-KI 项目的自主测试中,即使是大语言模型在没有学科教学法背景的情况下,也曾多次建议儿童用数数的方式来解决错误题目,而这恰恰是课堂教学中需要消除的策略。.

第三,关于在哪个学习阶段以及针对何种类型的困难哪种帮助是有意义的明确规则。区分程序性学习和概念性学习就是这样一条准则:促进常规练习所需的干预措施与建立概念理解所需的干预措施不同。此外,系统还应当区分一次性的失误和潜在的理解问题。这无法从单一任务中判定,而只能根据多项任务的表现模式来判断,例如重复出现同一种错误类型或做题耗时。这前提条件是应用程序能够管理这些信息。.

第四,系统不仅需要调整难度,还必须能够识别儿童得出结果的不同思维路径。儿童以多种多样的方式解决数学问题,这是值得鼓励的。一个基于学科教学法原理的AI学习伴侣能够识别出替代策略,检验这些策略是否也适用于更大的数字和其他题目,必要时进行追问,并能够肯定儿童的做法或温和地引导他们采用更高效的方法。对于有计算困难的儿童来说,系统据以进行调整的依据至关重要。显而易见的调整——即使用更小的数字和更简单的题目——可能会产生适得其反的效果:一个靠数数来进行计算的儿童,在面对较小的题目时仍然会通过数数成功解决,从而巩固了这种策略。所需要的是对引导方式(提示)进行调整,而不是对难度水平进行调整(Gaidoschik, 2010; Wartha & Schulz, 2012)。然而,仅凭结果是无法看出所使用的策略的;8 + 6 = 14 在这两种情况下看起来都是一样的。线索则可以从解题耗时、诸如偏差为一之类的典型错误模式以及直接询问儿童是如何计算的之中获取。.

学科教学论基础是自适应支持能够作为自适应支持发挥作用的前提条件。没有它,正如借用Schneider(未出版手稿,无年份)中一个犀利表述所说的那样,AI学习伴侣将只是一个„有语言天赋的随机生成器“(无页码),它偶尔会产生有用的提示,但往往产生的是不够具体或具有误导性的刺激。.

剂量:自适应脚手架与„你先——我后“原则“

基于学科教学法知识,第二个设计层面得以实现:即对提示和辅助的自适应调控。这正是AI学习伴随系统与问答机器人的区别所在。研究结果表明,精心设计的AI学习环境能够根据学习状态、错误和策略做出反应,而不是直接给出正确答案,从而激发学习和理解过程。现有的研究无法孤立证明是否是自适应部分起到了这一作用,因为自适应性在这些研究中总是与整体的精心设计相伴相生;Salden等人(2010)针对例题研究,为自适应辅助与固定辅助的比较提供了唯一干净的对比。.

以下区分了反馈与帮助。反馈是对结果或解题路径的评估;帮助则是指在解题过程中的支持,即提示、提问和子步骤。两者的用量各有不同:反馈应具有信息量且时机恰当,而帮助则应循序渐进且有所保留。.

在关于TALPer系统的研究中,台湾学力较弱的五年级学生从自适应支持中获益尤为显著,而学力较强的孩子则与AI学习伴侣发展出了更复杂的互动模式(Kuo et al., 2026)。因此,该系统能够满足不同的学习前提条件。Liu et al. (2025) 针对小学应用题的生成式学习环境报告了学业成绩的提升,其中对支持的主观感知质量——而非支持的单纯可用性——对动机和学习效果产生的影响最大。Son (2024) 的系统性综述证实了设计良好的智能辅导系统对数学学习成绩的积极影响,特别是当这些系统能够自适应地响应个人学习需求时。生成式系统可以根据具体孩子的作业、输入以及以往的学习进度来调整反馈。.

反馈类型. 反馈研究首先根据信息含量对反馈进行区分(Shute,2008)。最简单的反馈仅告知答案是正确还是错误。第二种会额外给出正确答案。第三种是精细化形式,它提供关于错误所在、其背后可能存在的观念以及下一步合理行动的信息。其效果截然不同。Wisniewski等人(2020)在一项元分析中总结了435项研究,包含994个效应量。反馈的平均效应为d = 0.48,且分布极不均衡:信息丰富的反馈达到d = 0.99,纠正性反馈达到d = 0.46,而强化与惩罚(即表扬、奖励和批评)仅为d = 0.24。因此,这一较低的数值针对的是表扬和批评,而非属于纠正性形式的事实上的对错反馈。Kluger和DeNisi(1996)在一项主要以成年人为对象的元分析中表明,超过三分之一的反馈干预会降低绩效,尤其是当反馈将注意力从任务本身引向个人时。.

与之相关的是反馈指向何处的问题。哈蒂和蒂姆帕雷利(Hattie & Timperley,2007)区分了四个切入点:任务(„结果不对“)、处理过程(„你漏掉了进位,检查一下十位数“)、自我调节(„你自己怎么能看出这是否正确呢?“)和个人(„你擅长数学“)。其中最有效的是中间的两项;针对个人的反馈是最无效的形式。对于人工智能学习伴侣来说,在自动化那些已被理解的计算技能时,简单的对错反馈是合适的;在此类情况下,反馈应当简明且即时。但在建立理解时,这还不够。此时需要的是能够指出思考路径或引发自我检查、而不对结果或孩子进行评价的反馈。对于小学教育而言,这会产生一个目标冲突:精细化反馈包含丰富的信息,而丰富的信息会加重一个仍在艰难阅读的儿童的工作记忆负担。因此,这里的„精细化“指的不是冗长,而是精确:即指向具体步骤并结合行动呼吁的一个句子(“再看一眼十位数。进位时发生了什么?”),而不是对整个过程的完整解释。.

除了类型之外,时机也很重要,这主要体现在两个方面。第一方面涉及系统是在每个子步骤之后进行干预,还是仅在尝试完成后才进行干预。在练习已经理解的技能(例如心算、乘法口诀或数字拆解)时,研究结果倾向于分步、即时的反馈:这可以防止错误固化,并保持较低的工作记忆负担。而在解决问题和建立理解时,反馈则应该在完成独立的自主尝试之后再给出,否则会剥夺孩子自己检查和修正的机会。这是一条设计原则,而非确定的研究结果;Shute(2008)指出,对于困难的任务和学习能力较弱的学习者,即时反馈也有优势,因此对于小学生来说,„完成的尝试“这一概念应作狭义理解。第二方面涉及真正的延迟,即在数分钟或数天后才给予反馈。在此方面,研究结果并不一致(Shute, 2008);对于小学教育而言,其实际意义较小,因为届时孩子对自己的做题过程已不再有清晰的记忆。.

先你——后我。. 思考与支持的顺序至关重要。库马尔等人(Kumar et al., 2025)通过两项预注册的在线实验(共涉及 1818 名成年人),以多项选择题形式的数学任务为基础,检验了大语言模型的解释对后续测试表现的影响。提供解释的效果优于单纯给出正确答案,当参与者先前自己尝试过该任务时,这种优势最为明显。不过,即使顺序颠倒,这种优势依然存在。在第二项实验中,引入了包含计算错误和错误最终结果的解释;此时的学习收益介于单纯显示答案与无误解释之间。因此,在此设计中,有错误的解释并没有想象中那么有害。这不能推广到较少能注意到错误的小学生身上。鲁安等人(Ruan et al., 2020)以 3 至 5 年级的 72 名儿童为对象,比较了无反馈、带静态提示和带辅导聊天机器人的叙事式学习环境。叙事提高了参与度,而学习收益则体现在聊天机器人组中。然而,该聊天机器人是由人工操控的(绿野仙踪实验装置);该研究证明了对话式提问的益处,而非人工智能系统的性能。.

在自调节学习领域,一些研究指出,与静态的帮助序列相比,自适应的、由人工智能支持的脚手架可以提高自我调节过程的质量,并且比„千篇一律的帮助“这一概念更具优势(Liu et al., 2025; Wu et al., 2026)。因此,必须对生成式人工智能进行整合和预先结构化,使其能够自适应地回应学习者的输入,而不仅仅提供预先制作好的提示。.

这一原则有一个局限性,该局限性由上述的„已解答示例效应“导致:在对某种任务类型毫无先前经验的情况下,寻找解题途径的过程会使工作记忆充斥着无益于学习的进程;只有随着先前经验的增加,自主尝试才比示例更具学习效果(伦克尔,2014年)。在针对中等教育阶段智能辅导系统的研究中,分阶段教学已被证明是行之有效的:首先是一个附带理解题的完整已解答示例,然后是一个由孩子补充最后步骤的不完整示例,最后是带着反馈的自主解题尝试(伦克尔与阿特金森,2003年)。关键在于步骤的隐去取决于什么:萨尔登等人(2010年)的研究表明,根据学习者的解释来进行步骤隐去,要优于按固定模式进行隐去。这就是支架式教学中对权变性(或称及时性)的要求在已解答示例上的应用。因此,“你先来——我随后”描述的是针对孩子已有经验的任务类型的常规情况,而不是引入新内容的切入点。.

限制援助并观察求助情况。. 帮助不仅需要个性化,还必须是有限度的。为此存在两种不同的机制。渐隐(Fading)即有计划地撤回支持,它是根据能力的增长来调整的:支持会随着孩子能够独立完成相应步骤的程度而撤回,而不是取决于孩子请求帮助的频率。与此不同的是对滥用帮助行为的限制。关于智能导师系统的研究长期表明,学习者并未按照系统设计的方式来使用帮助功能。一部分人会直接点开提示链直到看到答案,而没有消化中间的步骤;另一部分人则恰恰在需要帮助时避免寻求帮助,而是继续盲目猜测或默默做错(Aleven 等,人,2016年;主要针对中学阶段)。适应性地寻求帮助本身就是一项元认知能力,小学生仍在逐步培养这一能力。因此,针对这一年龄段的人工智能学习伴侣不能指望孩子在需要时才主动请求帮助。它应该能够识别这两种模式并作出不同的回应:对于没有思考时间、非常迅速且重复的提示请求,用反问而不是下一个提示来回应;对于屡次尝试错误却完全没有请求帮助的情况,则主动提供提示。其目的不是减少帮助,而是让帮助在正确的地方发挥作用。.

带有下限的努力. 一定程度的自主努力对于学习至关重要,尤其是在构建理解方面。学习者通过努力能够克服的困难——例如分散练习而非集中练习,或是主动提取而非反复重读——会降低练习时的表现,却恰恰因此改善了记忆保持和知识迁移(Bjork & Bjork, 2011)。这种对练习表现与学习增益的区分,对于评估人工智能学习伴随(工具)具有重要意义:在完成任务过程中看起来成功的事项,并不能证明发生了学习。Bastani等人(2025年)的研究结果正是这种情况。此外,促进学习的困难只有在两个条件下才成立。首先,该困难必须处于通过支持可以达到的范围内。其次,自主探索的阶段需要有一个总结:在关于“富有成效的失败”的研究中,学习优势并非由失败本身产生,而是由随后的澄清和系统化阶段产生(Kapur, 2016)。这一立场与认知负荷理论(Cognitive Load Theory)存在众所周知的张力,后者倾向于早期且高强度的引导式教学(Kirschner et al., 2006);而对立观点则反驳称,问题导向的模式绝非没有引导,而是得到了不同的支持(Hmelo-Silver et al., 2007)。这种张力尚未消除,且关于“富有成效的失败”的研究结果主要来自中等教育阶段。.

对于小学阶段,由此得出了一种带有下限的谨慎版本。6至10岁的儿童在没有沟通对象的情况下遇到未解决的难题时,很快会将其视为失败而非挑战,而且对一个孩子来说,等待中的屏幕不是思考的间歇,而是一个坏掉的App。在脚手架(Scaffolding)最初的描述中,控制挫败感明确属于支持者的任务之一(Wood等人,1976年)。因此,自主尝试的阶段必须短暂且有明显的界限,它需要一个清晰可见的退出机制,并且支持应该按固定的顺序递进:在第一次尝试失败后,主动提供一个更具体的提示,而不是又提出一个问题;在第二次或第三次失败后,更换任务或呈现方式,或者向老师发出提示。单纯的数字变小并不算改变;如上所述,这只会巩固计数策略。绝不能让孩子陷入反问的死循环中。这背后隐藏着一种只有在频繁累积后才会显现的要求:每一次单独的错误反馈可能都是恰当的,但这一系列反馈组合起来,却可能传递出一种关于这个孩子的、谁也未曾预料到的信息。因此,应用程序必须记录并跟踪反馈的先后顺序,而不仅仅是单个反馈。多长的等待时间才是合适的,目前在实证上尚无定论;在PRIMO-AI项目中,这被作为一个开放的设计问题来处理。.

此外,还有一个实际的困难。处于小学年龄段的孩子通常无法表达他们不理解的地方,而且许多人阅读和写作还很费力。一个只能通过文字或口头解释来接受他们独立尝试解题的方法,恰恰将它理应帮助的孩子排除在外。因此,他们必须也能够通过非语言的方式进行尝试:通过操作学具、画草图或从多种展示的路径中进行选择。.

因此,一旦孩子熟悉了某种题型,人工智能学习助手就应该遵循„你先——我后“的原则。首先要求孩子自己尝试解答。人工智能只在需要时介入,可以通过应要求介入,或者在出现错误时自动介入,然后询问孩子的想法、部分策略和观察结果。解释会被连接到现有的理解基础之上。完整的示范解答依然是例外情况,用于反思,而不是作为主要的学习形式。关于表扬,有一个来自反馈研究的规则:反馈应该针对孩子做了什么,而不是针对孩子是什么。„你先凑够了十,这在这里是个好方法“是孩子能从中有所收获的反馈;„太棒了,你是个数学天才“则不是。对个人特质的归因不包含任何关于任务的信息,属于最无效的反馈形式之一(Hattie & Timperley, 2007; Kluger & DeNisi, 1996)。对于五年级的学生来说,在遭遇失败后,因聪明而受到的表扬比因努力而受到的表扬会导致更低的毅力和更差的表现(Mueller & Dweck, 1998)。因此,对每一次输入都报以热情回应的人工智能学习助手并不是格外亲切,而是格外空洞。.

激活:元认知与对AI回答的批判性审查

第三个设计层面超越了援助的定量提供,旨在提高由互动所激发的认知过程的质量。人工智能系统不仅可以提供提示和解释任务。如果经过专门设计,它们还能够激发问题解决过程中的规划、监控和反思过程。Wu 等人(2026)的系统性综述表明,聊天机器人可以支持自我调节学习,前提是它们的脚手架与自我调节学习模型相结合。Guo 等人(2025)在一篇尚未经过同行评审的系统性综述中报告称,人工智能系统可以满足小学生对自主性、胜任感和归属感的心理需求,从而影响动机和投入度。.

这一切的前提是目标明确。只有当孩子知道任务的核心要求是什么时,反馈才能发挥作用:是需要快速计算、阐述解题思路,还是比较不同的方法?人工智能学习伴侣应当在开始时明确指出这一目标,并使它的反馈明显以此为导向(Hattie & Timperley, 2007)。此外,每一次反馈之后都必须紧跟一个将其付诸实践的机会。那种给出提示后任务即告结束、应用程序直接进入下一题的做法是无效的。在收到提示后,任务应当允许被重新编辑,且提示应当建议一个具体的下一步行动。.

Song等人(2026)在一项针对中学阶段班级的个案研究中报告称,学习者将一个需要他们向其进行解释的AI系统(可教代理)视为学习同伴、主持人和共同解题者。然而,这并未阐明“通过解释进行学习”的原则在AI辅助环境中是否也能带来学习成效的提升。与此同时,研究表明,如果没有特殊的设定或后续训练,许多当今的生成式AI系统无法可靠地完成诸如启发式引导规划、策略选择和反思等导师任务,反而倾向于前文所述的指令性风格(Chudziak & Kostka, 2025;Contel & Cusi, 2025)。因此,必须对这类系统进行针对性的预先构建,使其能够主动提供元认知帮助,而不仅仅是对错误做出反应。.

激活的第二个方面是赋能儿童批判性地审查人工智能的回答。严格来说,这与自我调节学习有些交织,因为它关乎的不是控制自身的学习过程,而是如何处理容易出错的信息源。然而,对于借助人工智能的学习而言,它依然属于这一范畴,因为这两者都需要同一种态度:不盲目接受自己和系统做法。在一项针对77名三至五年级儿童的研究中,这些儿童与一个基于语言模型的机器人一起练习数学题,结果显示大多数儿童能够区分正确和错误的回答(Helal等,2024)。然而,这种能力在很大程度上取决于他们是否能自己解出题目。对人工智能回答的批判性审查以专业知识为前提,而不能取代专业知识。一项个人的观察与之相符:在一次 小学数学日 2026年1月,在某个活动环节中,三年级和四年级的小学生向一个为他们专门开发的聊天机器人提出了他们自己能够确切解决的数学题,并对机器人的回答进行了检查。人工智能出现计算错误令孩子们感到惊讶,并在该环节的后续过程中引导他们产生了审视的态度。这只是对单日情况的观察,并非一项调查研究,也并不意味着某种稳定能力的形成。因此,在将批判性检验人工智能回答的能力迁移到新内容之前,必须先在孩子们能够确切掌握的内容上进行练习。孩子们在小学阶段就已经可以练习这种能力;他们在日常生活中越来越多地接触到人工智能生成的内容(Yim & Su, 2025)。.

人工智能学习伙伴可以被设计为一个元认知伙伴,来激发这些过程。对于小学阶段,问题必须从可见的事物切入:„这三个任务有什么共同点?“、„你是数出来的,还是根据你已经知道的任务推导出来的?“、„请把图画里的8指给我看。“、„你的结果比100大还是小?你怎么能一眼看出这一点?“像„你注意到了什么?“这样的开放式反思问题,需要低龄儿童通常还不具备的语言和元认知工具;只有当它们与孩子面前的具体对象相关时,才起作用。该系统会引导对错误进行反思(„之前有什么想法可能会对这里有帮助?“),并且在适当的时候,可以融入回讲(Teach-back)的元素:孩子们向人工智能解释他们理解的内容,人工智能则进行追问和深化。通过这种方式,系统能够激发孩子们自己的解释、检验和反思,而不是把自己表现为一个无所不知的权威。.

对于小学阶段来说,这一原则同时也是最缺乏保障的。关于人工智能辅助自主学习的研究结果几乎全部来自中等教育和高等教育阶段。.

嵌入:混合式安排与教师的角色

第四个设计层面涉及AI学习陪伴所发生的框架。多项研究表明了混合模式的优势,在这种模式下,AI并非取代教师,而是减轻教师的负担,例如通过在问题解决过程中提供量身定制的脚手架或实时分析,让教师有更多时间进行教学互动和建立关系(Wezendonk & Veldhuis, 2024; Gonnermann-Müller et al., 2025, 预印本)。因此,这并不证明其普遍优于设计良好的纯人工或纯AI支持的反馈。.

教辅服务商 Eedi 与 Google DeepMind 在英国五所中学(涉及 165 名学生)中开展的一项探索性试点项目在一份新闻稿(Eedi & Google DeepMind, 2025)中报告称,与标准提示相比,由人工智能建议与人类导师组成的混合安排在迁移到新任务时实现了 10 个百分点的增长,而纯人类支持的增长则为 4.5 个百分点。在此过程中,导师介入的主要目的是放慢人工智能的节奏并缓和其语气。这些结果未经过同行评审,由服务商自主发布,目前只能视为初步结果。在 Kaliisa 等人(2026)对涵盖 4813 名(主要是高年级)学习者的 41 项研究所进行的元分析中,在学习成绩方面,人工智能生成反馈与人类反馈之间并未表现出显著差异(g = 0.25,不显著,且各项具体研究结果差异很大)。但这并不直接意味着两者的结合效果更好。这种假设之所以合理,是因为这两种形式各有不同的优势:人工智能反馈能够即时获取且门槛较低,而教师反馈则能进行归纳引导并了解孩子。结合两者的效果是否优于单一形式,目前仍然是一个开放性的研究课题。支持的主体是谁并不如支持的设计本身那么具有决定性,这一结论并非新发现:早在针对规则导向型辅导系统的研究中,VanLehn(2011)就发现,构建良好的系统的效果与人类个别导师相当(d = 0.76 对比 d = 0.79),并且常常被引用的“人类辅导具有两个标准差的优越性”这一观点在经验上是站不住脚的。Cosentino 等人(2025)认为,混合反馈模式具有降低认知负荷并支持差异化信息处理的潜力。.

Kestin等人(2025年)提供了一个反驳一刀切的混合模式假设的反例。在一项针对一所高度拔尖高校物理专业学生的随机对照实验中,参试者在使用基于教学法原则设计的AI导师学习时,比在采用启发式教学方法的线下课堂中花费了更少的时间,却学习到了显著更多的知识。这一研究结果涉及高校环境中的单个学习单元,无法推广至小学教育。但它表明,设计良好的AI辅助并不绝对依赖于人类框架。另一个研究结果涉及对教师本身的协助。Tutor CoPilot(Wang等人,2024年,预印本)在实时中为某个在线辅导项目的导师提供措辞建议。在一项包含900名导师以及1800名K-12年级学生的随机对照实验中,学生掌握某个主题的概率上升了4个百分点,而在先前评价较低的导师组中,这一概率上升了9个百分点。对消息的分析显示,他们更频繁地提出了引导性问题,而较少进行一概而论的表扬。.

从混合嵌入的角度来看,系统设计会产生多方面的影响。反馈的生成必须基于有教学法依据的信息。教师需要了解互动过程并具备调整设置的能力。关于教师总览面板(仪表盘)的研究表明,其效用取决于教师的解读工作。在一项针对 38 节小学数学课的观察研究中,教师平均每节课查看该面板 8.3 次,并主要从中推导出与任务和过程相关的反馈(Molenaar & Knoop-van Campen, 2019)。因此,显示的数据不会自动起作用,而是通过教师如何利用这些数据来发挥作用。这表明,应当优先展示重要信息,而不是堆砌过程数据:哪个孩子现在需要老师的帮助?为什么?在一项针对中学生的研讨中,如果有一个工具向教师显示哪些孩子在辅导系统中正需要帮助,与没有该显示的情况相比,孩子们学到的东西更多(Holstein et al., 2018)。目前尚无这两种显示形式的直接对比。因此,小学阶段的概览面板应当减少过程数据,包含更多指导行动的提示,并且能够在进行中的课堂上在几秒钟内被捕捉到。人工智能可以针对任务、帮助或初步诊断提出建议;决策权则始终掌握在人类手中。特别有前景的是在问题解决层面提供任务级别的支持。在一个异质性班级中,教师往往无法及时触及所有孩子。Eti 等人(2026)的系统性综述主要将以下系统描述为成功的:它们能够识别错误概念、提供适当的提示,并逐步引导学习者独立解决问题;该综述并未对这些设计与其他设计之间的有效性进行比较。.

目前,在人工智能导师系统的开发和应用中,教师的参与往往仍未得到充分考虑。Guerino 等人(2023)以及 Wezendonk 和 Veldhuis(2024)强调,必须采取以教师为中心的设计方法和教师人工智能素养培训项目,以确保其融入课堂并获得认可。关于人工智能整合与评估的专业化和继续教育是负责任应用的前提条件(Holmes 等人,2019;德国教育部长联席会议 KMK,2024;Wang & Nie,2023),并且应当纳入职前教师教育和在职教师培训之中。培训内容应涵盖技术基础以及教育教学方面的机遇、风险和评估标准。其基础依然是学科教学法知识,教师借此能够在学习安排中审查和定位人工智能作为辅助工具的作用。.

AI作为用实物材料开展数学活动的催化剂

这些设计原则描述了人工智能辅助学习在系统与儿童交互时应当如何运作。同样重要的是,这种交互如何融入数学学习的整体安排中。人工智能不应导致儿童整天盯着屏幕。关于实体用户界面(Tangible Interfaces)和社会性机器人的研究表明,人工智能还可以激发物理世界中的交互(Ligthart et al., 2023)。人工智能应作为数学活动的催化剂,同时支持不同表征层级之间的转换:实物操作(具象级)、图像与草图(半具象级)以及数字、算式与语言(抽象级;Bruner, 1966)。产生学习效果的与其说是某一个单一层级,不如说是层级之间的转化过程,在德国教学法中称为多模态迁移(intermodaler Transfer,Wartha & Schulz, 2012)。因此,人工智能系统最具成效的引导往往不是解释,而是要求进行表征转换:„你能用小圆片摆出来吗?“„把你算的过程画出来。“„你在画里哪里找到了数字7?“这类引导将思考的工作交还给儿童,同时也让他们离开了屏幕。.

人工智能可以结合实物操作以及草图、笔记或照片,并针对这些内容提出问题,例如在应用程序中对应用题进行建模时。 数学故事. 在这里,除了语音输入之外,还可以与AI学习伙伴讨论建模的草图、笔记和照片。应用题恰恰表明了支持与代劳之间的界限是多么微妙。在这里,孩子们很少是因为计算而失败,更多是因为缺乏理解力的阅读、不认识的单词、诸如„一共就是加“之类的关键词策略,以及无法检验结果是否合理。AI学习伙伴可以通过朗读、解释单词、询问情境,或者对于以德语为第二语言的孩子用第一语言进行询问来减轻语言负担,而不会预先给出数学结构。相反,如果它把题目改写得连计算方法都已经显现出来,那么恰恰省去了最核心的思维过程。用第一语言进行追问还 Voraussetzung(具备)两个前提:首先,它应被视为一种入门辅助而非长期解决方案,因为构建德语专业术语本身就是学习目标之一;其次,教师能够了解其进展,例如通过随附的德语版本。对于实践而言,由此产生了一个简单的检验问题:AI是帮孩子减轻了阅读负担,还是剥夺了他们建模的机会?

语音输入在此是一个敏感环节。自动语音识别对儿童声音的识别效果明显逊于成年人声音;常见模型在处理儿童语言时的词错误率明显高于成年人,这一点目前主要针对英语儿童进行了研究(Attia 等人,2024年),并且方言、多语种环境以及教室内的噪声会加剧这一问题。识别错误对于后续的语言模型而言是不可见的。它会将误听的内容当作实质性发言,在不利情况下甚至会将其误解为学生的错误观念。因此,小学阶段的系统应当将不确定性可视化并进行反问,而不是直接去解读:即展示或朗读系统所理解的内容,并在语言模型做出回应之前,让儿童进行纠正。.

关于小学阶段的研究明显少于中等教育和高等教育阶段。现有的研究结果令人谨慎地保持乐观:Hwang(2022)的元分析发现,基于规则的人工智能系统对小学数学教育具有小的积极影响(g = 0,35),而关于对话系统的少数研究表明,如果学习环境设计合理,且将数字陪伴与模拟操作相结合,儿童就能从中受益(Kuo et al., 2026; Liu et al., 2025; Ruan et al., 2020,其中后者使用的是人工操控的聊天机器人)。一项针对两名六岁儿童的探索性案例研究(Rumbelow & Coles, 2024)描述了一个物体识别应用程序如何引导其中一名儿童在几分钟内实现了思维转变,即把居维埃条(Cuisenaire rods)从„计数单位“的理解转变为„长度“的理解;而第二个孩子身上并未发生这种转变。这样的结果表明了一种设计潜力,而非有效性证明。将其应用到德国初等教育的常见材料中意味着:一个孩子用双面计数片在二十宫格上摆出一道算术题,拍摄摆放好的画面,系统随后进行追问而非评价:“你在这里摆了一道什么算术题?”、“你为什么把五个和五个推到了一起?”其收益不在于识别本身,而在于促使儿童将自己的行为用语言表达出来。照片旨在记录行为,而非替代行为。识别的成功率有多高取决于所使用的材料:结构清晰、易于区分的材料能被很好地识别,而手绘草图、儿童手写体,尤其是对物体的精确计数,对当今的图像模型来说仍然容易出错。.

KI-gestütztes Üben kann die Automatisierung von Rechensätzen unterstützen; eine kleinere, in einer wenig verbreiteten Zeitschrift veröffentlichte Studie mit achtjährigen Kindern über sechs Wochen berichtet größere Flüssigkeitsgewinne als beim reinen Auswendiglernen (Samuelsson, 2023). Für die Primarstufe ist dabei die Reihenfolge entscheidend: Automatisierung setzt Verständnis und ableitende Strategien voraus. Bei Kindern, die noch zählend rechnen, ist Übung unter Zeitdruck nicht nur wenig wirksam, sondern kann die zählende Strategie verfestigen und Vermeidungsverhalten verstärken (Gaidoschik, 2010; Wartha & Schulz, 2012). Ein KI-Lernbegleiter müsste daher unterscheiden können, ob ein Kind eine Aufgabe zählend oder ableitend löst, und im ersten Fall nicht Tempo, sondern Strategieaufbau adressieren, etwa über die Kraft der Fünf, das Verdoppeln oder das Zerlegen am Zwanzigerfeld. Adaptive Systeme für Kinder mit Rechenschwierigkeiten werden in Prototypenstudien erprobt (Hocine et al., 2023). Spielerische Ansätze sind ebenfalls untersucht: Sayed et al. (2022) berichten Verbesserungen besonders bei leistungsschwächeren Schülerinnen und Schülern durch adaptive, spielerische Inhalte.

Kinder sollen mathematische Aussagen, auch und gerade von KI, kritisch prüfen, begründen und miteinander diskutieren (Kortenkamp, 2024; Aufenanger et al., 2023). KI-Lernbegleitung in der Grundschule sollte daher vor allem als Anstoß für reichhaltige mathematische Aktivitäten dienen, die digitale und analoge Handlungen miteinander verbinden und an fachdidaktischen Überlegungen ausgerichtet sind.

什么时候应该放弃使用AI学习伴侣

Aus den vier Prinzipien folgt spiegelbildlich, in welchen Situationen ein Einsatz derzeit nicht sinnvoll ist. Vor jeder Frage nach der Gestaltung steht die Frage, ob KI hier etwas leistet, das Material, Gespräch und eigenes Probieren nicht leisten. Ein Kind, das Zahlen zerlegt, braucht Plättchen und eine Frage, keinen Chatbot.

Beim erstmaligen Aufbau von Grundvorstellungen mit Material tritt der Bildschirm in Konkurrenz zur Handlung und zum Gespräch. Hier ist die Lehrkraft die passendere Instanz; KI kann allenfalls im Anschluss zur Versprachlichung des Gehandelten beitragen.

Bei Aufgaben, deren Lernwert gerade im eigenständigen Ringen liegt, etwa offene Problemstellungen, verkürzt jede sofort verfügbare Hilfe genau den Prozess, um den es geht. Hier ist die Lehrkraft, die Zeit gibt und im richtigen Moment nachfragt, dem System überlegen.

Bei diagnostischen Einschätzungen mit Folgen, etwa Förderentscheidungen, dem Verdacht auf Rechenschwierigkeiten oder der Leistungsbewertung, ist eine KI-gestützte Einschätzung bestenfalls ein Hinweis, nie eine Grundlage. Die Verantwortung liegt bei der Lehrkraft.

Wenn die Lehrkraft keinen Zugriff auf den Interaktionsverlauf hat, entfällt das vierte Prinzip. Eine unbeaufsichtigte KI-Lernbegleitung in der Primarstufe, deren Ausgaben niemand prüft, ist nach dem gegenwärtigen Kenntnisstand nicht zu verantworten.

Schließlich entstehen zusätzliche Hürden statt Unterstützung, wenn die sprachlichen Voraussetzungen der Kinder eine dialogische Interaktion nicht zulassen, etwa bei geringer Lesekompetenz ohne verlässliche Sprachausgabe oder bei unzuverlässiger Spracherkennung. Die Ständige Wissenschaftliche Kommission der Kultusministerkonferenz (SWK, 2024) empfiehlt für die Grundschule eine weitgehende Abstinenz von Sprachmodellen und stattdessen den systematischen Aufbau basaler Lese- und Schreibkompetenzen; eine reguläre Nutzung sieht sie erst ab Klasse 8 vor. Die hier beschriebenen Prinzipien beziehen sich nicht auf den freien Zugang zu einem Chatbot, den die SWK im Blick hat, sondern auf eng vorstrukturierte, in eine Lernanwendung eingebettete Systeme. Ob eine solche Einbettung die Bedenken der SWK ausräumt, ist eine offene Frage; die vorliegenden Befunde sprechen dafür, dass es auf genau diese Vorstrukturierung ankommt.

作为教师你可以检查的内容

Die vier Prinzipien lassen sich in Fragen übersetzen, mit denen du einen KI-Lernbegleiter im Schulalltag beurteilen kannst. Ein einfaches Verfahren: Bearbeite die App selbst und gib dabei bewusst die Fehler ein, die du aus deiner Klasse kennst.

  • Fundierung. Gib eine typische Fehlvorstellung ein, etwa 42 − 8 = 46 (das Kind zieht ziffernweise die kleinere von der größeren Ziffer ab), oder antworte auf die Frage, wie viele Zehner in 240 stecken, mit „vier“ statt „24“. Erkennt das System, welche Vorstellung dahintersteckt, oder meldet es nur „falsch, versuch es noch einmal“? Schlägt es bei einer Aufgabe wie 8 + 6 vor, weiterzuzählen, statt eine ableitende Strategie anzuregen? Dann ist es für Kinder mit Rechenschwierigkeiten nicht geeignet. Bei 8 + 1 ist Weiterzählen dagegen unbedenklich; entscheidend ist, ob das System dort zählen lässt, wo eine Strategie zur Verfügung stünde.
  • Dosierung. Fordere fünfmal hintereinander einen Hinweis an, ohne selbst etwas zu rechnen. Gibt das System irgendwann die Lösung heraus? Fragt es nach einer eigenen Idee? Ein System, das auf Knopfdruck beliebig oft Lösungen liefert, wird in der Klasse genau so genutzt werden. Prüfe auch den umgekehrten Fall: Was passiert, wenn du dreimal denselben Fehler machst, ohne Hilfe anzufordern? Und lass dich nicht davon beeindrucken, dass Kinder in einer App sichtbar viel richtig machen; Übungserfolg mit Hilfe ist kein Beleg für Lernen.
  • Aktivierung. Gib eine richtige Antwort mit falscher Begründung ein. Reagiert das System auf die Begründung oder nur auf das Ergebnis? Lobt es alles? Widerspricht es, wenn du eine falsche Behauptung überzeugt vorträgst?
  • Einbettung. Siehst du, welche Hilfen ein Kind bekommen hat? Kannst du Funktionen abschalten? Kannst du die Rückmeldungen einer Stunde in den Tagen danach nachlesen, bevor du mit dem Kind sprichst? Nimmt die KI dem Kind bei Sachaufgaben das Lesen ab oder das Modellieren?

Für den Unterricht folgt daraus: Beim Automatisieren von Rechenfertigkeiten ist unmittelbare, knappe Rückmeldung richtig; hier darf die KI sofort sagen, ob etwas stimmt. Das gilt allerdings erst, wenn ein Kind die Aufgaben verstanden hat und nicht mehr zählend löst. Kinder, die noch zählen, brauchen Strategieaufbau, kein schnelleres Feedback. Beim Aufbau von Verständnis und beim Problemlösen sollte sie erst nach einem eigenen Versuch eingreifen und dann mit einer Frage beginnen. Bei einem neuen Verfahren, etwa einem Rechenweg über den Zehner, ist der Einstieg über ein gemeinsam betrachtetes Lösungsbeispiel sinnvoller als der eigene Versuch; für den erstmaligen Aufbau von Grundvorstellungen gilt das nicht, dort gehen Material und Gespräch vor. In der Übersicht ist nicht nur auffällig, wer viele Hinweise anfordert, sondern auch, wer nie welche anfordert und trotzdem Fehler macht. Und Kinder trauen sich einen eigenen Versuch nur zu, wenn Fehler in der Klasse als Arbeitsmaterial und nicht als Makel behandelt werden. Diesen Rahmen kann kein System herstellen. Eine ausführlichere Prüfliste mit fünf Fragen bietet der SKILL-Check im Beitrag zum SKILL-Modell.

核心凭证一览

Die folgende Tabelle ordnet die wichtigsten empirischen Belege dieses Beitrags nach Stichprobe, Design und Übertragbarkeit auf die Primarstufe. Sie macht sichtbar, dass die große Mehrheit der Wirkungsbefunde aus höheren Bildungsstufen stammt.

QuelleStichprobeDesignBefundÜbertragbarkeit auf die Primarstufe
Bastani et al. (2025)rund 1000 Schülerinnen und Schüler, Klassen 9–11, TürkeiFeldexperimentFreier Chatbot-Zugang: mehr Erfolg beim Üben, 17 % schlechter im Test ohne KI; Variante mit Hinweisen: Test auf KontrollniveauMechanismus plausibel, für Grundschule ungeprüft
Gerlich (2025)666 ErwachseneQuerschnittsbefragungr = −0,68 zwischen KI-Nutzung und kritischem DenkenNur Hypothese; keine Kinderdaten
Kumar et al. (2025)1818 Erwachsene onlineZwei präregistrierte ExperimenteErklärungen wirksamer als Lösungen; Vorteil am größten nach eigenem Versuch; fehlerhafte Erklärungen weniger schädlich als erwartetPrinzip plausibel, Übertragung offen
Makransky et al. (2025)175 Studierende; 234 Sekundarstufe IIPräregistriertes Experiment und ReplikationDidaktisch vorstrukturierter Tutor besser als generisches Modell im Sofort-Test; verzögerter Test nur in Studie 2 signifikantÜbertragung offen
Abdulsalam & Aroyehun (2025, Preprint)Nachhilfedialoge; Altersangaben fehlenDialoganalyseHöflichkeit hängt negativ mit bewerteter Qualität zusammen; keine LernergebnisseHinweis auf Systemverhalten, nicht auf Lernen
Kestin et al. (2025)194 PhysikstudierendeRandomisierter KontrollversuchKI-Tutor lernwirksamer als aktivierende PräsenzstundeNicht übertragbar; zeigt, dass gute Gestaltung nicht zwingend menschliche Rahmung braucht
Kaliisa et al. (2026)41 Studien, 4813 Lernende, überwiegend HochschuleMeta-AnalyseKein signifikanter Unterschied KI- vs. menschliches Feedback (g = 0,25)Keine Aussage für Grundschule
Eedi & Google DeepMind (2025, Pressemitteilung)165 Schülerinnen und Schüler, Sekundarstufe, GroßbritannienExploratives PilotprojektGegenüber einem Standardhinweis: Mensch + KI +10 Prozentpunkte, Mensch allein +4,5Vorläufig; Anbieterquelle
Wang et al. (2024, Preprint)900 Tutorinnen und Tutoren, 1800 Lernende K–12Randomisierter KontrollversuchFormulierungshilfe für Tutorinnen und Tutoren: +4 Prozentpunkte ThemenbeherrschungTeilweise, Nachhilfekontext
Kuo et al. (2026)Fünftklässlerinnen und Fünftklässler, TaiwanInterventionsstudieLeistungsschwächere Kinder profitieren am stärksten von adaptiver UnterstützungDirekt relevant
Liu et al. (2025)Grundschulkinder, TextaufgabenInterventionsstudieLeistungsgewinne; wahrgenommene Qualität der Unterstützung entscheidendDirekt relevant
Ruan et al. (2020)72 Kinder, Klassen 3–5, USAExperiment; Chatbot im Wizard-of-Oz-AufbauNarrativ steigert Engagement; tutorieller Chatbot verbessert LernergebnisseGrundschulkinder, aber kein KI-System im Einsatz
Helal et al. (2024)77 Kinder, Jahrgang 3–5Nutzungsstudie mit ExperimentFehlererkennung hängt vom eigenen Können abDirekt relevant
Rumbelow & Coles (2024)2 SechsjährigeExplorative FallstudieObjekterkennung stieß bei einem Kind einen Darstellungswechsel anHinweis, kein Beleg
Steenbergen-Hu & Cooper (2013)34 Stichproben, Klassen 1–12Meta-AnalyseIntelligente Tutorsysteme gegenüber regulärem Unterricht: g = 0,01 bis 0,09Teilweise; dämpft Erwartungen
Liu et al. (2026)22 Studien, 46 Stichproben, 5232 TeilnehmendeMeta-AnalyseGenerative KI in der Mathematik: g = 0,53; größere Effekte bei kleinen StichprobenKaum Grundschulstudien enthalten; Publikationsverzerrung möglich
Hwang (2022)21 Studien, 30 Stichproben, GrundschulmathematikMeta-AnalyseRegelbasierte KI-Systeme: g = 0,35Direkt relevant, aber Systeme vor der Verbreitung generativer KI
Létourneau et al. (2025)28 Studien, 4597 Lernende, Klassen 1–12Systematische ÜbersichtÜberwiegend positive Effekte; nur 4 Studien (14 %) mit GrundschulkindernBelegt die Forschungslücke selbst
Wisniewski et al. (2020)435 Studien, 994 Effektstärken, altersübergreifendMeta-AnalyseFeedback d = 0,48; informationsreiches Feedback d = 0,99; Verstärkung und Sanktionierung d = 0,24Gut, altersübergreifend
Kluger & DeNisi (1996)überwiegend Erwachsene, auch ArbeitskontexteMeta-AnalyseÜber ein Drittel der Feedbackinterventionen verschlechtert die Leistung, vor allem bei Fokus auf die PersonMechanismus plausibel; Stichproben nicht aus der Schule

技术实现的后果

Dieser Abschnitt richtet sich an Entwicklerinnen und Entwickler; für den Unterrichtseinsatz ist er nicht erforderlich. Die vier Prinzipien stellen Anforderungen, an denen Anwendungen bei der Umsetzung scheitern können, und aus dem Forschungsstand folgen einige Konsequenzen, die über die didaktische Argumentation hinausgehen. Die folgenden Aussagen beruhen auf dem technischen Stand vom September 2026 und auf Erfahrungen aus der Entwicklung im Projekt PRIMA-KI. Sie sind Konstruktionsregeln, keine empirisch geprüften Wirkaussagen, und sie veralten schneller als der übrige Beitrag.

Der Lernstand gehört in die Anwendung, nicht in das Sprachmodell. Ein Sprachmodell verfügt über kein Modell des Lernenden, sondern nur über den Text, den es im aktuellen Gespräch sieht. Je länger dieses Gespräch wird, desto unzuverlässiger befolgt es seine ursprünglichen Vorgaben. Der Lernstand muss deshalb von der App geführt werden: bearbeitete Aufgaben, Fehlerarten, Anzahl angeforderter Hilfen, Bearbeitungsdauer, wiederkehrende Muster. Diese Information wird dem Modell in verdichteter, strukturierter Form übergeben, nicht als vollständiger Gesprächsverlauf. Das Sprachmodell deutet dann eine einzelne Äußerung im Licht dieses Lernstands; die Fortschreibung des Lernstands bleibt Aufgabe der Anwendung. Diese Trennung ist zugleich die Voraussetzung dafür, dass Lehrkräfte den Lernstand einsehen können und dass er über eine Sitzung hinaus Bestand hat.

Prüfbare Entscheidungen gehören in den Programmcode. Der wirksamste Schutz gegen Halluzinationen, also frei erfundene, aber plausibel klingende Ausgaben, ist kein KI-Verfahren, sondern eine Zuständigkeitsgrenze. Ob eine Antwort richtig ist, welche Aufgabe als Nächstes kommt, wie viele Hilfen ein Kind schon bekommen hat: Das prüft und steuert die Anwendung, nicht das Sprachmodell. Fading und Hilfebegrenzung sind beides Anwendungslogik, aber mit verschiedenen Steuergrößen. Fading richtet sich nach dem geschätzten Kompetenzstand aus dem Lernendenmodell: Die höchste angebotene Hilfestufe sinkt, wenn ein Kind einen Aufgabentyp zunehmend allein bewältigt. Die Begrenzung bei Missbrauch richtet sich nach dem Nutzungsmuster innerhalb einer Aufgabe: Wer in wenigen Sekunden dreimal den nächsten Hinweis anfordert, bekommt eine Rückfrage statt der nächsten Stufe. Ein Hilfebudget setzt nur das Zweite um; wer damit auch das Erste abbilden will, verknappt die Hilfe für die Kinder, die sie am nötigsten brauchen. Ein Sprachmodell hält eine solche Zurückhaltung im laufenden Gespräch von sich aus nicht durch. Vorstrukturierung über einen Systemprompt steuert das Modell nur wahrscheinlichkeitsbasiert, nicht verbindlich, und gerade Verbote der Art „gib keine vollständige Lösung heraus“ lassen sich durch einfache Nachfragen unterlaufen. Hinzu kommt, dass Kinder ein solches System aktiv testen; Eingaben, die die Vorgaben außer Kraft setzen sollen, sind in einer Klasse binnen weniger Tage in Umlauf. Verlässlich wird die Zurückhaltung von Lösungen erst, wenn die Anwendung entscheidet, welche Hinweisstufe überhaupt an das Modell übergeben wird, und Ausgaben vor der Anzeige prüft. Was das Modell nicht kennt, kann es nicht ausplaudern; bei einfachen Rechenaufgaben, deren Lösung das Modell selbst findet, muss die Prüfung der Ausgabe diese Aufgabe übernehmen. Das steht in Spannung zur Kontingenzforderung aus dem Abschnitt zur Dosierung. Aufgelöst wird sie so: Adaptiv bleiben Diagnose und Formulierung; welche Hilfestufe freigegeben wird, entscheidet die Anwendung nach Regeln, die den geschätzten Kompetenzstand einbeziehen.

Diese Grenze lässt sich allerdings nicht überall ziehen. Ob ein Rechenergebnis stimmt, kann die Anwendung entscheiden; ob eine gesprochene Begründung, eine Skizze oder ein selbst gefundener Rechenweg mathematisch stichhaltig ist, kann sie nicht entscheiden. Wo die Anwendung nichts prüfen kann, sollte das System nicht bewerten, sondern nachfragen und die Beurteilung dem Kind oder der Lehrkraft überlassen.

Fachdidaktisches Wissen an die Aufgaben binden. Die im Abschnitt zur Fundierung genannten Wissensgrundlagen lassen sich auf mehreren Wegen bereitstellen: über den Systemprompt, über strukturiertes Wissen, das an die Aufgaben selbst gebunden ist und situationsabhängig zugespielt wird, oder über ein spezialisiertes Nachtraining des Modells. Der zweite Weg ist in der Praxis der ergiebigste, weil er dasselbe Wissen für die Anwendung, für die Aufgabenauswahl und für die Rückmeldung an die Lehrkraft nutzbar macht. Fehlertaxonomien gehören deshalb als maschinenlesbare Markierungen an Aufgaben und typische Falschantworten, nicht als Fließtext in eine Anweisung. Diese Markierungen sind zugleich die Voraussetzung dafür, den Lernstand fortschreiben zu können: Ein Verfahren wie Knowledge Tracing braucht Aufgaben, denen die geforderten Fähigkeiten zugeordnet sind. Ein umfassendes eigenes Nachtraining scheitert für den deutschsprachigen Primarbereich derzeit meist am fehlenden Datenmaterial; für eng umgrenzte Teilaufgaben, etwa das Kategorisieren typischer Fehler, kann eine Anpassung mit vergleichsweise wenigen, fachdidaktisch kuratierten Beispielen genügen. Ein einzelner, immer längerer Regelkatalog im Systemprompt ist nicht die Lösung: Je mehr Vorgaben gleichzeitig gelten, desto unzuverlässiger werden sie befolgt. Sinnvoller sind kurze, auf die jeweilige Lernsituation zugeschnittene Vorgaben.

Kleine Modelle bringen einen Zielkonflikt mit sich. Für eng umgrenzte Aufgaben kann ein kleineres, spezialisiertes Modell ausreichen, das mit weniger Rechenleistung auskommt und sich lokal auf dem Gerät oder auf eigenen beziehungsweise vertraglich gebundenen Servern betreiben lässt, sodass die Eingaben der Kinder den eigenen Verantwortungsbereich nicht verlassen. Das entschärft Datenschutz- und Energiefragen; auf Schul-Tablets ist die Grenze meist der Arbeitsspeicher. Kleine Modelle sind derzeit aber gerade dort am schwächsten, wo dieser Beitrag die höchsten Anforderungen stellt: beim Deuten offener Kinderäußerungen und beim Erkennen der Vorstellung hinter einem Fehler. Sie folgen komplexen Anweisungen weniger zuverlässig, und die geforderte Zurückhaltung bei Lösungen ist eine solche Anweisung. Realistisch ist heute eine Arbeitsteilung: klar entscheidbare Aufgaben wie Richtig-falsch-Prüfung, die Kategorisierung erwartbarer Fehler und die Aufgabenauswahl lokal und regelbasiert, das offene Gespräch über ein leistungsfähigeres Modell, und nur dort, wo es didaktisch gebraucht wird.

Prüfverfahren mit unabhängigem Signal. Verfahren, bei denen mehrere Modellinstanzen arbeitsteilig zusammenwirken und eine von ihnen die Ausgaben der anderen prüft (Multi-Agent-Ansätze), oder bei denen ein zweites Sprachmodell die Ausgaben des ersten bewertet (LLM-as-Judge), verbessern in mehreren Arbeiten die bewertete Qualität von Scaffolds und senken die Rate offensichtlich falscher Rückmeldungen (Gonnermann-Müller et al., 2025, Preprint; Qian et al., 2026). Diese Ergebnisse beziehen sich auf Qualitätsbewertungen, nicht auf gemessenes Lernen. Wo ein Sprachmodell als Prüfinstanz eingesetzt wird, ist zuvor zu zeigen, dass seine Urteile mit denen fachkundiger Personen übereinstimmen; Cohn et al. (2026) berichten für ihre Prüfmodelle eine hohe Übereinstimmung mit menschlicher Konsenskodierung. Ein Sprachmodell, das ein Sprachmodell prüft, teilt zudem dessen systematische Fehler, besonders wenn beide aus derselben Modellfamilie stammen, und zeigt bekannte Verzerrungen: eine Bevorzugung längerer Antworten und eine Bevorzugung der eigenen Ausgaben (Zheng, Chiang, et al., 2023). Verlässlich sind solche Prüfungen vor allem, wenn die prüfende Instanz eine unabhängige Information nutzt: die bekannte Lösung, eine Regel, eine hinterlegte Wissensquelle. Im Mathematikbereich lässt sich rechnerische Korrektheit eindeutig nachrechnen, bevor eine Ausgabe das Kind erreicht, verlässlich allerdings nur dort, wo die Anwendung die Rechnung selbst kennt und nicht erst aus freiem Text herauslesen muss.

Antwortzeit, Infrastruktur und Kosten. Jede Prüfstufe kostet Antwortzeit. Ein Gespräch mit einem Kind der zweiten Klasse gelingt nur, wenn die Antwort in wenigen Sekunden kommt. Der Zielkonflikt lässt sich entschärfen, wenn die Anwendung nicht auf das Modell wartet: Was sie selbst weiß, zeigt sie sofort, etwa die Rückmeldung zum Ergebnis oder die erste hinterlegte Hinweisstufe, während die frei formulierte Rückmeldung im Hintergrund entsteht und geprüft wird. Eine ganze Klasse arbeitet gleichzeitig über eine Schulinfrastruktur, die zeitweise nicht verfügbar ist; eine Anwendung muss deshalb auch ohne KI-Anbindung sinnvoll weiterlaufen. Und die laufenden Kosten pro Kind entscheiden darüber, ob ein Konzept über den Modellversuch hinaus Bestand hat. Daraus folgt eine sparsame Grundhaltung: Das Sprachmodell wird an den wenigen Stellen eingesetzt, an denen offene Sprache gebraucht wird, und nicht dort, wo eine hinterlegte Rückmeldung dasselbe leistet.

Prüfen, bevor Kinder damit arbeiten. Ein KI-Lernbegleiter muss systematisch und wiederholt geprüft werden. Sinnvoll ist eine feste Sammlung realistischer Kinderäußerungen und typischer Fehler mit dem jeweils erwarteten Systemverhalten, gegen die nach jeder Änderung an Vorgaben oder Modellversion erneut geprüft wird, denn Modellwechsel verändern das Verhalten oft unbemerkt und lassen sich nicht immer aufschieben, weil Anbieter einzelne Modellversionen nach einiger Zeit abstellen. Geprüft wird dabei nicht der Wortlaut der Antwort, sondern ob sie bestimmte Eigenschaften hat: keine vollständige Lösung, ein Bezug auf den genannten Rechenweg, eine Rückfrage statt einer Bewertung. Da dasselbe Modell auf dieselbe Eingabe unterschiedlich antwortet, muss jeder Fall mehrfach durchlaufen werden; das Ergebnis ist eine Fehlerquote, keine Ja-nein-Aussage, und sie wird an einer vorab festgelegten Schwelle gemessen. Ein Lernbegleiter, der in einem von zwanzig Fällen die Lösung ausgibt, fällt in einer Klasse mit 25 Kindern täglich auf. Die Prüfliste für Lehrkräfte im Abschnitt oben lässt sich dafür direkt in Prüffälle übersetzen. Dazu gehören eine gezielte Prüfung auf unerwünschte Ausgaben, die Frage, ob das System einem Kind widerspricht, das eine falsche Begründung überzeugt vorträgt, und die Bewertung einer Stichprobe durch fachdidaktisch geschulte Personen. Benchmarks für pädagogische Qualität liegen inzwischen vor (Macina et al., 2025); sie ersetzen die Prüfung am eigenen Anwendungsfall nicht, geben ihr aber einen Rahmen. Die Verlässlichkeit muss für Modell, Version, Aufgabe und Lerngruppe jeweils geprüft werden.

基于人工智能的学习支持的伦理要求

Die Gestaltungsprinzipien zielen auf die lernwirksame Ausgestaltung von KI-Lernbegleitung. Lernwirksamkeit allein ist aber kein hinreichendes Kriterium, besonders nicht, wenn Kinder die Lernenden sind. Ethische Fragen stellen sich beim Lernen mit generativer KI unabhängig von der Lernwirksamkeit, und sie gehen über den häufig im Vordergrund stehenden Datenschutz hinaus. Holmes et al. (2022) fordern ein gemeinschaftlich entwickeltes Ethik-Rahmenwerk, das Fairness, Transparenz, den Handlungsspielraum der Lernenden (Agency) und pädagogische Verantwortung umfasst. Die Kultusministerkonferenz (KMK, 2024) empfiehlt für Grund- und Förderschulen einen vorsichtigen, forschungsbasierten Einsatz von KI mit Fokus auf Basiskompetenzen, Inklusion, Chancengerechtigkeit und datenschutzkonforme, altersangemessene Lösungen.

Dass die Forschung hier Lücken aufweist, zeigt eine Übersichtsarbeit zu KI und dem Wohlergehen von Lernenden (Human Flourishing) in der Sekundarstufe: Die Forschungslage ist stark leistungsorientiert, während ethische, metakognitive und lehrkraftbezogene Perspektiven unterbelichtet bleiben (Fock & Siller, 2025). Almheiri et al. (2025) sowie Cárdenas et al. (2025) identifizieren ethische Herausforderungen und Skalierungsprobleme als Haupthindernisse für den breiten Einsatz von KI-Tutorsystemen. Arbeiten zum psychologischen Profiling mit großen Sprachmodellen (Rosenfelder et al., 2025) zeigen, wie treffgenau Modelle aus Texten Persönlichkeits- und Wertemuster ableiten können. Ein intransparentes System könnte solche Profile ohne Wissen der Kinder und ihrer Eltern erstellen. Gulz und Haake (2021) betonen zudem die Notwendigkeit, Adaptivität mit inklusiver Pädagogik und Barrierefreiheit zu verbinden, ohne Lernende mit besonderen Bedürfnissen zu stigmatisieren. Dazu gehört ein Punkt, der im Klassenzimmer unmittelbar sichtbar wird: Kinder sehen die Bildschirme ihrer Nachbarn. Differenzierung, die als Abstufung erkennbar wird, wirkt anders als Differenzierung, die sich in der Art der Rückfrage verbirgt.

Aus diesen Befunden und Forderungen lassen sich konkrete ethische Anforderungen an einen verantwortlichen KI-Lernbegleiter ableiten. Er muss datensparsam arbeiten und psychologische Profilbildung vermeiden. Das ist anspruchsvoller, als es klingt, denn offene Eingaben von Kindern sind nicht steuerbar: Kinder schreiben und sprechen Namen, Orte und Persönliches in ein Eingabefeld. Datensparsamkeit muss deshalb an der Speicherung ansetzen und daran, wie wenig überhaupt an einen externen Dienst übermittelt wird. Praktisch heißt das: pseudonyme Kennungen statt Namen, dauerhafte Speicherung nur des fachlichen Lernstands und getrennte Datenbestände. Gesprächsverläufe bleiben nur so lange verfügbar, wie die Lehrkraft sie für die Nachbereitung braucht, etwa wenige Tage, und werden danach automatisch gelöscht. Bei externen Diensten braucht es einen Auftragsverarbeitungsvertrag, der die Verarbeitung im europäischen Raum und den Ausschluss der Weiterverwendung für das Training vorsieht. Verarbeitung auf dem Gerät entschärft viele dieser Fragen, ist aber in der Leistungsfähigkeit begrenzt. Die Qualitätsprüfung durch Fachleute braucht Dialoge; sie sollte auf eine ausdrücklich dafür erhobene, pseudonymisierte Stichprobe gestützt werden und nicht auf den laufenden Datenbestand. Für Forschungsprojekte kommt hinzu, dass Gesprächsverläufe personenbezogene Daten von Kindern sind und eine eigene Rechtsgrundlage sowie die Einwilligung der Erziehungsberechtigten erfordern. Rechtlich zu beachten ist außerdem die europäische KI-Verordnung (Europäische Union, 2024): KI-Systeme, die Lernleistungen bewerten oder den Zugang zu Bildung steuern, gelten als Hochrisikosysteme mit entsprechenden Pflichten, und Transparenzpflichten gegenüber den Nutzenden gelten unabhängig davon.

Der Lernbegleiter muss barrierearm sein und multimodale Interaktion (Sprache, Text, Bild, Handlung) für unterschiedliche Lernbedürfnisse nutzen (Hocine et al., 2023), wobei benachteiligte Lernende bei der Gestaltung gezielt in den Blick genommen werden. Seine Funktionsweise muss in Grundzügen erklärbar und nachvollziehbar sein. Ein Lernendenmodell kann dem Kind auch zugänglich gemacht werden: Offene Lernendenmodelle machen sichtbar, was das System über den Lernstand annimmt, und geben dem Kind die Möglichkeit, dieser Einschätzung zu widersprechen (Bull & Kay, 2016). Untersucht sind sie bislang fast nur mit älteren Lernenden; ob Grundschulkinder eine sichtbare Zustandsanzeige als Hilfe zur Selbsteinschätzung oder als Bewertung erleben, ist offen. Der Lernbegleiter muss Kinder zur kritischen Prüfung von KI-Antworten anregen und dazu beitragen, dass kritisches Denken gestärkt wird statt geschwächt.

Hinzu kommt eine Anforderung, die sich aus dem Alter der Lernenden ergibt. Kinder im Grundschulalter reagieren auf ein geduldiges, freundliches und jederzeit verfügbares Gegenüber mit Beziehungsaufbau. Sie duzen es, erzählen ihm Privates und fragen es, ob es sie mag. Ein KI-Lernbegleiter sollte deshalb weder eine Persönlichkeit noch eine Freundschaft simulieren, seinen Status als Programm auf Nachfrage klar benennen und Gespräche, die den Lerngegenstand verlassen, an Menschen zurückverweisen. Die Beziehung zum Kind ist Aufgabe der Lehrkraft und der Eltern; das System hat sie weder zu ersetzen noch zu imitieren. Der übergeordnete Grundsatz lautet, dass der Lernbegleiter Selbsttätigkeit und Entscheidungsspielräume der Lernenden stärken soll.

SKILL模型作为方向指导框架

对于 PRIMA-AI 项目而言, SKILL模型 als Ordnungsrahmen für den Einsatz generativer KI beim Lernen entwickelt (Urff, 2026). Seine Grundregel lautet: Je geringer die Kompetenz einer Person, KI in einer konkreten Sache lernwirksam zu nutzen, desto mehr didaktische Lenkung braucht der Einsatz, aus dem Werkzeug oder durch die Lehrkraft. Lenkung wird über drei Hebel beschrieben (Scaffolding, Leitplanken, Kontextualisierung), und drei Stufen des Einsatzes (Eingebettet, Begleitet, Offen) markieren, wie viel davon eine Person braucht. Maßgeblich ist die schwächste von vier Teilkompetenzen: Wissen über die Sache; Fehler in KI-Antworten erkennen; das eigene Vorgehen steuern und den Griff zur Lösung zurückstellen; Fragen formulieren und Antworten verarbeiten. Für die Grundschule bedeutet das in der Regel Stufe 1: eine eng vorstrukturierte, in eine Lernanwendung eingebettete KI, deren Grenzen außerhalb des Dialogs verankert sind, begleitet von der Lehrkraft.

Die in diesem Beitrag entwickelten Gestaltungsprinzipien beschreiben, wie ein Werkzeug auf dieser Stufe gebaut sein muss. Fundierung und Dosierung entsprechen den Hebeln Kontextualisierung und Scaffolding, die Hilfebegrenzung den Leitplanken, die Einbettung der Begleitung durch die Lehrkraft. Der SKILL-Check des Modells übersetzt diese Anforderungen in fünf Prüffragen für ein konkretes Werkzeug. Das SKILL-Modell ist ein Ordnungsrahmen, kein empirisch geprüftes Wirkmodell; es macht die Annahmen dieses Beitrags planbar, belegt sie aber nicht.

资产负债表与未决问题

Die vier Gestaltungsprinzipien lassen sich in einem Satz zusammenfassen: Ein KI-Lernbegleiter für die Grundschule ist dann hilfreich, wenn er weiß, wie Kinder Mathematik lernen, wenn er weniger sagt, als er könnte, wenn er zum Nachdenken und Nachfragen auffordert, statt zu erklären, und wenn eine Lehrkraft sieht und steuert, was er tut. Fehlt eine dieser Bedingungen, ist der Verzicht auf den Einsatz die bessere Entscheidung. Für die Primarstufe bleiben diese Prinzipien forschungsbasierte Gestaltungsannahmen. Die große Mehrheit der Wirkungsbefunde stammt aus Sekundarstufe, Hochschule oder Erwachsenenstichproben; die Meta-Analyse zur Grundschule betrifft regelbasierte Systeme, und die wenigen Grundschulstudien zu dialogischen Systemen sind klein oder explorativ.

Daraus ergeben sich offene Forschungsfragen. Es fehlen Langzeitstudien, die KI-gestützte Lernbegleitung über einzelne Interventionen hinaus untersuchen, insbesondere zur Frage, ob adaptives Scaffolding zu dauerhaftem Kompetenzaufbau führt oder ob sich Nachteile erst mit zeitlicher Verzögerung zeigen. Es fehlen Studien, die die Bedingungen der Primarstufe systematisch berücksichtigen: geringere Lesekompetenz, andere Interaktionsmuster, das Zusammenspiel mit konkretem Material und die Frage, wie lange ein Kind ohne Hilfe suchen sollte. Ungeklärt ist, wie Lehrkräfte KI-Lernbegleitung im Alltag einer heterogenen Grundschulklasse mit begrenzter Infrastruktur integrieren, wer wann welche Aufmerksamkeit erhält und wie hoch die zusätzliche Belastung der Lehrkraft dabei ist. Hinzu kommt ein methodisches Problem, das die Bewertung aller genannten Systeme betrifft: Die Qualität von KI-Lernbegleitern wird derzeit überwiegend an Ersatzgrößen gemessen, an Expertenurteilen über Dialoge, an Benchmark-Ergebnissen oder an Bewertungen durch andere Sprachmodelle. Ob ein System, das nach diesen Maßstäben gut abschneidet, zu Lernzuwachs führt, ist bisher kaum untersucht. Solange dieser Zusammenhang offen ist, sind gute Benchmark-Werte kein Wirksamkeitsnachweis.

Im Projekt PRIMA-KI entstehen auf Basis der hier formulierten Prinzipien appintegrierte KI-Lernbegleitungen, die in Zyklen aus Entwicklung, Erprobung und Überarbeitung (Design-Based Research) erforscht und weiterentwickelt werden. Die Ergebnisse dieser Zyklen werden auf urff.app dokumentiert und fließen in die nächste Fassung dieses Beitrags ein.

文学

Abdulsalam, R. O., & Aroyehun, S. (2025). Large language models approach expert pedagogical quality in math tutoring but differ in instructional and linguistic profiles [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2512.20780

Alemdag, E. (2025). The effect of chatbots on learning: A meta-analysis of empirical research. Journal of Research on Technology in Education, 57(2), 459–481. https://doi.org/10.1080/15391523.2023.2255698

Aleven, V., Roll, I., McLaren, B. M., & Koedinger, K. R. (2016). Help helps, but only so much: Research on help seeking with intelligent tutoring systems. International Journal of Artificial Intelligence in Education, 26(1), 205–223. https://doi.org/10.1007/s40593-015-0089-1

Almheiri, A. S. B., Albastaki, H., & Alrashdan, H. (2025). AI-based tutoring systems in education. In B. I. Edwards, H. Abuhassna, D. Olugbade, O. A. Ojo & W. A. Jaafar Wan Yahaya (Hrsg.), Generators, bots, and tutors (S. 185–210). IGI Global. https://doi.org/10.4018/979-8-3373-0847-0.ch007

Attia, A. A., Liu, J., Ai, W., Demszky, D., & Espy-Wilson, C. (2024). Kid-Whisper: Towards bridging the performance gap in automatic speech recognition for children vs. adults. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 74–80. https://doi.org/10.1609/aies.v7i1.31618

Aufenanger, S., Herzig, B., & Schiefner-Rohs, M. (2023). Künstliche Intelligenz und Schule. Aufgaben für Unterricht und die Organisation (von) Schule. In C. de Witt, C. Gloerfeld & S. E. Wrede (Hrsg.), Künstliche Intelligenz in der Bildung (S. 199–218). Springer Fachmedien. https://doi.org/10.1007/978-3-658-40079-8_10

Awang, L. A., Yusop, F. D., & Danaee, M. (2025). Current practices and future direction of artificial intelligence in mathematics education: A systematic review. International Electronic Journal of Mathematics Education, 20(2), em0823. https://doi.org/10.29333/iejme/16006

Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences, 122(26), e2422633122. https://doi.org/10.1073/pnas.2422633122 (Korrektur: 122(34), e2518204122. https://doi.org/10.1073/pnas.2518204122)

Bjork, E. L., & Bjork, R. A. (2011). Making things hard on yourself, but in a good way: Creating desirable difficulties to enhance learning. In M. A. Gernsbacher, R. W. Pew, L. M. Hough & J. R. Pomerantz (Hrsg.), Psychology and the real world: Essays illustrating fundamental contributions to society (S. 56–64). Worth Publishers.

Bruner, J. S. (1966). Toward a theory of instruction. Belknap Press of Harvard University Press.

Bull, S., & Kay, J. (2016). SMILI☺: A framework for interfaces to learning data in open learner models, learning analytics and related fields. International Journal of Artificial Intelligence in Education, 26(1), 293–331. https://doi.org/10.1007/s40593-015-0090-8

Canonigo, A. M. (2024). Levering AI to enhance students‘ conceptual understanding and confidence in mathematics. Journal of Computer Assisted Learning, 40(6), 3215–3229. https://doi.org/10.1111/jcal.13065

Cárdenas, R., Vásquez, H. G. E., Gamboa, D. A. P., Arteaga-Arcentales, E., & Carrera, J. E. M. (2025). Exploring AI-powered adaptive learning systems and their implementation in educational settings: A systematic literature review. International Journal of Innovative Research and Scientific Studies, 8(4), 832–842. https://doi.org/10.53894/ijirss.v8i4.7961

Chudziak, J. A., & Kostka, A. (2025). AI-powered math tutoring: Platform for personalized and adaptive education. In A. I. Cristea, E. Walker, Y. Lu, O. C. Santos & S. Isotani (Hrsg.), Artificial intelligence in education (Lecture Notes in Computer Science, Bd. 15882, S. 462–469). Springer. https://doi.org/10.1007/978-3-031-98465-5_58

Cohn, C., Rayala, S., Srivastava, N., Fonteles, J., Jain, S., Luo, X., Mereddy, D., Mohammed, N., & Biswas, G. (2026). A theory of adaptive scaffolding for LLM-based pedagogical agents. Proceedings of the AAAI Conference on Artificial Intelligence, 40(3), 1757–1765. https://doi.org/10.1609/aaai.v40i3.37154

Contel, F., & Cusi, A. (2025). Investigating the role of ChatGPT in supporting metacognitive processes during problem-solving activities. Digital Experiences in Mathematics Education, 11(1), 167–191. https://doi.org/10.1007/s40751-024-00164-7

Corbett, A. T., & Anderson, J. R. (1995). Knowledge tracing: Modeling the acquisition of procedural knowledge. User Modeling and User-Adapted Interaction, 4(4), 253–278. https://doi.org/10.1007/BF01099821

Cosentino, G., Anton, J., Sharma, K., Gelsomini, M., Giannakos, M. N., & Abrahamson, D. (2025). Generative AI and multimodal data for educational feedback: Insights from embodied math learning. British Journal of Educational Technology, 56(5), 1686–1709. https://doi.org/10.1111/bjet.13587

Deng, R., Jiang, M., Yu, X., Lu, Y., & Liu, S. (2025). Does ChatGPT enhance student learning? A systematic review and meta-analysis of experimental studies. Computers & Education, 227, 105224. https://doi.org/10.1016/j.compedu.2024.105224

Dinsmore, D. L., & Fryer, L. K. (2026). What does current genAI actually mean for student learning? Learning and Individual Differences, 125, 102834. https://doi.org/10.1016/j.lindif.2025.102834

Eedi & Google DeepMind. (2025, 11. November). New exploratory research from Eedi and Google DeepMind reveals human-in-the-loop AI tutoring outperforms human-only support [Pressemitteilung]. https://www.eedi.com/news/new-exploratory-research-from-eedi-and-google-deepmind-reveals-human-in-the-loop-ai-tutoring-outperforms-human-only-support

Eti, N., Mosia, M., & Egara, F.O. (2026). 人工智能驱动的个性化学习在提升数学问题解决能力中的作用:系统性综述。计算机科学前沿,8。https://doi.org/10.3389/fcomp.2026.1813431

Europäische Union. (2024). Verordnung (EU) 2024/1689 des Europäischen Parlaments und des Rates vom 13. Juni 2024 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz (KI-Verordnung). Amtsblatt der Europäischen Union, L, 12.7.2024. https://eur-lex.europa.eu/eli/reg/2024/1689/oj

Fock, A., & Siller, H.-S. (2025). Generative artificial intelligence in secondary STEM education in the light of human flourishing: A scoping literature review. International Journal of STEM Education, 12(1), 67. https://doi.org/10.1186/s40594-025-00589-5

Gaidoschik, M. (2010). Wie Kinder rechnen lernen – oder auch nicht: Theoretische und empirische Grundlagen einer entwicklungspsychologisch orientierten Rechendidaktik. Peter Lang. https://doi.org/10.3726/978-3-653-01218-7

Gerlich, M. (2025). AI tools in society: Impacts on cognitive offloading and the future of critical thinking. Societies, 15(1), 6. https://doi.org/10.3390/soc15010006 (Korrektur: 15(9), 252. https://doi.org/10.3390/soc15090252)

Gonnermann-Müller, J., Haase, J., Fackeldey, K., & Pokutta, S. (2025). FACET: Teacher-centred LLM-based multi-agent systems – Towards personalized educational worksheets [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2508.11401

Guerino, G., Challco, G. C., Veloso, T. E., Oliveira, L., Penha, R. S. D., Melo, R. F., Vieira, T., Marinho, M. L. M., Macario, V., Bittencourt, I. I., Isotani, S., & Dermeval, D. (2023). Teacher-centered intelligent tutoring systems: Design considerations from Brazilian public school teachers. Anais do XXXIV Simpósio Brasileiro de Informática na Educação (SBIE 2023) (S. 1419–1430). Sociedade Brasileira de Computação. https://doi.org/10.5753/sbie.2023.235159

Gulz, A., & Haake, M. (2021). No child left behind, nor singled out: Is it possible to combine adaptive instruction and inclusive pedagogy in early math software? SN Social Sciences, 1, 205. https://doi.org/10.1007/s43545-021-00205-7

Guo, J., Ma, Y., Jang, H., Li, T., Wu, J., Huang, D., Han, F., Noetel, M., Liao, K., Tang, X., & Kui, X. (2025). The impact of artificial intelligence on primary school students‘ motivation and engagement: A systematic review [Preprint]. PsyArXiv. https://doi.org/10.31234/osf.io/ecspn_v1

Hattie, J., & Timperley, H. (2007). The power of feedback. Review of Educational Research, 77(1), 81–112. https://doi.org/10.3102/003465430298487

Helal, M., Holthaus, P., Wood, L., Velmurugan, V., Lakatos, G., Moros, S., & Amirabdollahian, F. (2024). When the robotic maths tutor is wrong – Can children identify mistakes generated by ChatGPT? In 2024 5th International Conference on Artificial Intelligence, Robotics and Control (AIRC) (S. 83–90). IEEE. https://doi.org/10.1109/AIRC61399.2024.10672220

Hmelo-Silver, C. E., Duncan, R. G., & Chinn, C. A. (2007). Scaffolding and achievement in problem-based and inquiry learning: A response to Kirschner, Sweller, and Clark (2006). Educational Psychologist, 42(2), 99–107. https://doi.org/10.1080/00461520701263368

Hocine, N., Moussa, M. B. O., & Ali, S. A. (2023). PosiCalculia: An adaptive virtual environment for children with learning difficulties. In 2023 International Conference on Innovations in Intelligent Systems and Applications (INISTA) (S. 1–6). IEEE. https://doi.org/10.1109/inista59065.2023.10310592

Holmes, W., & Tuomi, I. (2022). State of the art and practice in AI in education. European Journal of Education, 57(4), 542–570. https://doi.org/10.1111/ejed.12533

Holmes, W., Bialik, M., & Fadel, C. (2019). Artificial intelligence in education: Promise and implications for teaching and learning. Center for Curriculum Redesign.

Holmes, W., Porayska-Pomsta, K., Holstein, K., Sutherland, E., Baker, T., Shum, S. B., Santos, O. C., Rodrigo, M. T., Cukurova, M., Bittencourt, I. I., & Koedinger, K. R. (2022). Ethics of AI in education: Towards a community-wide framework. International Journal of Artificial Intelligence in Education, 32(3), 504–526. https://doi.org/10.1007/s40593-021-00239-1

Holstein, K., McLaren, B. M., & Aleven, V. (2018). Student learning benefits of a mixed-reality teacher awareness tool in AI-enhanced classrooms. In C. Penstein Rosé, R. Martínez-Maldonado, H. U. Hoppe, R. Luckin, M. Mavrikis, K. Porayska-Pomsta, B. McLaren & B. du Boulay (Hrsg.), Artificial intelligence in education (Lecture Notes in Computer Science, Bd. 10947, S. 154–168). Springer. https://doi.org/10.1007/978-3-319-93843-1_12

Hwang, S. (2022). Examining the effects of artificial intelligence on elementary students‘ mathematics achievement: A meta-analysis. Sustainability, 14(20), 13185. https://doi.org/10.3390/su142013185

Jančařík, A., Michal, J., & Novotná, J. (2023). Using AI chatbot for math tutoring. Journal of Education Culture and Society, 14(2), 285–296. https://doi.org/10.15503/jecs2023.2.285.296

Kaliisa, R., Misiejuk, K., López-Pernas, S., & Saqr, M. (2026). How does artificial intelligence compare to human feedback? A meta-analysis of performance, feedback perception, and learning dispositions. Educational Psychology, 46(1), 80–111. https://doi.org/10.1080/01443410.2025.2553639

Kalyuga, S. (2007). Expertise reversal effect and its implications for learner-tailored instruction. Educational Psychology Review, 19(4), 509–539. https://doi.org/10.1007/s10648-007-9054-3

Kalyuga, S., Ayres, P., Chandler, P., & Sweller, J. (2003). The expertise reversal effect. Educational Psychologist, 38(1), 23–31. https://doi.org/10.1207/S15326985EP3801_4

Kapur, M. (2016). Examining productive failure, productive success, unproductive failure, and unproductive success in learning. Educational Psychologist, 51(2), 289–299. https://doi.org/10.1080/00461520.2016.1155457

Kestin, G., Miller, K., Klales, A., Milbourne, T., & Ponti, G. (2025). AI tutoring outperforms in-class active learning: An RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports, 15(1), 17458. https://doi.org/10.1038/s41598-025-97652-6

Kirschner, P. A., Sweller, J., & Clark, R. E. (2006). Why minimal guidance during instruction does not work: An analysis of the failure of constructivist, discovery, problem-based, experiential, and inquiry-based teaching. Educational Psychologist, 41(2), 75–86. https://doi.org/10.1207/s15326985ep4102_1

Kluger, A. N., & DeNisi, A. (1996). The effects of feedback interventions on performance: A historical review, a meta-analysis, and a preliminary feedback intervention theory. Psychological Bulletin, 119(2), 254–284. https://doi.org/10.1037/0033-2909.119.2.254

Koedinger, K. R., & Aleven, V. (2007). Exploring the assistance dilemma in experiments with Cognitive Tutors. Educational Psychology Review, 19(3), 239–264. https://doi.org/10.1007/s10648-007-9049-0

Kortenkamp, U. (2024). Wieviel Mathe braucht der Mensch? Mathematische Kernkompetenzen im Angesicht von KI. In A. S. Steinweg (Hrsg.), Schule im Wandel – Mathematikunterricht im Wandel: Tagungsband des AK Grundschule in der GDM 2024 (S. 57–72). University of Bamberg Press. https://doi.org/10.20378/irb-104036

Kultusministerkonferenz [KMK]. (2024). Handlungsempfehlung für die Bildungsverwaltung zum Umgang mit Künstlicher Intelligenz in schulischen Bildungsprozessen [Beschluss vom 10.10.2024]. Kultusministerkonferenz. https://www.kmk.org/fileadmin/veroeffentlichungen_beschluesse/2024/2024_10_10-Handlungsempfehlung-KI.pdf

Kumar, H., Rothschild, D. M., Goldstein, D. G., & Hofman, J. M. (2025). Math education with large language models: Peril or promise? In A. I. Cristea, E. Walker, Y. Lu, O. C. Santos & S. Isotani (Hrsg.), Artificial intelligence in education (Lecture Notes in Computer Science, Bd. 15880, S. 60–75). Springer. https://doi.org/10.1007/978-3-031-98459-4_5

Kuo, B.-C., Bai, Z.-E., & Lin, C.-H. (2026). Developing an AI learning companion for mathematics problem solving in elementary schools. Computers & Education, 240, 105463. https://doi.org/10.1016/j.compedu.2025.105463

Létourneau, A., Deslandes Martineau, M., Charland, P., Karran, J. A., Boasen, J., & Léger, P. M. (2025). A systematic review of AI-driven intelligent tutoring systems (ITS) in K-12 education. npj Science of Learning, 10(1), 29. https://doi.org/10.1038/s41539-025-00320-7

Ligthart, M. E. U., de Droog, S. M., Bossema, M., Elloumi, L., Hoogland, K., Smakman, M. H. J., Hindriks, K. V., & Ben Allouch, S. (2023). Design specifications for a social robot math tutor. In G. Castellano, L. Riek, M. Cakmak & J. Leite (Hrsg.), Proceedings of the 2023 ACM/IEEE International Conference on Human-Robot Interaction (S. 321–330). ACM/IEEE. https://doi.org/10.1145/3568162.3576957

Listyaningrum, P., Retnawati, H., Harun, H., & Ibda, H. (2024). Digital learning using ChatGPT in elementary school mathematics learning: A systematic literature review. Indonesian Journal of Electrical Engineering and Computer Science, 36(3), 1701–1710. https://doi.org/10.11591/ijeecs.v36.i3.pp1701-1710

Liu, B., Zhang, W., & Wang, F. (2026). Can generative artificial intelligence effectively enhance students‘ mathematics learning outcomes? A meta-analysis of empirical studies from 2023 to 2025. Education Sciences, 16(1), 140. https://doi.org/10.3390/educsci16010140

Liu, J., Sun, D., Sun, J., Wang, J., & Yu, P. L. H. (2025). Designing a generative AI enabled learning environment for mathematics word problem solving in primary schools: Learning performance, attitudes and interaction. Computers and Education: Artificial Intelligence, 9, 100438. https://doi.org/10.1016/j.caeai.2025.100438

Ma, W., Adesope, O. O., Nesbit, J. C., & Liu, Q. (2014). Intelligent tutoring systems and learning outcomes: A meta-analysis. Journal of Educational Psychology, 106(4), 901–918. https://doi.org/10.1037/a0037123

Macina, J., Daheim, N., Hakimi, I., Kapur, M., Gurevych, I., & Sachan, M. (2025). MathTutorBench: A benchmark for measuring open-ended pedagogical capabilities of LLM tutors. In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (S. 204–221). Association for Computational Linguistics. https://doi.org/10.18653/v1/2025.emnlp-main.11

Makransky, G., Shiwalia, B. M., Herlau, T., & Blurton, S. (2025). Beyond the “wow” factor: Using generative AI for increasing generative sense-making. Educational Psychology Review, 37(3), 60. https://doi.org/10.1007/s10648-025-10039-x

Mason, J., Burton, L., & Stacey, K. (1982). Thinking mathematically. Addison-Wesley.

Molenaar, I. (2022). The concept of hybrid human-AI regulation: Exemplifying how to support young learners‘ self-regulated learning. Computers and Education: Artificial Intelligence, 3, 100070. https://doi.org/10.1016/j.caeai.2022.100070

Molenaar, I., & Knoop-van Campen, C. A. N. (2019). How teachers make dashboard information actionable. IEEE Transactions on Learning Technologies, 12(3), 347–355. https://doi.org/10.1109/TLT.2018.2851585

Mueller, C. M., & Dweck, C. S. (1998). Praise for intelligence can undermine children’s motivation and performance. Journal of Personality and Social Psychology, 75(1), 33–52. https://doi.org/10.1037/0022-3514.75.1.33

Opesemowo, O. A. G., & Adewuyi, H. O. (2024). A systematic review of artificial intelligence in mathematics education: The emergence of 4IR. Eurasia Journal of Mathematics, Science and Technology Education, 20(7), em2478. https://doi.org/10.29333/ejmste/14762

Padberg, F., & Benz, C. (2021). Didaktik der Arithmetik: Fundiert, vielseitig, praxisnah (5. Aufl.). Springer Spektrum.

Puntambekar, S., & Hübscher, R. (2005). Tools for scaffolding students in a complex learning environment: What have we gained and what have we missed? Educational Psychologist, 40(1), 1–12. https://doi.org/10.1207/s15326985ep4001_1

Qian, K., Liu, S., Li, T., Raković, M., Li, X., Guan, R., Molenaar, I., Nawaz, S., Swiecki, Z., Yan, L., & Gašević, D. (2026). Towards reliable generative AI-driven scaffolding: Reducing hallucinations and enhancing quality in self-regulated learning support. Computers & Education, 240, 105448. https://doi.org/10.1016/j.compedu.2025.105448

Renkl, A. (2014). Toward an instructionally oriented theory of example-based learning. Cognitive Science, 38(1), 1–37. https://doi.org/10.1111/cogs.12086

Renkl, A., & Atkinson, R. K. (2003). Structuring the transition from example study to problem solving in cognitive skill acquisition: A cognitive load perspective. Educational Psychologist, 38(1), 15–22. https://doi.org/10.1207/S15326985EP3801_3

Rosenfelder, A., Levitin, M. D., & Gilead, M. (2025). Towards social superintelligence? AI infers diverse psychological traits from text without specific training, outperforming human judges. Computers in Human Behavior: Artificial Humans, 6, 100228. https://doi.org/10.1016/j.chbah.2025.100228

Ruan, S., He, J., Ying, R., Burkle, J., Hakim, D., Wang, A., Yin, Y., Zhou, L., Xu, Q., AbuHashem, A. A., Dietz, G., Murnane, E. L., Brunskill, E., & Landay, J. A. (2020). Supporting children’s math learning with feedback-augmented narrative technology. In Proceedings of the Interaction Design and Children Conference (S. 567–580). ACM. https://doi.org/10.1145/3392063.3394400

Rumbelow, M., & Coles, A. (2024). The promise of AI object-recognition in learning mathematics: An explorative study of 6-year-old children’s interactions with Cuisenaire rods and the Blockplay.ai app. Education Sciences, 14(6), 591. https://doi.org/10.3390/educsci14060591

Salden, R. J. C. M., Koedinger, K. R., Renkl, A., Aleven, V., & McLaren, B. M. (2010). Accounting for beneficial effects of worked examples in tutored problem solving. Educational Psychology Review, 22(4), 379–392. https://doi.org/10.1007/s10648-010-9143-6

Samuelsson, J. (2023). Arithmetic fact fluency supported by artificial intelligence. Frontiers in Education Technology (Scholink), 6(1), 13. https://doi.org/10.22158/fet.v6n1p13

Sayed, W. S., Noeman, A., Abdellatif, A., Abdelrazek, M., Badawy, M. G., Hamed, A. E. A., & El-Tantawy, S. (2022). AI-based adaptive personalized content presentation and exercises navigation for an effective and engaging e-learning platform. Multimedia Tools and Applications, 82(3), 3303–3333. https://doi.org/10.1007/s11042-022-13076-8

Schneider, R. J. (o. J.). Der Einsatz von KI zur Unterstützung bei der Unterrichtsvorbereitung: Wie lassen sich KI-generierte Übungsaufgaben für den Mathematikunterricht der Grundschule fachdidaktisch bewerten? [Unveröffentlichtes Manuskript].

Sharma, M., Tong, M., Korbak, T., Duvenaud, D., Askell, A., Bowman, S. R., Cheng, N., Durmus, E., Hatfield-Dodds, Z., Johnston, S. R., Kravec, S., Maxwell, T., McCandlish, S., Ndousse, K., Rausch, O., Schiefer, N., Yan, D., Zhang, M., & Perez, E. (2024). Towards understanding sycophancy in language models. In The Twelfth International Conference on Learning Representations (ICLR 2024). https://openreview.net/forum?id=tvhaxkMKAn

Shute, V. J. (2008). Focus on formative feedback. Review of Educational Research, 78(1), 153–189. https://doi.org/10.3102/0034654307313795

Son, T. (2024). Artificial intelligence in mathematics education: A systematic literature review on intelligent tutoring systems. Journal of Educational Research in Mathematics, 34(2), 187–208. https://doi.org/10.29275/jerm.2024.34.2.187

Song, Y., Kim, J., Liu, Z., Li, C., & Xing, W. (2026). Students‘ perceived roles, opportunities, and challenges of a generative AI-powered teachable agent: A case of middle school math class. Journal of Research on Technology in Education, 58(3), 535–554. https://doi.org/10.1080/15391523.2024.2447727

Ständige Wissenschaftliche Kommission der Kultusministerkonferenz [SWK]. (2024). Large Language Models und ihre Potenziale im Bildungssystem [Impulspapier]. https://doi.org/10.25656/01:28303

Steenbergen-Hu, S., & Cooper, H. (2013). A meta-analysis of the effectiveness of intelligent tutoring systems on K–12 students‘ mathematical learning. Journal of Educational Psychology, 105(4), 970–987. https://doi.org/10.1037/a0032447

Steenbergen-Hu, S., & Cooper, H. (2014). A meta-analysis of the effectiveness of intelligent tutoring systems on college students‘ academic learning. Journal of Educational Psychology, 106(2), 331–347. https://doi.org/10.1037/a0034752

Sweller, J. (2020). Cognitive load theory and educational technology. Educational Technology Research and Development, 68(1), 1–16. https://doi.org/10.1007/s11423-019-09701-3

Sweller, J., van Merriënboer, J. J. G., & Paas, F. (2019). Cognitive architecture and instructional design: 20 years later. Educational Psychology Review, 31(2), 261–292. https://doi.org/10.1007/s10648-019-09465-5

Tabak, I. (2004). Synergy: A complement to emerging patterns of distributed scaffolding. Journal of the Learning Sciences, 13(3), 305–335. https://doi.org/10.1207/s15327809jls1303_3

Urff, C. (2026). Das SKILL-Modell: Wie viel Lenkung braucht Lernen mit KI? urff.app. https://urff.app/skill-modell-ki-unterricht-grundschule/

van de Pol, J., Volman, M., & Beishuizen, J. (2010). Scaffolding in teacher–student interaction: A decade of research. Educational Psychology Review, 22(3), 271–296. https://doi.org/10.1007/s10648-010-9127-6

VanLehn, K. (2011). The relative effectiveness of human tutoring, intelligent tutoring systems, and other tutoring systems. Educational Psychologist, 46(4), 197–221. https://doi.org/10.1080/00461520.2011.611369

Vygotsky, L. S. (1978). Mind in society: The development of higher psychological processes (M. Cole, V. John-Steiner, S. Scribner & E. Souberman, Hrsg.). Harvard University Press.

Wang, D., Shan, D., Ju, R., Kao, B., Zhang, C., & Chen, G. (2025). Investigating dialogic interaction in K12 online one-on-one mathematics tutoring using AI and sequence mining techniques. Education and Information Technologies, 30(7), 9215–9240. https://doi.org/10.1007/s10639-024-13195-9

Wang, J., & Fan, W. (2025). The effect of ChatGPT on students‘ learning performance, learning perception, and higher-order thinking: Insights from a meta-analysis. Humanities and Social Sciences Communications, 12(1), 1–21. https://doi.org/10.1057/s41599-025-04787-y

Wang, L., & Nie, Z. (2023). Research on adaptive learning in K-12 education in the perspective of teachers‘ artificial intelligence literacy: Development, technology, improvement strategies. In 2023 5th International Conference on Computer Science and Technologies in Education (CSTE) (S. 1–8). IEEE. https://doi.org/10.1109/cste59648.2023.00059

Wang, R. E., Ribeiro, A. T., Robinson, C. D., Loeb, S., & Demszky, D. (2024). Tutor CoPilot: A human-AI approach for scaling real-time expertise [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2410.03017

Wartha, S., & Schulz, A. (2012). Rechenproblemen vorbeugen. Cornelsen Scriptor.

Weidlich, J., Gašević, D., Drachsler, H., & Kirschner, P. A. (2025). ChatGPT in education: An effect in search of a cause. Journal of Computer Assisted Learning, 41(5), e70105. https://doi.org/10.1111/jcal.70105

Wezendonk, A., & Veldhuis, M. (2024). Adaptieve leersystemen en de didactische besluitvorming van basisschoolleerkrachten bij rekenen-wiskunde. Tijdschrift OnderwijsPraktijk Studies. https://doi.org/10.54657/tops.13844

Wisniewski, B., Zierer, K., & Hattie, J. (2020). The power of feedback revisited: A meta-analysis of educational feedback research. Frontiers in Psychology, 10, 3087. https://doi.org/10.3389/fpsyg.2019.03087

Wood, D., Bruner, J. S., & Ross, G. (1976). The role of tutoring in problem solving. Journal of Child Psychology and Psychiatry, 17(2), 89–100. https://doi.org/10.1111/j.1469-7610.1976.tb00381.x

Wu, R., & Yu, Z. (2024). Do AI chatbots improve students learning outcomes? Evidence from a meta-analysis. British Journal of Educational Technology, 55(1), 10–33. https://doi.org/10.1111/bjet.13334

Wu, X.-Y., Radloff, J., Yeter, I., Wang, L., & Chiu, T. K. F. (2026). Designing artificial intelligence chatbots for self-regulated learning from a systematic review based on Habermas’s three interests. Interactive Learning Environments, 34(5), 3141–3164. https://doi.org/10.1080/10494820.2025.2563086

Yim, I. H. Y., & Su, J. (2025). Artificial intelligence literacy education in primary schools: A review. International Journal of Technology and Design Education, 35(5), 2175–2204. https://doi.org/10.1007/s10798-025-09979-w

Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., & Stoica, I. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. In Advances in Neural Information Processing Systems 36 (NeurIPS 2023, Datasets and Benchmarks Track). arXiv-Fassung: https://doi.org/10.48550/arXiv.2306.05685

Zheng, L., Niu, J., Zhong, L., & Gyasi, J. F. (2023). The effectiveness of artificial intelligence on learning achievement and learning perception: A meta-analysis. Interactive Learning Environments, 31(9), 5650–5664. https://doi.org/10.1080/10494820.2021.2015693

Zimmerman, B. J. (2002). Becoming a self-regulated learner: An overview. Theory Into Practice, 41(2), 64–70. https://doi.org/10.1207/s15430421tip4102_2

延伸阅读

Die folgenden Titel wurden bei der Erarbeitung des Beitrags herangezogen, werden im Text aber nicht direkt zitiert.

Aru, J., & Laak, K.-J. (2025). Developing an AI-based general personal tutor for education. Trends in Cognitive Sciences, 29(11), 957–960. https://doi.org/10.1016/j.tics.2025.09.010

Bach, K. M., Reinhold, F., & Hofer, S. (2025). Unlocking math potential in students from lower SES backgrounds – using instructional scaffolds to improve performance. npj Science of Learning, 10(1), 66. https://doi.org/10.1038/s41539-025-00358-7

Buchholtz, N., Schorcht, S., Baumanns, L., Huget, J., Noster, N., Rott, B., Siller, H.-S., & Sommerhoff, D. (2024). Damit rechnet niemand! Sechs Leitgedanken zu Implikationen und Forschungsbedarfen zu KI-Technologien im Mathematikunterricht. Mitteilungen der Gesellschaft für Didaktik der Mathematik, 117.

Gisiger, M. (2025, 17. April). Die Rolle von Künstlicher Intelligenz im Lernen – Chancen und Risiken [Blogbeitrag]. https://text.tchncs.de/gisiger/die-rolle-von-kunstlicher-intelligenz-im-lernen-chancen-und-risiken

Harahap, R. (2024). The role of ChatGPT in enhancing mathematics education: A systematic review. Annals of the Vietnam Academy of Science and Technology, 28(2s), 511–524. https://doi.org/10.52783/anvi.v28.2753

Li, M. (2024). Integrating artificial intelligence in primary mathematics education: Investigating internal and external influences on teacher adoption. International Journal of Science and Mathematics Education. https://doi.org/10.1007/s10763-024-10515-w

Mott, B., Gupta, A., Glazewski, K., Ottenbreit-Leftwich, A., Hmelo-Silver, C., Scribner, A., Lee, S., & Lester, J. (2023). Fostering upper elementary AI education: Iteratively refining a use-modify-create scaffolding progression for AI planning. In Proceedings of the 2023 Conference on Innovation and Technology in Computer Science Education V. 2 (S. 647). ACM. https://doi.org/10.1145/3587103.3594170

Ninaus, M., & Sailer, M. (2022). Closing the loop – The human role in artificial intelligence for education. Frontiers in Psychology, 13. https://doi.org/10.3389/fpsyg.2022.956798

Topkaya, Y., Doğan, Y., Batdı, V., & Aydın, S. (2025). 人工智能在小学教育中的应用:一项定量支持的混合元方法研究[预印本]。预印本。https://doi.org/10.20944/preprints202501.2263.v1

Vitale, A., & Dello Iacono, U. (2024). 利用社交机器人作为包容性教育技术,通过讲故事的方式进行数学学习。《欧洲公共与社会创新评论》,9,1-17。https://doi.org/10.31637/epsir-2024-672

1 条回复

  1. 在学习过程中的适当时间,可以使用“思考……„等提示语。人工智能辅助学习指导也能在此发挥重要作用,减轻教师的负担并为其提供补充。