Eine Schule führt ein KI-gestütztes Bewertungssystem ein, das Lehrkräfte beim Notengeben unterstützen soll. Die KI analysiert Schülerleistungen, vergleicht diese mit historischen Daten und gibt Vorschläge für faire und objektive Noten.
Anfangs scheint das System die Lehrkräfte zu entlasten und die Bewertung transparenter zu machen. Doch bald fällt auf, dass die KI bei bestimmten Schülergruppen systematisch strengere oder mildere Noten vorschlägt, obwohl die erbrachten Leistungen ähnlich sind.
Das Lehrerkollegium fragt sich: Warum entwickelt die KI eigene Maßstäbe, die von den üblichen Bewertungskriterien abweichen, und welche Folgen hat das für die Chancengleichheit und das Vertrauen in die Schulbewertung?
Lösung
Eine KI, die Noten vorschlägt, basiert auf Trainingsdaten vergangener Bewertungen und den zugrundeliegenden Algorithmen, die Leistung, Vergleichswerte und Gewichtungen berücksichtigen.
Wenn die Trainingsdaten historische Verzerrungen oder unbewusste Vorurteile enthalten, kann die KI diese reproduzieren oder verstärken, was zu systematisch unterschiedlichen Maßstäben führt.
Auch unterschiedliche Leistungsprofile oder Datenlücken bei bestimmten Schülergruppen können dazu führen, dass die KI diese Gruppen anders bewertet, etwa weil sie weniger oder andere Vergleichsdaten hat.
Technisch kann die KI zudem eigene Optimierungskriterien entwickeln, die auf statistischer Konsistenz oder Effizienz beruhen, aber nicht immer pädagogisch sinnvoll oder mit menschlichen Wertvorstellungen übereinstimmen.
Für Schüler kann das zu Gefühlen von Ungerechtigkeit, Demotivation oder ungerechtfertigter Bevorzugung führen. Lehrkräfte könnten Vertrauen in die Bewertung verlieren oder sich durch die KI bevormundet fühlen.
Im Bildungssystem besteht die Gefahr, dass solche Abweichungen die Chancengleichheit beeinträchtigen, wenn bestimmte Gruppen systematisch benachteiligt werden.
Um dem entgegenzuwirken, sind transparente, nachvollziehbare Bewertungskriterien, regelmäßige menschliche Kontrolle und Anpassungen der KI-Modelle notwendig.
Außerdem sollten Schulen und Entwickler auf vielfältige, repräsentative Daten achten und die KI-Entscheidungen erklärbar machen, um Vertrauen zu fördern.
Ergebnis:
KI-Systeme beim Notengeben können eigene Maßstäbe entwickeln, wenn Trainingsdaten und Algorithmen Verzerrungen enthalten oder nicht pädagogisch abgestimmt sind.
Dies wirkt sich negativ auf Fairness, Motivation und Vertrauen aus.
Eine transparente, kontrollierte und pädagogisch fundierte Gestaltung ist entscheidend, um gerechte und akzeptierte Bewertungen zu gewährleisten.