Mistral AI hat mit Shieldstral ein Sicherheitsmodell vorgestellt, das die Moderation von KI-generierten Inhalten vereinfachen soll. Statt auf feste Kategorien setzt das Modell auf einen flexiblen Frage-Antwort-Ansatz: Betreiber formulieren ihre Moderationsrichtlinien als natürlichsprachliche Ja/Nein-Fragen wie zum Beispiel: „Ruft dieser Inhalt zu echter Gewalt auf?“. Shieldstral liefert anschließend einen Safety-Score zurück, auf dessen Grundlage der Prompt oder die KI-Antwort freigegeben werden kann oder nicht.
Dieses Vorgehen soll laut Mistral zwei Vorteile haben. Zum einen lassen sich die Fragen, die an den Inhalt gestellt werden sollen, von den Betreibern von Shieldstral leicht anpassen und jederzeit verändern. Zum anderen kann so der Kontext eines Inhalts besser mit bewertet werden. Zum Beispiel: Was im Rahmen eines Referats über Konzentrationslager für den Schulunterricht vielleicht notwendige Originalzitate aus zeitgenössischen Reden sind, wäre als Inhalt für einen privaten Blogpost höchst kritisch.
Bisherige Guardrail-Modelle mit festgelegten Taxonomien können solche Kontextunterschiede laut den Autoren des zugehörigen Papers nur unzureichend abbilden, weil die Zulässigkeit eines Inhalts häufig fest an Kategorien geknüpft ist.







