METHODIK

So funktioniert Fluentry

Diese Seite ist der öffentliche Beleg für jede Aussage, die Fluentry über sich selbst trifft: was wir messen, wie unsere Testaufgaben entstehen, wie wir bewerten, was ein Grade bedeutet und wo die KI-Verordnung der EU (EU AI Act) ins Spiel kommt. Sie richtet sich an Journalistinnen und Journalisten, an Prüferinnen und Prüfer in der Beschaffung sowie an neugierige Testteilnehmende, die hinter die Kulissen schauen möchten.

Was wir messen (und was nicht)

Fluentry misst KI-Kompetenz: Ihre Fähigkeit, KI-Ausgaben zu erkennen, ihre Qualität zu beurteilen und abzuwägen, wann und wie der Einsatz von KI angemessen ist. Konkret: Können Sie KI-generierte Inhalte erkennen, verstehen Sie die Funktionsweise von KI gut genug, um Nachrichten kritisch zu lesen, und können Sie ethische Situationen rund um KI durchdenken?

Was Fluentry nicht misst

  • Ihre Fähigkeit, KI zu entwickeln. Wir sind kein Programmiertest und keine Zertifizierung im Bereich ML-Engineering.
  • Ihre Fähigkeit, ein bestimmtes KI-Werkzeug zu bedienen. Wir bescheinigen keine Routine im Umgang mit ChatGPT, Claude, Copilot oder einem anderen Produkt. Werkzeuge ändern sich jedes Quartal; Kompetenz bleibt.
  • Ihre Fähigkeit, eine menschliche Aufgabe durch KI zu ersetzen. Wir bewerten keine Automatisierungsfertigkeiten.
  • Ihre Intelligenz, Ihre Beschäftigungsfähigkeit oder Ihr künftiges Verdienstpotenzial. KI-Kompetenz ist eine Fähigkeit unter vielen.

Wenn Sie eine Einschätzung zu einem der genannten Punkte benötigen, ist Fluentry nicht das richtige Werkzeug. Das sagen wir Ihnen lieber, als den Test zu überverkaufen.

Wie Aufgaben entstehen

Jede Fluentry-Testaufgabe wird gemeinsam verfasst. Eine namentlich benannte Lehrkraft gibt die Aufgabe in Auftrag. Wo es Qualität und Tempo zugutekommt, entwerfen KI-Werkzeuge Material. Zwei Menschen prüfen jede Aufgabe, bevor sie ausgeliefert wird. Wo die Antwort von Urteilsvermögen abhängt, bei unseren Ethik-Szenarien, legt ein Gremium aus ausgewiesenen Fachleuten die bewerteten Werte fest. KI legt niemals einen bewerteten Wert fest.

Wir legen die Rolle der KI auf Ebene des Aufgabentyps offen. Wir verbergen sie nicht, und wir übertreiben sie nicht. Die Pipeline liegt in unserem Inhaltsverzeichnis (Content-Repository), das für die Beschaffungsprüfung unter einer Vertraulichkeitsvereinbarung (NDA) verfügbar ist.

Was KI tut, nach Test

Can AI Fool You? Die menschliche Seite wird von einer namentlich benannten beitragenden Person verfasst, ohne dass beim Entwurf oder bei der Bearbeitung ein KI-Werkzeug zum Einsatz kommt. Die KI-Seite entsteht über eine Rotation von fünf oder mehr Spitzenmodellen. Beide Seiten werden von einer zweiten, namentlich benannten Person geprüft, bevor sie zusammengeführt werden.

AI Knowledge: Der Aufgabenstamm und die Auswahl des Konzepts werden von internen Autorinnen und Autoren oder von beauftragten Fachexpertinnen und Fachexperten verfasst. KI darf die falschen Antwortoptionen, Konzept-Tags und Erläuterungen vorschlagen; die menschliche Autorin oder der menschliche Autor wählt aus, bearbeitet und gibt frei. KI verfasst niemals den Aufgabenstamm und wählt niemals die richtige Antwort.

AI Ethics: Aufgabenstämme und Formulierungen der Optionen werden von Menschen geschrieben. KI darf Varianten vorschlagen, doch die endgültige Fassung schreibt stets die menschliche Autorin oder der menschliche Autor. Den bewerteten Wert jeder Option legt ein Expertengremium aus mindestens zwei Fachleuten fest. KI legt niemals einen bewerteten Wert fest.

Was KI niemals tut

  • KI legt niemals einen bewerteten Wert für eine Szenario-Aufgabe fest.
  • KI wählt niemals die richtige Antwort einer Knowledge-Aufgabe.
  • KI verfasst niemals eine menschliche Seite in einem Paar-Test.
  • KI prüft eine Aufgabe niemals und gibt sie niemals frei. Beide Prüfungen erfolgen durch Menschen.
  • KI wird nicht eingesetzt, um Bilder realer oder benannter Personen zu erzeugen oder den Stil einer bestimmten fotografierenden Person nachzuahmen.
  • KI wird nicht eingesetzt, um Fotografien von Fluentry-Autorinnen und -Autoren, Prüfenden, Kundinnen und Kunden oder dem Team zu erzeugen.

Woher die menschlichen Fotografien stammen

Die menschliche Seite unserer Bildpaare besteht aus echten Fotografien aktiver Fotografinnen und Fotografen. Dazu gehören Bilder von Martin Vorel, veröffentlicht über sein freies Fotografieprojekt LibreShot. Wir nennen die Fotografinnen und Fotografen hier und nicht auf der Testoberfläche, da eine Quellenangabe direkt neben einem laufenden Bildpaar einen Hinweis auf die Antwort geben würde.

Wie wir jeden Test bewerten

Ihr Ergebnis ist der Prozentsatz der Aufgaben, die Sie richtig beantwortet haben, mit etwas mehr Anrechnung für schwierigere Aufgaben und etwas weniger für leichtere, auf einer Skala von 0 bis 100.

Bei unserem Ethik-Test verschiebt sich die Logik: Ihr Ethik-Ergebnis ist der Durchschnittswert der von Ihnen gewählten Optionen, auf einer Skala von 0 bis 100. Höher bewertete Optionen spiegeln die stärkeren ethischen Positionen wider, die unser Expertengremium eingeordnet hat.

Bei den meisten Szenario-Aufgaben gibt es keine einzelne richtige Antwort. Die Wertskala spiegelt das fachliche Urteil des Gremiums wider, nicht eine objektive Wahrheit. Wer im Gremium sitzt, erläutern wir weiter unten auf dieser Seite.

Was ein Grade bedeutet

Fluentry verwendet eine Grade-Skala nach dem Vorbild der Grades von Musikprüfungen: Grade 1 bis Grade 8, mit einer Diploma-Stufe oberhalb von Grade 8.

Ihr Grade wird aus den Ergebnissen berechnet, die Sie je Test erzielt haben. Wir verwenden Ihr jeweils jüngstes Ergebnis pro Test (nicht Ihr bestes), gewichtet zugunsten der jüngeren Leistung, damit ein vor einem Jahr erreichter Grade den Test der vergangenen Woche nicht überstrahlt.

Die Grade-Schwellen sind an Tausenden von Fluentry-Sitzungen verankert. Sie verschieben sich nicht. Grade 5 bedeutet 2027 dieselbe Kompetenz wie Grade 5 im Jahr 2026, dieselbe Eigenschaft, die das Zeugnis eines Grade-5-Geigers über Jahrzehnte hinweg aussagekräftig macht.

Was hinter jedem Grade steht

GradeSteht fürWas er bedeutet
DiplomaTop 2 %Die Spitzenstufe. Herausragende Leistung über die gesamte Aufgabenbank.
Grade 8Top 6 %Ausgezeichnet.
Grade 7Top 15 %Stark, mit Reichweite.
Grade 6Top 25 %Stark.
Grade 5Top 40 %Solide.
Grade 4Top 55 %Kompetent.
Grade 3Top 70 %In Entwicklung.
Grade 2Top 85 %Grundlegend.
Grade 1Unter Grade 2Anfänger. Die erste Stufe.

Dies sind die Perzentilbänder zum Zeitpunkt der Kalibrierungsmomentaufnahme beim Start. Sie werden anschließend in feste Ergebnis-Grenzwerte umgerechnet und eingefroren; sie verschieben sich nicht, wenn neue Teilnehmende hinzukommen. Ein 2027 erreichter Grade spiegelt dieselbe Kompetenz wider wie einer aus dem Jahr 2026.

Warum verankert und nicht rollierend

Rollierende Schwellen, bei denen sich der Grenzwert für Grade 5 jeden Monat mit neuen Teilnehmenden verschiebt, führen je nach Bewegungsrichtung der Population zu Noteninflation oder Notendeflation. Verankerte Schwellen ergeben eine stabile Qualifikation. Wir haben uns für die Qualifikation entschieden. Wenn wir unsere Methodik wesentlich ändern, etwa durch das Hinzufügen eines neuen Testtyps, der die Aggregation der Grades beeinflusst, verankern wir ausdrücklich neu und benachrichtigen jede Nutzerin und jeden Nutzer, deren oder dessen Grade sich ändert. Dies ist dieselbe Disziplin, die Prüfungsausschüsse für Musik seit Jahrzehnten anwenden.

Die Diploma-Stufe

Diploma sind die obersten 2 % aller Fluentry-Grades. Es ist kein Grade 9; es ist eine eigene Stufe mit einer eigenen Behandlung als Qualifikation. Wir haben 2 % gewählt, weil dieser Anteil selten genug ist, um bedeutsam zu wirken, und nicht so selten, dass er in einem beliebigen Startjahr verschwindet.

Ausblick: Wenn unsere Academy erscheint, kann sich die Diploma-Stufe so weiterentwickeln, dass zusätzlich zur Ergebnisschwelle der Abschluss eines Kurses erforderlich ist. Wir kündigen diese Änderung im Voraus an und aktualisieren diese Seite an dem Tag, an dem sie erscheint.

Wenn ein neuer Test erscheint

Wer nur einen Fluentry-Test absolviert hat, erhält einen Grade auf Grundlage dieses Tests. Wenn ein neuer Test erscheint, ändert sich der Grade nicht über Nacht; das Erreichte bleibt erhalten. Man steigt auf (oder hält die Position oder rutscht ab), indem man weitere Tests absolviert. Wir erzwingen niemals eine Wiederholung.

Wie wir Sie vergleichen

Ihr Ergebnis mit anderen Teilnehmenden in Ihrem Land zu vergleichen, funktioniert erst, wenn genügend von ihnen den Test absolviert haben. Wenn Ihr Land noch klein ist, sagen wir Ihnen das. Ihre Teilen-Karte zeigt stets ein Perzentil, wir lassen Sie nie ohne eine Zahl zurück, doch die Quelle, aus der wir es abgeleitet haben, legen wir offen: Ihr Land, das weitere europäische Feld oder (während sich die weltweiten Zahlen noch aufbauen) das globale Feld.

Das von Ihnen erzeugte Teilen-Bild wird im Moment des Teilens festgehalten. Wenn Ihr Land im nächsten Monat mehr Teilnehmende gewinnt und sich Ihr lokales Perzentil leicht verschiebt, ändert sich das auf LinkedIn gepostete Bild nicht rückwirkend.

Mit wem Sie verglichen werden

WannQuelleWas Sie sehen
Ihr Land hat genügend TeilnehmendeIhr LandBesser als X % der Teilnehmenden in {country}
Ihr Land ist noch klein, aber Europa ist großEuropäisches FeldBesser als X % der europäischen Teilnehmenden
Beide sind noch kleinEuropäisches Feld (gebändert)Top X % der europäischen Teilnehmenden bisher
Die weltweiten Zahlen bauen sich noch aufGlobal (gebändert)Sie gehören zu den Ersten, die diesen Test machen; der Vergleich bildet sich noch

Ein ehrlicher Vorbehalt

Wenn wir europäische Ergebnisse über Länder hinweg zusammenfassen, ist das Ergebnis eine Näherung. Die Aufgabenbanken unterscheiden sich: Französische Paar-Test-Aufgaben sind keine Übersetzungen der englischen; sie werden eigenständig nach einer gemeinsamen Schwierigkeitsvorgabe verfasst. Die kombinierte europäische Zahl ist daher eine Aggregation von vergleichbar schwierigen, aber nicht identischen Tests. Sobald die eigenen Zahlen eines Landes über die ersten paar hundert Teilnehmenden hinaus wachsen, wechseln wir zurück zum eigenen Feld Ihres Landes, das der sauberste Vergleich ist.

Aufgabengesundheit

Fluentry-Aufgaben werden fortlaufend an den Menschen evaluiert, die sie bearbeiten. Jede Woche wird jede aktive Aufgabe nach Trefferquote und Beteiligung bewertet. Aufgaben, die zu leicht oder zu schwer werden oder einen plötzlichen Anstieg der Trefferquote zeigen (ein Hinweis darauf, dass die Antwort durchgesickert ist), werden markiert. Aufgaben, die durchgängig nicht trennscharf sind, scheiden aus der aktiven Bank aus.

Aggregierte Kennzahlen zur Aufgabengesundheit der aktiven Bank sind für die Beschaffungsprüfung unter einer Vertraulichkeitsvereinbarung (NDA) verfügbar.

Wenn eine Aufgabe nicht mehr funktioniert, etwa weil sie durch Fortschritte der KI zu leicht wird, in einem öffentlichen Forum auftaucht oder schlicht nichts Nützliches mehr offenbart, scheidet sie aus. Wir ersetzen sie. Die aktive Aufgabenbank erneuert sich fortlaufend. Wir protokollieren jedes Ausscheiden und berichten aggregierte Zahlen unter einer Vertraulichkeitsvereinbarung (NDA) für die Beschaffungsprüfung.

Wir aggregieren diese Daten je Test und je Testtyp, niemals je Aufgabe (die Identität einer Aufgabe ist geistiges Eigentum, das wir nicht offenlegen).

Wer die Aufgabenbank aufbaut

Die Aufgabenbank von Fluentry wird von einem Team aufgebaut, das hauseigenes Schreiben, beauftragte Fachexpertise und ein Netzwerk aus Lehrenden, Ethikerinnen und Ethikern sowie politischen Praktikerinnen und Praktikern vereint. Jede Aufgabe wird von einer zweiten Person geprüft, bevor sie ausgeliefert wird. Bei Ethik-Szenarien werden die bewerteten Werte von einem Expertengremium aus mindestens zwei Fachleuten festgelegt.

Wir veröffentlichen keine Einzelnamen auf der öffentlichen Seite, die meisten Beitragenden werden je Aufgabe beauftragt, und das entspricht ihrer üblichen Präferenz. Wir legen jedoch den Standard offen, nach dem wir einstellen. Für die Beschaffungsprüfung stellen wir die vollständige Autoren- und Prüferliste unter einer Vertraulichkeitsvereinbarung (NDA) bereit.

Der Standard, nach dem wir einstellen

  • Autorinnen und Autoren: hauseigene Schreibende mit fundiertem Fachwissen oder beauftragte Fachleute mit veröffentlichter oder praktischer Erfahrung im Testbereich. Die menschlichen Seiten der Paar-Tests werden von Muttersprachlerinnen und Muttersprachlern der jeweiligen Testsprache geschrieben.
  • Prüfende: eine zweite Person, unabhängig von der Autorin oder dem Autor, Muttersprachlerin oder Muttersprachler der Testsprache, mit ausreichendem Fachwissen, um Richtigkeit und Passung zu beurteilen.
  • Expertengremium (Ethik): mindestens zwei Mitwirkende je Aufgabe mit praktischer oder veröffentlichter Erfahrung in KI-Ethik, KI-Politik, Philosophie oder angrenzenden Feldern. Der Median des Gremiums legt den bewerteten Wert fest.

Wir nennen in v1 öffentlich keine Einzelpersonen, weil die meisten Beitragenden dies bevorzugen, weil Prüferinnen und Prüfer in der Beschaffung mehr Nutzen daraus ziehen, die Liste unter einer Vertraulichkeitsvereinbarung (NDA) zu verifizieren, und weil wir keine personenbezogenen Daten veröffentlichen, die wir nicht benötigen.

Änderungsprotokoll

Wenn sich die Art ändert, wie Fluentry misst, halten wir das hier fest. Drei Arten von Änderungen werden protokolliert. Aufgabenänderungen: Aufgaben scheiden fortlaufend aus, während sich die Bank weiterentwickelt; wir protokollieren die vierteljährlichen Sammelaktualisierungen, nicht jedes einzelne Ausscheiden. Methodikänderungen: Wenn wir einen neuen Testtyp hinzufügen, die Aggregation der Grades ändern oder die Perzentilschwellen überarbeiten, erhält diese Seite einen versionierten Eintrag, und alle, deren Grade betroffen ist, erhalten eine E-Mail, bevor die Änderung wirksam wird. Seitenänderungen: Wenn diese Seite selbst wesentlich überarbeitet wird, hält der Eintrag unten fest, was sich wann geändert hat.

DatumUmfangZusammenfassung
3. Juni 2026SeiteRedaktionelle Überarbeitungen zur besseren Verständlichkeit in mehreren Abschnitten. Keine Änderung an Methodik, Bewertung oder Grade-Schwellen.
v1-StartSeiteMethodik-Seite erstmals veröffentlicht mit drei Live-Tests (Can AI Fool You?, AI Knowledge, AI Ethics) in en-GB.

Position zur KI-Verordnung der EU

Die KI-Verordnung der EU (EU AI Act) ist im Februar 2025 in Kraft getreten. Zwei Teile davon sind für Fluentry unmittelbar relevant.

Artikel 4, die Verpflichtung zur KI-Kompetenz. Organisationen, die KI-Systeme einsetzen, müssen sicherstellen, dass ihr Personal über ausreichende KI-Kompetenz verfügt. Fluentry besteht zum Teil dazu, diese Verpflichtung messbar zu machen. Unser B2B-Angebot dokumentiert die organisatorische KI-Kompetenz in einer Form, die für Beschaffung und Audit geeignet ist.

Einstufung als Hochrisiko (Anhang III). Die Verordnung führt Kategorien von KI-Systemen auf, die als Hochrisiko gelten und schärfere Compliance-Pflichten auslösen. Fluentry ist kein Hochrisiko-System nach Anhang III. Wir sind eine Bewertung der KI-Kompetenz, die von Einzelpersonen an sich selbst und von Organisationen an ihrem eigenen Personal zu Compliance-Zwecken genutzt wird. Wir werden nicht für Einstellungsentscheidungen, Kreditbewertung, biometrische Identifizierung, Notenvergabe im regulierten schulischen oder universitären Sinn oder eine andere Kategorie des Anhangs III verwendet.

Zur Klarstellung: Ein Fluentry-Grade ist kein reguliertes Bildungszeugnis. Es ist eine Qualifikation, die wir nach unserer eigenen Methodik vergeben, dem Vorbild der Grades von Musikprüfungen nachempfunden, aber nicht Teil eines nationalen Bildungssystems, einer Prüfungsstelle oder eines akkreditierten Qualifikationsrahmens. Sie gehört in dieselbe begriffliche Kategorie wie eine Lernserie in einer Sprach-App oder ein Abzeichen für Tippgeschwindigkeit: ein echtes Signal für eine echte Fähigkeit, ausgestellt von der Plattform, die es misst, kein staatlich anerkannter akademischer Abschluss.

Wenn eine B2B-Kundin oder ein B2B-Kunde Fluentry auf eine Weise nutzt, die Pflichten nach Anhang III auslöst, etwa indem unsere Bewertung als verbindliches Kriterium in einer Einstellungsentscheidung behandelt wird, liegt diese Nutzung nach der Verordnung in der Verantwortung der Kundin oder des Kunden, nicht bei Fluentry. Unsere Standard-B2B-Verträge weisen diese Pflichten über den Auftragsverarbeitungsvertrag (AVV) zu.

Ein internes Compliance-Memo mit der vollständigen Analyse zu Anhang III steht Beschaffungsteams unter einer Vertraulichkeitsvereinbarung (NDA) zur Verfügung.

ACADEMY METHODOLOGY

How the Academy works

The Academy teaches to the gaps our tests measure, against recognised public frameworks, with every course expert-reviewed and dated. This page explains how it is built and why you can trust it.

What AI literacy means here

We use one model across the Tests and the Academy, so what you are measured on is what you are taught.

AI literacy is more than knowing what a model is. We assess and teach across four pillars: Knowledge (what AI is and how it works), Use (getting useful, safe results from it), Critical (judging output, spotting failure and bias) and Ethics (the responsible and lawful choices around its use).

The Academy is the remediation layer on top of the Tests. The test shows where you are weak, the Academy teaches to that gap and a re-take proves the gain on the same scale.

The frameworks we build against

Every course and role path maps to recognised public frameworks. This is the procurement-grade answer to the question a buyer or regulator asks first: what standard is this against. The frameworks are public, so the mapping is free credibility rather than a private claim.

How our learning maps to recognised AI literacy frameworks.
Our coverageMapped frameworks
All-staff foundationsEU Commission Article 4 guidance; DigComp 3.0 (AI dimension); UNESCO AI competency frameworks
Use and promptingDigComp 3.0; EC-OECD AILit framework
Critical evaluation and riskEC-OECD AILit framework; UNESCO AI competency frameworks
Ethics, oversight and the lawEU Commission Article 4 guidance; UNESCO Recommendation on the Ethics of AI
Manager and oversight role pathEU Commission Article 4 guidance; EC-OECD AILit framework

Frameworks evolve. We review the mapping each quarter and date the page so you can see when it was last checked.

How a course is made

Courses are drafted with AI from real data on what learners get wrong, then a named expert reviews and signs off, then the course is translated and checked, then it is reviewed and dated every quarter. We disclose AI co-authoring openly, the same stance we take on the Tests, because transparency is a trust asset with EU buyers rather than a liability.

  • AI drafts from the gap data: the item-level signal of what people actually get wrong.
  • A named subject expert reviews, corrects and signs off before anything goes live.
  • Translation and a native-language check across our launch locales.
  • A dated quarterly review, with a per-course changelog.

How we measure learning

Every module ends in an assessment built on the same engine as the Tests. We record competence, not just completion, which is the evidence advantage over tick-box training. Completing a course is not the credential; demonstrating the competence is.

Learning feeds the credential. After working a path you re-take the relevant test, your score recomputes your overall Grade and the Grade is the thing that climbs. The credential stays earned, not farmed.

Our EU AI Act position

The Academy is a training product. Its AI features (the practice sandbox and the explain-why tutor) are educational tools, not consequential automated decisions about a person. Our preliminary assessment is that the Academy is not a high-risk AI system, and AI use is clearly disclosed throughout.

This is our preliminary position. The definitive statement publishes here once external counsel has confirmed it.

The evidence and the credential

For an organisation, the Academy produces an EU AI Act Article 4 evidence record: a dated, per-person, per-course log of training and competence, with the leaver records retained, that you can show a regulator. It records competence, not just attendance.

The credential itself is the Grade, not a wallet of course badges. It is one living credential that you come back to improve and that gently decays if you stop, so it reflects current competence. That is the difference between measured fluency and a certificate of attendance.

LAST REVIEWED 6. Juni 2026

AKTUALISIERT 9. Juli 2026

Fragen zu unserer Methodik? Schreiben Sie an methodology@fluentry.be. Für die Beschaffungsprüfung stellen wir die vollständige Autoren- und Prüferliste, den Provenienznachweis je Aufgabe sowie unser internes Memo zur KI-Verordnung der EU unter einer Vertraulichkeitsvereinbarung (NDA) bereit.