Wenn Sie sich durch die anderen Seiten dieses Bereichs lesen, begegnen Ihnen einige Fachbegriffe. Hier stehen sie kurz erklärt, sortiert nach Themenfeld und mit einem Bild aus dem Alltag, damit kein Wort im Weg steht.
Diese Seite erklärt die Begriffe, die Ihnen in den anderen Beiträgen dieses Bereichs begegnen. Sortiert nach Themenfeld, nicht alphabetisch, weil verwandte Begriffe zusammen verständlicher sind.
Fünf Vergleiche, die den Rest tragen
Parameter
Die Angabe 7B oder 24B beschreibt, wie viele Stellschrauben ein Modell hat. Mehr Stellschrauben bedeuten mehr Wissen und feinere Antworten, aber auch mehr Platzbedarf. Vergleichbar mit der Frage, wie viele Werkzeuge in einer Werkstatt stehen. Mehr Werkzeug heißt mehr Möglichkeiten, aber auch eine größere Halle.
Quantisierung
Das Modell wird in gröberer Auflösung gespeichert, ähnlich wie ein Foto mit geringerer Farbtiefe. Es sieht fast gleich aus, braucht aber die Hälfte des Platzes. Bei üblichen Einstellungen ist der Qualitätsverlust für die meisten Aufgaben nicht spürbar.
Kontextfenster
So viel Text kann das Modell auf einmal überblicken. Vergleichbar mit einem Schreibtisch: Was nicht daraufpasst, kann bei der Antwort nicht berücksichtigt werden. Ein Modell mit großem Kontextfenster liest ein vollständiges Lastenheft in einem Durchgang, ein kleines nur einzelne Kapitel.
Dokumentengestützte Antwort
Statt das Modell aus dem Gedächtnis antworten zu lassen, legt man ihm die passenden Seiten aus dem eigenen Archiv vor. Wie ein Sachbearbeiter, der in die Akte schaut, statt zu raten. Das ist der wirksamste Hebel gegen erfundene Antworten.
Determinismus
Ein Taschenrechner liefert bei derselben Eingabe immer dasselbe Ergebnis. Ein Sprachmodell nicht zwingend, weil viele kleine Rechenschritte je nach Auslastung in anderer Reihenfolge ablaufen. Das lässt sich technisch erzwingen, kostet aber Geschwindigkeit.
Modelle und Grundbegriffe
Sprachmodell (LLM)
Ein Programm, das Texte versteht und erzeugt, weil es aus sehr großen Textmengen Muster gelernt hat. Grundlage aller hier beschriebenen Anwendungen.
Open Weight
Die fertig trainierte Datei ist frei herunterladbar, der Trainingsweg ist nicht offengelegt. Sie können das Modell selbst betreiben, aber nicht vollständig nachvollziehen.
Open Source
Strengere Definition, bei der auch Nutzung und Weitergabe uneingeschränkt frei sind. Viele als offen beworbene Modelle erfüllen das nicht.
Token
Die kleinste Texteinheit, die ein Modell verarbeitet. Entspricht grob einer Silbe. Kontextfenster werden in Token angegeben.
Mixture of Experts (MoE)
Das Modell aktiviert je Aufgabe nur einen Teil seiner Bausteine. Spart Rechenzeit, aber nicht Speicher. Eine häufige Fehlkalkulation bei der Hardwareplanung.
Instruct-Modell
Auf das Befolgen von Anweisungen trainiert. Erste Wahl für Zusammenfassungen und Auswertungen vorhandener Dokumente.
Reasoning-Modell
Denkt vor der Antwort in Zwischenschritten. Gut beim Rechnen und Abwägen, schlechter beim reinen Zusammenfassen.
Multimodal
Verarbeitet Text und Bild gemeinsam. Nötig, wenn Fehlerbilder aus der Qualitätssicherung ausgewertet werden sollen.
Finetuning
Nachtrainieren mit eigenen Beispielen. Macht ein Modell auf Ihre Fachsprache passend, verlangt aber Daten und Aufwand.
Betrieb und Hardware
Inferenz
Der laufende Betrieb, also das Beantworten von Anfragen. Der Kostenblock nach der Anschaffung.
VRAM
Der Arbeitsspeicher auf der Grafikkarte. Bestimmt, welche Modellgröße überhaupt lädt.
Unified Memory
Bei Apple gemeinsamer Speicher für Prozessor und Grafikeinheit. Erlaubt große Modelle auf einem einzelnen Gerät.
Speicherbandbreite
Wie schnell Daten aus dem Speicher gelesen werden. Bestimmt die Antwortgeschwindigkeit stärker als die reine Rechenleistung.
Ollama
Einfaches Programm zum Herunterladen und Ausführen von Modellen. Der übliche Einstieg.
vLLM
Server-Software für hohen Durchsatz und viele gleichzeitige Nutzer. Nötig, sobald mehrere Abteilungen zugreifen.
GGUF
Dateiformat für heruntergeladene Modelle. Steht im Dateinamen und zeigt die Quantisierungsstufe.
Docker, Container
Verpackung, die eine Anwendung mitsamt Umgebung isoliert. Standard für den produktiven Betrieb.
WSL2
Linux-Umgebung innerhalb von Windows. Empfohlener Weg, wenn Sie unter Windows produktiv betreiben.
Foundry Local
Microsofts Lösung für lokale Sprachmodelle unter Windows. Naheliegend, wenn ohnehin Windows Server im Einsatz ist.
Hugging Face
Zentrale Plattform, auf der Modelle veröffentlicht werden. Die Bezugsquelle für Originaldateien.
Qualität und Zuverlässigkeit
Halluzination
Das Modell erfindet plausibel klingende, aber falsche Angaben. Das größte Qualitätsrisiko im Betrieb.
Grounding
Das Modell darf nur aus vorgelegten Unterlagen antworten. Die wirksamste Gegenmaßnahme gegen Halluzinationen.
RAG
Verfahren, das passende Dokumentstellen sucht und dem Modell vorlegt. Macht Antworten überprüfbar, weil die Fundstelle mitkommt.
Vektordatenbank
Speicher, der Dokumente nach inhaltlicher Ähnlichkeit findet, nicht nach Stichwort. Findet die richtige Stelle auch bei abweichender Formulierung.
Embedding
Umwandlung von Text in Zahlen, damit Ähnlichkeit berechenbar wird. Technische Grundlage der Dokumentensuche.
Temperatur
Regler für die Zufälligkeit der Antwort. Niedrig für Fakten, höher für Textentwürfe.
Seed
Startwert für den Zufall. Hilft bei Wiederholbarkeit, garantiert sie aber nicht.
Benchmark
Standardisierter Vergleichstest. Nützlich zur Vorauswahl, ersetzt keinen Test mit eigenen Daten.
Recht und Sicherheit
Apache 2.0
Freizügige Lizenz, die nur Namensnennung und die Offenlegung von Änderungen verlangt. Der unkomplizierteste Fall, auch bei Weitergabe an Kunden.
Community-Lizenz
Herstellereigene Lizenz mit zusätzlichen Bedingungen. Kann nachträglich geändert werden, das ist das eigentliche Risiko.
DSGVO
Europäisches Datenschutzrecht. Beim lokalen Betrieb technisch weitgehend entschärft, weil kein Auftragsverarbeiter entsteht.
EU AI Act
Europäisches KI-Recht. Gilt unabhängig von der Lizenz und verlangt je nach Risikoklasse unterschiedliche Dokumentation.
Risikoklasse
Einstufung einer Anwendung nach dem EU AI Act in verboten, hoch, begrenzt oder minimal. Entscheidet über den Dokumentationsaufwand.
NIS2
EU-Regelwerk zur Cybersicherheit, in Deutschland seit Dezember 2025 geltendes Recht. Betrifft unter anderem den Maschinenbau ab bestimmter Betriebsgröße.
Prompt Injection
Versteckte Anweisung in einem Dokument, die das Modell übernimmt. Relevant, sobald Sie fremde Dokumente automatisch auswerten.
Membership Inference
Rückschluss darauf, ob ein bestimmtes Dokument im System steckt. Vertraulichkeitsrisiko bei sensiblen Beständen.
Zero Trust
Grundsatz, keinem Zugriff ohne Prüfung zu vertrauen. Vom BSI und der französischen ANSSI ausdrücklich für Sprachmodelle empfohlen.
Least Privilege
Jeder bekommt nur die Rechte, die er braucht. Muss in der Datenschicht umgesetzt werden, nicht im Modell.
Netzsegmentierung
Trennung des Netzes in abgeschottete Bereiche. Verhindert, dass das KI-System zur Brücke zwischen Büro und Fertigung wird.
