KI im Mittelstand

KI-Begriffe, einfach erklärt

Von Halluzination bis Quantisierung, die Begriffe rund um lokale KI, erklärt für Entscheider in Fertigungsbetrieben.

Abstraktes Wissensnetz in Navy und Cyan aus verbundenen Begriffs-Knoten

Wenn Sie sich durch die anderen Seiten dieses Bereichs lesen, begegnen Ihnen einige Fachbegriffe. Hier stehen sie kurz erklärt, sortiert nach Themenfeld und mit einem Bild aus dem Alltag, damit kein Wort im Weg steht.

Diese Seite erklärt die Begriffe, die Ihnen in den anderen Beiträgen dieses Bereichs begegnen. Sortiert nach Themenfeld, nicht alphabetisch, weil verwandte Begriffe zusammen verständlicher sind.

Fünf Vergleiche, die den Rest tragen

Parameter

Die Angabe 7B oder 24B beschreibt, wie viele Stellschrauben ein Modell hat. Mehr Stellschrauben bedeuten mehr Wissen und feinere Antworten, aber auch mehr Platzbedarf. Vergleichbar mit der Frage, wie viele Werkzeuge in einer Werkstatt stehen. Mehr Werkzeug heißt mehr Möglichkeiten, aber auch eine größere Halle.

Quantisierung

Das Modell wird in gröberer Auflösung gespeichert, ähnlich wie ein Foto mit geringerer Farbtiefe. Es sieht fast gleich aus, braucht aber die Hälfte des Platzes. Bei üblichen Einstellungen ist der Qualitätsverlust für die meisten Aufgaben nicht spürbar.

Kontextfenster

So viel Text kann das Modell auf einmal überblicken. Vergleichbar mit einem Schreibtisch: Was nicht daraufpasst, kann bei der Antwort nicht berücksichtigt werden. Ein Modell mit großem Kontextfenster liest ein vollständiges Lastenheft in einem Durchgang, ein kleines nur einzelne Kapitel.

Dokumentengestützte Antwort

Statt das Modell aus dem Gedächtnis antworten zu lassen, legt man ihm die passenden Seiten aus dem eigenen Archiv vor. Wie ein Sachbearbeiter, der in die Akte schaut, statt zu raten. Das ist der wirksamste Hebel gegen erfundene Antworten.

Determinismus

Ein Taschenrechner liefert bei derselben Eingabe immer dasselbe Ergebnis. Ein Sprachmodell nicht zwingend, weil viele kleine Rechenschritte je nach Auslastung in anderer Reihenfolge ablaufen. Das lässt sich technisch erzwingen, kostet aber Geschwindigkeit.

Modelle und Grundbegriffe

Sprachmodell (LLM)

Ein Programm, das Texte versteht und erzeugt, weil es aus sehr großen Textmengen Muster gelernt hat. Grundlage aller hier beschriebenen Anwendungen.

Open Weight

Die fertig trainierte Datei ist frei herunterladbar, der Trainingsweg ist nicht offengelegt. Sie können das Modell selbst betreiben, aber nicht vollständig nachvollziehen.

Open Source

Strengere Definition, bei der auch Nutzung und Weitergabe uneingeschränkt frei sind. Viele als offen beworbene Modelle erfüllen das nicht.

Token

Die kleinste Texteinheit, die ein Modell verarbeitet. Entspricht grob einer Silbe. Kontextfenster werden in Token angegeben.

Mixture of Experts (MoE)

Das Modell aktiviert je Aufgabe nur einen Teil seiner Bausteine. Spart Rechenzeit, aber nicht Speicher. Eine häufige Fehlkalkulation bei der Hardwareplanung.

Instruct-Modell

Auf das Befolgen von Anweisungen trainiert. Erste Wahl für Zusammenfassungen und Auswertungen vorhandener Dokumente.

Reasoning-Modell

Denkt vor der Antwort in Zwischenschritten. Gut beim Rechnen und Abwägen, schlechter beim reinen Zusammenfassen.

Multimodal

Verarbeitet Text und Bild gemeinsam. Nötig, wenn Fehlerbilder aus der Qualitätssicherung ausgewertet werden sollen.

Finetuning

Nachtrainieren mit eigenen Beispielen. Macht ein Modell auf Ihre Fachsprache passend, verlangt aber Daten und Aufwand.

Betrieb und Hardware

Inferenz

Der laufende Betrieb, also das Beantworten von Anfragen. Der Kostenblock nach der Anschaffung.

VRAM

Der Arbeitsspeicher auf der Grafikkarte. Bestimmt, welche Modellgröße überhaupt lädt.

Unified Memory

Bei Apple gemeinsamer Speicher für Prozessor und Grafikeinheit. Erlaubt große Modelle auf einem einzelnen Gerät.

Speicherbandbreite

Wie schnell Daten aus dem Speicher gelesen werden. Bestimmt die Antwortgeschwindigkeit stärker als die reine Rechenleistung.

Ollama

Einfaches Programm zum Herunterladen und Ausführen von Modellen. Der übliche Einstieg.

vLLM

Server-Software für hohen Durchsatz und viele gleichzeitige Nutzer. Nötig, sobald mehrere Abteilungen zugreifen.

GGUF

Dateiformat für heruntergeladene Modelle. Steht im Dateinamen und zeigt die Quantisierungsstufe.

Docker, Container

Verpackung, die eine Anwendung mitsamt Umgebung isoliert. Standard für den produktiven Betrieb.

WSL2

Linux-Umgebung innerhalb von Windows. Empfohlener Weg, wenn Sie unter Windows produktiv betreiben.

Foundry Local

Microsofts Lösung für lokale Sprachmodelle unter Windows. Naheliegend, wenn ohnehin Windows Server im Einsatz ist.

Hugging Face

Zentrale Plattform, auf der Modelle veröffentlicht werden. Die Bezugsquelle für Originaldateien.

Qualität und Zuverlässigkeit

Halluzination

Das Modell erfindet plausibel klingende, aber falsche Angaben. Das größte Qualitätsrisiko im Betrieb.

Grounding

Das Modell darf nur aus vorgelegten Unterlagen antworten. Die wirksamste Gegenmaßnahme gegen Halluzinationen.

RAG

Verfahren, das passende Dokumentstellen sucht und dem Modell vorlegt. Macht Antworten überprüfbar, weil die Fundstelle mitkommt.

Vektordatenbank

Speicher, der Dokumente nach inhaltlicher Ähnlichkeit findet, nicht nach Stichwort. Findet die richtige Stelle auch bei abweichender Formulierung.

Embedding

Umwandlung von Text in Zahlen, damit Ähnlichkeit berechenbar wird. Technische Grundlage der Dokumentensuche.

Temperatur

Regler für die Zufälligkeit der Antwort. Niedrig für Fakten, höher für Textentwürfe.

Seed

Startwert für den Zufall. Hilft bei Wiederholbarkeit, garantiert sie aber nicht.

Benchmark

Standardisierter Vergleichstest. Nützlich zur Vorauswahl, ersetzt keinen Test mit eigenen Daten.

Recht und Sicherheit

Apache 2.0

Freizügige Lizenz, die nur Namensnennung und die Offenlegung von Änderungen verlangt. Der unkomplizierteste Fall, auch bei Weitergabe an Kunden.

Community-Lizenz

Herstellereigene Lizenz mit zusätzlichen Bedingungen. Kann nachträglich geändert werden, das ist das eigentliche Risiko.

DSGVO

Europäisches Datenschutzrecht. Beim lokalen Betrieb technisch weitgehend entschärft, weil kein Auftragsverarbeiter entsteht.

EU AI Act

Europäisches KI-Recht. Gilt unabhängig von der Lizenz und verlangt je nach Risikoklasse unterschiedliche Dokumentation.

Risikoklasse

Einstufung einer Anwendung nach dem EU AI Act in verboten, hoch, begrenzt oder minimal. Entscheidet über den Dokumentationsaufwand.

NIS2

EU-Regelwerk zur Cybersicherheit, in Deutschland seit Dezember 2025 geltendes Recht. Betrifft unter anderem den Maschinenbau ab bestimmter Betriebsgröße.

Prompt Injection

Versteckte Anweisung in einem Dokument, die das Modell übernimmt. Relevant, sobald Sie fremde Dokumente automatisch auswerten.

Membership Inference

Rückschluss darauf, ob ein bestimmtes Dokument im System steckt. Vertraulichkeitsrisiko bei sensiblen Beständen.

Zero Trust

Grundsatz, keinem Zugriff ohne Prüfung zu vertrauen. Vom BSI und der französischen ANSSI ausdrücklich für Sprachmodelle empfohlen.

Least Privilege

Jeder bekommt nur die Rechte, die er braucht. Muss in der Datenschicht umgesetzt werden, nicht im Modell.

Netzsegmentierung

Trennung des Netzes in abgeschottete Bereiche. Verhindert, dass das KI-System zur Brücke zwischen Büro und Fertigung wird.

Nächster Schritt

Wo bei Ihnen der Hebel liegt

Ein kostenfreies Erstgespräch von etwa einer Stunde. Wir klären, ob es bei Ihnen einen Hebel gibt und wie ein erster Schritt aussieht, der ins laufende Budget passt. Sie legen sich auf nichts weiter fest.