Lokale Modelle / SLMs

Shownotes

Kleine Sprachmodelle auf eigener Hardware – die nüchterne Bestandsaufnahme.

Ein Small Language Model läuft auf einem Arbeitsplatzrechner, einem kleinen Server oder einer einzelnen Grafikkarte – kein Rechenzentrum nötig. Damit adressiert diese Modellklasse genau die drei Punkte, an denen Cloud-KI im DACH-Mittelstand regelmäßig hängt: Kosten, Datenschutz und Abhängigkeit von einzelnen US-Anbietern.

Themen der Folge:

Was ein SLM ist – und warum „Open-Weight" nicht dasselbe ist wie „Open Source" Grund 1 für die Wende: Offene Modelle liegen nur noch drei bis vier Monate hinter den geschlossenen Spitzenmodellen (Epoch AI) Grund 2: Lizenzen sind geschäftstauglicher geworden – aber nicht einheitlich. Vorsicht bei Google Gemma und Meta Llama Teuken-7B: das europäische Modell aus dem Projekt OpenGPT-X, trainiert in allen 24 EU-Amtssprachen Grund 3: Die Hardware ist da – von 4-GB-Modellen auf dem Notebook bis zum Tischgerät mit 128 GB Unified Memory Die Kostenrechnung ehrlich gerechnet: versteckte Betriebskosten, ein hoch sitzender Break-even und der unfaire Vergleich zwischen kleinem lokalem und großem Cloud-Modell Wofür SLMs reichen: Klassifizieren, Extrahieren, Zusammenfassen, Antwortbausteine, einfache Code-Hilfen Wofür nicht: breites Weltwissen, mehrstufiges Schlussfolgern, höchste Faktentreue ohne Quellenanbindung Warum hybride Setups für den Mittelstand meist die richtige Antwort sind Gartner-Prognose: Bis 2027 werden kleine, aufgabenspezifische Modelle dem Volumen nach dreimal häufiger eingesetzt als allgemeine große Sprachmodelle

Quellen (Auswahl):

Epoch AI: Capabilities Index, Analysen Okt. 2025 und Jan.–Mai 2026 Hugging Face: „State of Open Source on Hugging Face: Spring 2026" Gartner: Pressemitteilung vom 09.04.2025 (Analystenprognose) Fraunhofer IAIS / OpenGPT-X: Modellkarte Teuken-7B · Deutsche Telekom Model Cards für Qwen 3, Gemma 3, Phi-4, Llama 3.2, Mistral (Stand Juni 2026) Kostenrichtgrößen: cogitx.ai / Intuz, SitePoint, Marka Development (2026)

Prompt-Zeit ist ein KI-generierter Podcast: Stimmen, Recherche und Redaktion entstehen mit künstlicher Intelligenz.

Transkript anzeigen

00:00:00:

00:00:14: Bevor es losgeht, ein Hinweis in eigener Sache.

00:00:17: Bei Promptzeit ist die KI nicht nur Thema sondern macht auch die Arbeit!

00:00:21: Stimmen, Recherche und Redaktion dieses Podcasts sind KI-generiert.

00:00:26: In diesem Sinne viel Spaß mit der Folge.

00:00:33: Wer KI im Unternehmen einführen will, denkt zuerst an die großen Namen aus der Cloud.

00:00:39: Doch für einen wachsenden Teil der täglichen Aufgaben ist das überdimensioniert.

00:00:44: Kleine frei verfügbare Sprachmodelle laufen inzwischen auf gewöhnlicher Büro Hardware verlassen das Haus nicht und kosten nach der Anschaffung kaum laufendes Geld.

00:00:54: Für den Mittelstand ist das weniger eine Technik als eine Rechenfrage und der EU-Datenschutz liefert ein zweites, gewichtiges Argument.

00:01:04: Eine nüchterne Bestandsaufnahme stand Juni, zwanzig.

00:01:09: Was ein SLM ist?

00:01:12: Als Small Language Model – SLM bezeichnet man Sprachmodelle mit grob eins bis vierzehn Milliarden Parametern im Gegensatz zu den siebzig Milliarden und mehr der großen Cloudmodelle.

00:01:25: Die Grenze ist unscharf und eher praktisch gemeint.

00:01:29: Ein SLM ist ein Modell, das auf einem einzelnen Arbeitsplatzrechner, einem kleinen Server oder einer einzelnen Grafikarte laufen kann ohne einen Rechenzentrum zu benötigen.

00:01:41: Fast alle je genannten Modelle sind zugleich Open-Wade – die trainierten Gewichte sind frei herunterladbar so dass das Modell vollständig im eigenen Haus betrieben werden kann!

00:01:53: Open-Wade ist nicht gleich bedeutend mit open source im strengen Sinn.

00:01:58: Trainingsdaten und Code werden meist nicht offen gelegt, die Lizenzen unterscheiden sich erheblich.

00:02:05: Der Reiz liegt in der Kombination Klein genug für lokale Hardware gut genug für einen Großteil der Standardaufgaben und rechtlich so gestellt dass die Daten das Unternehmen nicht verlassen.

00:02:18: Damit adressiert die Modellklasse genau die drei Punkte, an denen CloudKI im Dachmittelstand regelmäßig hängt.

00:02:26: Kosten, Datenschutz und Abhängigkeit von einzelnen US-Anbietern.

00:02:33: Warum in den letzten Jahren die Wände kamen?

00:02:37: Bis vor Kurzem war die Antwort auf «Reicht ein lokales Modell fast immer noch nicht».

00:02:43: Das hat sich geändert aus drei Gründen.

00:02:47: Erstens hat Open-Wade aufgeholt Die offenen Modelle hinken den jeweils besten geschlossenen Spitzenmodellen nur noch um wenige Monate hinterher.

00:02:57: Das auf Modell-Benchmarks spezialisierte Forschungshaus EPOG AI bezifferte den Abstand im Capabilities Index, im Oktober twenty-fünfundzwanzig, auf rund drei Monate.

00:03:09: Eine Folgeanalyse für Januar bis Mai zwei tausend sechsund zwanzig kam auf etwa vier Monate.

00:03:16: Für die meisten Geschäftsanwendungen ist ein Vorsprung von einem Quartal bedeutungslos.

00:03:21: Die Frage ist nicht, ob ein Modell das absolut Beste ist sondern, ob es die konkrete Aufgabe zuverlässig löst.

00:03:29: Der Hugging Face Jahresrückblick State of Open Source Spring-Spring-Aufgabe beschreibt die Lücke entsprechend als für Standardaufgaben weitgehend geschlossen.

00:03:41: Bemerkenswert ist die Verschiebung der Herkunft.

00:03:45: Die Modellfamilie Quen aus China löste laut Epoch AI im Herbst, zwei Tausend Fünfundzwanzig Metas Lama als meistgeladene Modell-Familien auf Huggingface ab.

00:03:57: Notiz Open Weight heißt Gewichte frei herunterladbar – nicht zwingend open source.

00:04:05: Trainingsdaten und Lizenzbedingungen bleiben oft eingeschränkt.

00:04:09: Lizenz vor dem Produktiveinsatz prüfen besonders bei Gemma & Lama.

00:04:16: Zweitens sind die Lizenzen geschäftstauglicher geworden, aber nicht einheitlich.

00:04:20: Und hier lohnt das genaue Hinsehen!

00:04:23: Die QUEN-III-Familie und MISTRALS kleinere Modelle stehen unter Apache II.null – also einer echten Freilizenz, die kommerzielle Nutzung ohne Sonderbedingungen erlaubt.

00:04:36: Microsoft's FIIV-Reihe steht unter MIT-Lizenz ebenfalls unproblematisch.

00:04:43: Achtung bei Google Gemma.

00:04:45: Die Gemma-Modelle laufen nicht unter Apache, sondern unter einer eigenen Gema Terms of Use die zwar kommerzielle Nutzung erlaubt aber Nutzungsbeschränkungen enthält.

00:04:57: Das ist juristisch zu prüfen bevor Gemma in ein Produkt einfließt.

00:05:03: Auch Metas Lama Lizenz ist eine Community Lizenz mit Auflagen keine reine Apache Lizenz.

00:05:10: Eine Sonderrolle spielt das europäische Modell Teukensieben B aus dem vom Bund geförderten Projekt Open GPTX.

00:05:19: Es wurde von Grund auf mehrsprachig in allen vierundzwanzig EU-Amtsstrachen trainiert, rund die Hälfte der Trainingsdaten ist nicht Englisch und die kommerzielle Variante steht unter Apache zwei Punkt Null.

00:05:33: Für Häuser die Wertauf europäische Herkunft und solide Mehrsprachigkeit jenseits des englischen Legen ist es einen Testwert.

00:05:42: Bei der Spitzenleistung muss man gegenüber den größeren internationalen Familien Abstriche einkalkulieren.

00:05:50: Drittens ist die Hardware da.

00:05:52: Gamas kleine Varianten, etwa Gemma III in der vier Milliarden Größe belegen rund vier Gigabyte Arbeitsspeicher und laufen damit auf einem gut ausgestatteten Notebook.

00:06:04: VIVIV Mini – drei Komma acht Milliarden Parameter gilt als praktikable Option schon für acht Gigabyte Maschinen.

00:06:13: Wer mehr Durchsatz braucht, findet seit Ende twenty-fünfundzwanzig Tischgeräte wie NVIDIA's DGX Spark GBC & Chip.

00:06:22: Einhundert und zwanzig Gigabyte Unified Memory in der EU rund viertausend achthundert Euro stand Februar.

00:06:30: zwei tausend sechsundzwantig Nvidia Marketplace je nach Partner auch darunter.

00:06:35: Wichtig!

00:06:36: Und in werbetexten meist unterschlagen sind drei Relativierung Versteckte Betriebskosten.

00:06:43: Eigenbetrieb kostet mehr als nur Strom und Hardware.

00:06:47: Branchenanalysenveranschlagen für Monitoring, Updates- und Störungsbehebung – zehn bis zwanzig Stunden Engineering Zeit pro Monat.

00:06:56: Je nach Stundensatz also siebenhundertfünfzig bis dreitausend US-Dollar allein an Personalkosten.

00:07:08: Wer das nicht einrechnet, vergleicht Äpfel mit Birnen.

00:07:13: Der Break-even sitzt hoch!

00:07:16: Gegen die günstigeren API-Modelle lohnt sich Eigenbetrieb erst bei dauerhaft hohem Volumen.

00:07:22: Verschiedene Analysen nennen Schwellen im Bereich mehrerer hundert Millionen Token pro Monat.

00:07:28: Unterhalb davon ist die API oft schlicht billiger.

00:07:33: Kleines lokales Modell – ungleich großes Cloudmodell.

00:07:37: Die zitierten Cloudkosten gelten für die großen Spitzenmodelle.

00:07:42: Ein fairer Vergleich stellt das SLM einem gleich kleinen, günstigen API-Modell gegenüber – dann schrumpft der reine Kostenvorteil!

00:07:52: Der eigentliche Mehrwert des lokalen Betriebs liegt dann weniger im Preis als in Datenhoheit und Unabhängigkeit.

00:08:00: Die belastbare Aussage lautet also bei hohem gleichmäßigem Anfragevolumen Und wenn Datenschutz ohnehin den Eigenbetrieb erzwingt, rechnet sich das lokale SLM klar.

00:08:12: Bei geringem oder schwankendem Bedarf bleibt die API meist günstiger.

00:08:18: Die Grafik unten zeigt die Logik schematisch Wofür SLMs reichen und wofür nicht?

00:08:25: Die nüchterne Faustregel kommt von den Marktforschern.

00:08:28: selbst Gartner prognostiziert dass Organisationen bis Kleine, aufgabenspezifische KI-Modelle dem Volumen nach mindestens dreimal so häufig einsetzen werden wie allgemeine große Sprachmodelle.

00:08:44: Der Grund?

00:08:46: Ein sehr großer Teil der Büroaufgaben braucht keine Siebzig Milliarden Modelle.

00:08:53: Gut geeignet sind SLMs für klarumrissende wiederkehrende Aufgaben.

00:08:58: Klassifizieren und Verschlagworten.

00:09:01: E-mail sortieren, Tickets ruten, Dokumente kategorisieren.

00:09:06: Extrahirn strukturierter Daten aus Texten.

00:09:10: Rechnungen, Formulare, Verträge auslesen.

00:09:14: Zusammenfassen und umformulieren von Texten in vorhersehbaren Rahmen.

00:09:19: Antwortbausteine und Entwürfe im Kundenservice auf interner Wissensbasis – RAG Einfache Code-Hilfen.

00:09:29: Quenn drei in der sieben Milliarden Klasse gilt als stärkstes kleines Modell für Coderzeugung.

00:09:36: Schlecht geeignet sind sie für Aufgaben, die breites Weltwissen langes Schlussfolgern über viele Schritte oder höchste Fakten treue ohne Quellenanbindung verlangen.

00:09:47: Komplexe juristische oder strategische Analysen anspruchsvolle mehrstufige Recherche kreatives Schreiben auf Spitzenniveau.

00:09:56: Hier bleiben die großen Modelle vorn und für solche Fälle ist eine Cloud-API auch wirtschaftlich oft die richtige Wahl.

00:10:05: Der pragmatische Weg für den Mittelstand ist deshalb selten ein Entwederoder, sondern ein hybrides Setup.

00:10:12: Dass lokale SLM für das hohe Volumen an Routineaufgaben mit sensiblen Daten die Cloud API als Reserve für die wenigen Fälle, die wirklich einen Spitzenmodell brauchen.

00:10:26: So!

00:10:26: Das war's mal wieder für heute.

00:10:28: In der nächsten Folge geht es um

00:10:31: Wissensmanagement und RAG.

00:10:35: Wir hoffen, Sie konnten etwas Nützliches aus der Folge ziehen und sie hören uns wieder.

00:10:39: Es verabschieden sich Ela...

00:10:42: ...und Helmut!

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.