Lokale Modelle / SLMs
Shownotes
Kleine Sprachmodelle auf eigener Hardware – die nüchterne Bestandsaufnahme.
Ein Small Language Model läuft auf einem Arbeitsplatzrechner, einem kleinen Server oder einer einzelnen Grafikkarte – kein Rechenzentrum nötig. Damit adressiert diese Modellklasse genau die drei Punkte, an denen Cloud-KI im DACH-Mittelstand regelmäßig hängt: Kosten, Datenschutz und Abhängigkeit von einzelnen US-Anbietern.
Themen der Folge:
Was ein SLM ist – und warum „Open-Weight" nicht dasselbe ist wie „Open Source" Grund 1 für die Wende: Offene Modelle liegen nur noch drei bis vier Monate hinter den geschlossenen Spitzenmodellen (Epoch AI) Grund 2: Lizenzen sind geschäftstauglicher geworden – aber nicht einheitlich. Vorsicht bei Google Gemma und Meta Llama Teuken-7B: das europäische Modell aus dem Projekt OpenGPT-X, trainiert in allen 24 EU-Amtssprachen Grund 3: Die Hardware ist da – von 4-GB-Modellen auf dem Notebook bis zum Tischgerät mit 128 GB Unified Memory Die Kostenrechnung ehrlich gerechnet: versteckte Betriebskosten, ein hoch sitzender Break-even und der unfaire Vergleich zwischen kleinem lokalem und großem Cloud-Modell Wofür SLMs reichen: Klassifizieren, Extrahieren, Zusammenfassen, Antwortbausteine, einfache Code-Hilfen Wofür nicht: breites Weltwissen, mehrstufiges Schlussfolgern, höchste Faktentreue ohne Quellenanbindung Warum hybride Setups für den Mittelstand meist die richtige Antwort sind Gartner-Prognose: Bis 2027 werden kleine, aufgabenspezifische Modelle dem Volumen nach dreimal häufiger eingesetzt als allgemeine große Sprachmodelle
Quellen (Auswahl):
Epoch AI: Capabilities Index, Analysen Okt. 2025 und Jan.–Mai 2026 Hugging Face: „State of Open Source on Hugging Face: Spring 2026" Gartner: Pressemitteilung vom 09.04.2025 (Analystenprognose) Fraunhofer IAIS / OpenGPT-X: Modellkarte Teuken-7B · Deutsche Telekom Model Cards für Qwen 3, Gemma 3, Phi-4, Llama 3.2, Mistral (Stand Juni 2026) Kostenrichtgrößen: cogitx.ai / Intuz, SitePoint, Marka Development (2026)
Prompt-Zeit ist ein KI-generierter Podcast: Stimmen, Recherche und Redaktion entstehen mit künstlicher Intelligenz.
Transkript anzeigen
00:00:00:
00:00:14: Bevor es losgeht, ein Hinweis in eigener Sache.
00:00:17: Bei Promptzeit ist die KI nicht nur Thema sondern macht auch die Arbeit!
00:00:21: Stimmen, Recherche und Redaktion dieses Podcasts sind KI-generiert.
00:00:26: In diesem Sinne viel Spaß mit der Folge.
00:00:33: Wer KI im Unternehmen einführen will, denkt zuerst an die großen Namen aus der Cloud.
00:00:39: Doch für einen wachsenden Teil der täglichen Aufgaben ist das überdimensioniert.
00:00:44: Kleine frei verfügbare Sprachmodelle laufen inzwischen auf gewöhnlicher Büro Hardware verlassen das Haus nicht und kosten nach der Anschaffung kaum laufendes Geld.
00:00:54: Für den Mittelstand ist das weniger eine Technik als eine Rechenfrage und der EU-Datenschutz liefert ein zweites, gewichtiges Argument.
00:01:04: Eine nüchterne Bestandsaufnahme stand Juni, zwanzig.
00:01:09: Was ein SLM ist?
00:01:12: Als Small Language Model – SLM bezeichnet man Sprachmodelle mit grob eins bis vierzehn Milliarden Parametern im Gegensatz zu den siebzig Milliarden und mehr der großen Cloudmodelle.
00:01:25: Die Grenze ist unscharf und eher praktisch gemeint.
00:01:29: Ein SLM ist ein Modell, das auf einem einzelnen Arbeitsplatzrechner, einem kleinen Server oder einer einzelnen Grafikarte laufen kann ohne einen Rechenzentrum zu benötigen.
00:01:41: Fast alle je genannten Modelle sind zugleich Open-Wade – die trainierten Gewichte sind frei herunterladbar so dass das Modell vollständig im eigenen Haus betrieben werden kann!
00:01:53: Open-Wade ist nicht gleich bedeutend mit open source im strengen Sinn.
00:01:58: Trainingsdaten und Code werden meist nicht offen gelegt, die Lizenzen unterscheiden sich erheblich.
00:02:05: Der Reiz liegt in der Kombination Klein genug für lokale Hardware gut genug für einen Großteil der Standardaufgaben und rechtlich so gestellt dass die Daten das Unternehmen nicht verlassen.
00:02:18: Damit adressiert die Modellklasse genau die drei Punkte, an denen CloudKI im Dachmittelstand regelmäßig hängt.
00:02:26: Kosten, Datenschutz und Abhängigkeit von einzelnen US-Anbietern.
00:02:33: Warum in den letzten Jahren die Wände kamen?
00:02:37: Bis vor Kurzem war die Antwort auf «Reicht ein lokales Modell fast immer noch nicht».
00:02:43: Das hat sich geändert aus drei Gründen.
00:02:47: Erstens hat Open-Wade aufgeholt Die offenen Modelle hinken den jeweils besten geschlossenen Spitzenmodellen nur noch um wenige Monate hinterher.
00:02:57: Das auf Modell-Benchmarks spezialisierte Forschungshaus EPOG AI bezifferte den Abstand im Capabilities Index, im Oktober twenty-fünfundzwanzig, auf rund drei Monate.
00:03:09: Eine Folgeanalyse für Januar bis Mai zwei tausend sechsund zwanzig kam auf etwa vier Monate.
00:03:16: Für die meisten Geschäftsanwendungen ist ein Vorsprung von einem Quartal bedeutungslos.
00:03:21: Die Frage ist nicht, ob ein Modell das absolut Beste ist sondern, ob es die konkrete Aufgabe zuverlässig löst.
00:03:29: Der Hugging Face Jahresrückblick State of Open Source Spring-Spring-Aufgabe beschreibt die Lücke entsprechend als für Standardaufgaben weitgehend geschlossen.
00:03:41: Bemerkenswert ist die Verschiebung der Herkunft.
00:03:45: Die Modellfamilie Quen aus China löste laut Epoch AI im Herbst, zwei Tausend Fünfundzwanzig Metas Lama als meistgeladene Modell-Familien auf Huggingface ab.
00:03:57: Notiz Open Weight heißt Gewichte frei herunterladbar – nicht zwingend open source.
00:04:05: Trainingsdaten und Lizenzbedingungen bleiben oft eingeschränkt.
00:04:09: Lizenz vor dem Produktiveinsatz prüfen besonders bei Gemma & Lama.
00:04:16: Zweitens sind die Lizenzen geschäftstauglicher geworden, aber nicht einheitlich.
00:04:20: Und hier lohnt das genaue Hinsehen!
00:04:23: Die QUEN-III-Familie und MISTRALS kleinere Modelle stehen unter Apache II.null – also einer echten Freilizenz, die kommerzielle Nutzung ohne Sonderbedingungen erlaubt.
00:04:36: Microsoft's FIIV-Reihe steht unter MIT-Lizenz ebenfalls unproblematisch.
00:04:43: Achtung bei Google Gemma.
00:04:45: Die Gemma-Modelle laufen nicht unter Apache, sondern unter einer eigenen Gema Terms of Use die zwar kommerzielle Nutzung erlaubt aber Nutzungsbeschränkungen enthält.
00:04:57: Das ist juristisch zu prüfen bevor Gemma in ein Produkt einfließt.
00:05:03: Auch Metas Lama Lizenz ist eine Community Lizenz mit Auflagen keine reine Apache Lizenz.
00:05:10: Eine Sonderrolle spielt das europäische Modell Teukensieben B aus dem vom Bund geförderten Projekt Open GPTX.
00:05:19: Es wurde von Grund auf mehrsprachig in allen vierundzwanzig EU-Amtsstrachen trainiert, rund die Hälfte der Trainingsdaten ist nicht Englisch und die kommerzielle Variante steht unter Apache zwei Punkt Null.
00:05:33: Für Häuser die Wertauf europäische Herkunft und solide Mehrsprachigkeit jenseits des englischen Legen ist es einen Testwert.
00:05:42: Bei der Spitzenleistung muss man gegenüber den größeren internationalen Familien Abstriche einkalkulieren.
00:05:50: Drittens ist die Hardware da.
00:05:52: Gamas kleine Varianten, etwa Gemma III in der vier Milliarden Größe belegen rund vier Gigabyte Arbeitsspeicher und laufen damit auf einem gut ausgestatteten Notebook.
00:06:04: VIVIV Mini – drei Komma acht Milliarden Parameter gilt als praktikable Option schon für acht Gigabyte Maschinen.
00:06:13: Wer mehr Durchsatz braucht, findet seit Ende twenty-fünfundzwanzig Tischgeräte wie NVIDIA's DGX Spark GBC & Chip.
00:06:22: Einhundert und zwanzig Gigabyte Unified Memory in der EU rund viertausend achthundert Euro stand Februar.
00:06:30: zwei tausend sechsundzwantig Nvidia Marketplace je nach Partner auch darunter.
00:06:35: Wichtig!
00:06:36: Und in werbetexten meist unterschlagen sind drei Relativierung Versteckte Betriebskosten.
00:06:43: Eigenbetrieb kostet mehr als nur Strom und Hardware.
00:06:47: Branchenanalysenveranschlagen für Monitoring, Updates- und Störungsbehebung – zehn bis zwanzig Stunden Engineering Zeit pro Monat.
00:06:56: Je nach Stundensatz also siebenhundertfünfzig bis dreitausend US-Dollar allein an Personalkosten.
00:07:08: Wer das nicht einrechnet, vergleicht Äpfel mit Birnen.
00:07:13: Der Break-even sitzt hoch!
00:07:16: Gegen die günstigeren API-Modelle lohnt sich Eigenbetrieb erst bei dauerhaft hohem Volumen.
00:07:22: Verschiedene Analysen nennen Schwellen im Bereich mehrerer hundert Millionen Token pro Monat.
00:07:28: Unterhalb davon ist die API oft schlicht billiger.
00:07:33: Kleines lokales Modell – ungleich großes Cloudmodell.
00:07:37: Die zitierten Cloudkosten gelten für die großen Spitzenmodelle.
00:07:42: Ein fairer Vergleich stellt das SLM einem gleich kleinen, günstigen API-Modell gegenüber – dann schrumpft der reine Kostenvorteil!
00:07:52: Der eigentliche Mehrwert des lokalen Betriebs liegt dann weniger im Preis als in Datenhoheit und Unabhängigkeit.
00:08:00: Die belastbare Aussage lautet also bei hohem gleichmäßigem Anfragevolumen Und wenn Datenschutz ohnehin den Eigenbetrieb erzwingt, rechnet sich das lokale SLM klar.
00:08:12: Bei geringem oder schwankendem Bedarf bleibt die API meist günstiger.
00:08:18: Die Grafik unten zeigt die Logik schematisch Wofür SLMs reichen und wofür nicht?
00:08:25: Die nüchterne Faustregel kommt von den Marktforschern.
00:08:28: selbst Gartner prognostiziert dass Organisationen bis Kleine, aufgabenspezifische KI-Modelle dem Volumen nach mindestens dreimal so häufig einsetzen werden wie allgemeine große Sprachmodelle.
00:08:44: Der Grund?
00:08:46: Ein sehr großer Teil der Büroaufgaben braucht keine Siebzig Milliarden Modelle.
00:08:53: Gut geeignet sind SLMs für klarumrissende wiederkehrende Aufgaben.
00:08:58: Klassifizieren und Verschlagworten.
00:09:01: E-mail sortieren, Tickets ruten, Dokumente kategorisieren.
00:09:06: Extrahirn strukturierter Daten aus Texten.
00:09:10: Rechnungen, Formulare, Verträge auslesen.
00:09:14: Zusammenfassen und umformulieren von Texten in vorhersehbaren Rahmen.
00:09:19: Antwortbausteine und Entwürfe im Kundenservice auf interner Wissensbasis – RAG Einfache Code-Hilfen.
00:09:29: Quenn drei in der sieben Milliarden Klasse gilt als stärkstes kleines Modell für Coderzeugung.
00:09:36: Schlecht geeignet sind sie für Aufgaben, die breites Weltwissen langes Schlussfolgern über viele Schritte oder höchste Fakten treue ohne Quellenanbindung verlangen.
00:09:47: Komplexe juristische oder strategische Analysen anspruchsvolle mehrstufige Recherche kreatives Schreiben auf Spitzenniveau.
00:09:56: Hier bleiben die großen Modelle vorn und für solche Fälle ist eine Cloud-API auch wirtschaftlich oft die richtige Wahl.
00:10:05: Der pragmatische Weg für den Mittelstand ist deshalb selten ein Entwederoder, sondern ein hybrides Setup.
00:10:12: Dass lokale SLM für das hohe Volumen an Routineaufgaben mit sensiblen Daten die Cloud API als Reserve für die wenigen Fälle, die wirklich einen Spitzenmodell brauchen.
00:10:26: So!
00:10:26: Das war's mal wieder für heute.
00:10:28: In der nächsten Folge geht es um
00:10:31: Wissensmanagement und RAG.
00:10:35: Wir hoffen, Sie konnten etwas Nützliches aus der Folge ziehen und sie hören uns wieder.
00:10:39: Es verabschieden sich Ela...
00:10:42: ...und Helmut!
Neuer Kommentar