Kein bestes Modell, sondern ein passendes: So wählst Du ein offenes Sprachmodell für Deutsch, Code, Extraktion oder Mehrsprachigkeit aus.
Kostenlose KI-Erstberatung anfragen →Zufriedene Kunden der Suchhelden GmbH
Die Frage klingt einfach: Welches Open-Source-LLM sollen wir nehmen? Die üblichen Antworten helfen nur leider selten weiter. Ranglisten wechseln im Wochentakt. Jede Woche wird irgendwo ein neues Modell gefeiert. Und wer drei Meinungen einholt, bekommt vier Empfehlungen.
Der Grund dafür ist simpel. Es gibt kein bestes Modell. Es gibt nur ein passendes. Ein Modell, das deutsche Vertragstexte sauber zusammenfasst, ist nicht automatisch gut im Programmieren. Eines, das in einer Tabelle vorne liegt, kann bei Euren Fachbegriffen danebenliegen. Und ein Modell, das technisch überzeugt, darf vielleicht gar nicht kommerziell eingesetzt werden.
Dieser Ratgeber sortiert das Feld. Wir zeigen, welche offenen Sprachmodelle es als Familien gibt und wofür sie in der Praxis eingesetzt werden. Wir erklären, was Modellgrößen im Alltag bedeuten. Wir gehen auf Lizenzen ein, weil „open source" nicht dasselbe ist wie „frei nutzbar". Und wir beschreiben, wie eine Auswahl abläuft, die nicht auf Bauchgefühl beruht.
„Du kannst um die Welt fliegen um international Business zu machen – wir bringen Dein Business zum Fliegen. Wir bewegen uns durch datenbasierte Customer Journeys, setzen auf transparente Zusammenarbeit und positionieren Dein Business an die Spitze. Ein Business braucht keine Superkräfte, aber es braucht Helden – Suchhelden. Denn nicht alle Helden tragen Capes.“
Open-Source-LLMs im Vergleich: Welches offene Modell passt zu welcher Aufgabe?
Bewusst verzichten wir dabei auf Versionsnummern, Punktwerte und Platzierungen. Solche Angaben sind nach wenigen Monaten falsch. Charakter und Schwerpunkt einer Modellfamilie halten deutlich länger. Genau darauf bauen wir die Empfehlungen auf.
So setzen wir das mit Euch um: Ziele verstehen → Stack und Modelle wählen → Ihr mietet den Server nach unserer Vorgabe → wir richten ihn ein und betreuen ihn → wir führen die KI bei Euch ein → wir trainieren sie, bis Eure Ziele erreicht sind.
Der Beschluss steht: Die KI soll im eigenen Haus laufen. Dann kommt die Frage nach dem Modell. Und plötzlich stehen Dutzende Namen im Raum, dazu Varianten, Ableger und Spezialversionen. Viele Teams verlieren an dieser Stelle Wochen. Nicht weil die Technik schwierig wäre, sondern weil niemand die Auswahl eingrenzen mag.
Hilfreich ist ein Perspektivwechsel. Statt „Welches Modell ist das stärkste?" lautet die bessere Frage: „Welche Aufgaben sollen wirklich erledigt werden?" Aus zwei oder drei klar beschriebenen Aufgaben ergibt sich fast von selbst eine überschaubare Auswahl. Der Rest fällt weg, bevor jemand ihn überhaupt installiert.
Der Server steht, die Oberfläche ist da, das Modell antwortet. Trotzdem ist die Stimmung verhalten. Die Antworten wirken hölzern. Fachbegriffe werden falsch übersetzt. Manchmal rutscht die Antwort mitten im Satz ins Englische. Die Technik funktioniert, das Ergebnis überzeugt nicht.
Meist liegt das am Modell, nicht am Aufbau. Familien unterscheiden sich deutlich darin, wie viel deutschsprachiges Material sie gesehen haben. Ein Wechsel ist an dieser Stelle kein Rückschritt, sondern normaler Projektalltag. Wer den Stack sauber gebaut hat, tauscht das Modell aus und behält alles andere.
Ein Anwendungsfall ist fertig entwickelt. Die Tests laufen gut. Dann fragt jemand aus der Rechtsabteilung, unter welchen Bedingungen das Modell eigentlich genutzt werden darf. Und die Antwort fällt komplizierter aus als erwartet. Manche Modelle sind uneingeschränkt kommerziell nutzbar. Andere knüpfen Bedingungen daran.
Diese Prüfung gehört an den Anfang, nicht ans Ende. Sie kostet wenig Zeit, wenn man sie früh macht. Sie kostet ein Projekt, wenn sie zu spät kommt. Wir klären deshalb vor dem ersten Test, welche Kandidaten überhaupt in Frage kommen – technisch und lizenzrechtlich.
Diese Tabelle bewertet keine einzelnen Modelle. Sie zeigt, worauf es bei der Auswahl ankommt – und woran Du im eigenen Test erkennst, ob ein Kandidat passt.
Die Reihenfolge der Kriterien ist nicht bei allen gleich. Wer Verträge auswertet, gewichtet Sprachqualität und Kontextlänge hoch. Wer Tickets vorsortiert, braucht vor allem Tempo und verlässliche Struktur. Wer in einer abgeschotteten Umgebung arbeitet, stellt den Hardwarebedarf nach vorne. Deshalb bringt es wenig, ein Modell pauschal als gut oder schlecht zu bezeichnen.
Zwei Kriterien werden regelmäßig unterschätzt. Das eine ist die Geschwindigkeit: Ein Modell, das im Alltag spürbar hängt, wird nach kurzer Zeit nicht mehr benutzt. Das andere ist die Lizenzlage. Sie entscheidet nicht über die Qualität, aber über die Zulässigkeit – und damit letztlich über alles.
Am Anfang steht kein Modellname, sondern eine Liste. Welche Aufgaben soll das System übernehmen? Zusammenfassen, Entwürfe schreiben, Daten aus Dokumenten ziehen, Anfragen sortieren, Code erklären? Jede Aufgabe stellt andere Anforderungen. Drei bis fünf klar beschriebene Aufgaben reichen völlig aus.
Dazu gehören die Randbedingungen. In welcher Sprache wird gearbeitet? Wie lang sind die Texte? Wie viele Menschen nutzen das System gleichzeitig? Und was passiert mit der Antwort danach – liest sie ein Mensch oder verarbeitet sie ein anderes System weiter? Das macht einen großen Unterschied.
Jetzt wird die Auswahl klein gemacht. Aus den Aufgaben ergibt sich ein Profil: eher sprachstark, eher schnell, eher spezialisiert. Dazu kommt der Rahmen, den Eure Hardware setzt. Am Ende bleiben meist drei oder vier Kandidaten übrig, nicht dreißig.
Parallel prüfen wir die Lizenzbedingungen jedes Kandidaten. Was ist erlaubt, was nicht, welche Auflagen hängen daran? Modelle, die zu Eurem Einsatzzweck nicht passen, fliegen an dieser Stelle raus. Vor dem Test, nicht danach.
Jetzt kommen Eure eigenen Unterlagen ins Spiel. Echte Dokumente, echte Fragen, echte Formulierungen aus Eurem Alltag. Alle Kandidaten bekommen dieselben Aufgaben. Die Ergebnisse legen wir nebeneinander. Für den Betrieb nutzen wir dieselben Werkzeuge für den Modellbetrieb, die später auch produktiv laufen.
Öffentliche Ranglisten helfen an dieser Stelle kaum weiter. Sie messen allgemeine Aufgaben, nicht Deine. Ein Modell, das in einer Tabelle vorn liegt, kann bei Euren Fachbegriffen und Euren Dokumentformaten danebenliegen. Belastbar ist nur der direkte Vergleich mehrerer Kandidaten an echtem Material aus Eurem Haus. Bewertet wird von den Menschen, die später damit arbeiten. Ihr Urteil zählt im Alltag mehr als jede Platzierung.
Wichtig ist eine einfache Bewertung. Was ist inhaltlich richtig? Was klingt sprachlich passend? Wie lange hat es gedauert? Wer im Team das Ergebnis später nutzen soll, sollte mit bewerten. Fachabteilungen erkennen Schwächen, die in der IT niemandem auffallen.
Am Ende steht eine begründete Entscheidung, nicht eine Meinung. Oft fällt sie auf zwei Modelle: ein schnelles für den Alltag, ein stärkeres für anspruchsvolle Fälle. Das ist kein Kompromiss, sondern ein sinnvoller Aufbau. Die Nutzer:innen merken davon nichts, sie sehen nur eine Auswahl.
Danach gilt: beobachten. Wo sind die Antworten gut, wo nicht? Welche Aufgaben kommen neu dazu? Weil sich das Feld schnell bewegt, prüfen wir die Auswahl in festen Abständen erneut. Ein Modellwechsel ist in einem sauber gebauten Aufbau überschaubar.
Ein Open-Source-LLM ist ein großes Sprachmodell, dessen trainierte Gewichte öffentlich verfügbar sind. Du darfst es herunterladen, auf eigener Hardware ausführen und in eigene Anwendungen einbauen. Ein Sprachmodell – kurz LLM für „Large Language Model" – ist dabei ein System, das Texte versteht und erzeugt.
Bei geschlossenen Modellen geht das nicht. Sie laufen ausschließlich auf den Servern des Anbieters. Du sprichst über eine Schnittstelle mit ihnen und bekommst eine Antwort zurück. Das Modell selbst bleibt unzugänglich. Für viele Aufgaben ist das völlig in Ordnung. Für Inhalte, die das Haus nicht verlassen dürfen, ist es ein Ausschlusskriterium.
Der Abstand zwischen beiden Welten ist in den letzten Jahren spürbar kleiner geworden. Offene Modelle lösen heute Aufgaben, für die vor kurzem noch die größten kommerziellen Systeme nötig waren. Für den Mittelstand ist das die eigentliche Nachricht. Eigenbetrieb ist keine Notlösung mehr.
Diese drei Begriffe werden ständig vermischt, meinen aber Unterschiedliches. Offene Gewichte heißt: Die Modelldatei ist öffentlich verfügbar und ausführbar. Open Source meint im engeren Sinn mehr – etwa offengelegte Trainingsdaten und offene Werkzeuge. Viele bekannte Modelle erfüllen das nicht vollständig, obwohl sie umgangssprachlich so genannt werden.
Und frei nutzbar ist wieder etwas anderes. Verfügbarkeit sagt nichts über die erlaubte Nutzung. Manche Modelle dürfen uneingeschränkt kommerziell eingesetzt werden. Andere schließen bestimmte Zwecke aus oder knüpfen Auflagen an die Nutzung. Was gilt, steht in den Bedingungen des jeweiligen Modells.
In der Praxis genügt eine einfache Regel. Frag nicht, ob ein Modell „open source" ist. Frag, ob Ihr es für Euren konkreten Zweck einsetzen dürft. Das ist die Frage, die zählt – und sie ist mit einem Blick in die Nutzungsbedingungen meist schnell beantwortet.
Der Markt wartet nicht – belegte Zahlen
stufen generative KI als geschäftskritisch ein.
KPMG 2025der Mittelständler haben noch keine konkrete KI-Strategie.
KI-Index Mittelstand, H-KAjährliches Produktivitätspotenzial generativer KI weltweit.
McKinsey Global InstituteGemeinsam schauen wir, wo KI Deine Prozesse sinnvoll verbessern, Dein Team entlasten oder neue Möglichkeiten schaffen kann. Konkret, praxisnah und immer mit Blick darauf, was für Dein Unternehmen wirklich Mehrwert bringt.
Wir arbeiten modellagnostisch. Uns bindet keine Familie und kein Anbieter. Was wir empfehlen, ergibt sich aus Euren Aufgaben – nicht aus einer Partnerschaft.
Llama ist die Familie, die den Eigenbetrieb im Unternehmensumfeld populär gemacht hat. Sie gilt als breit aufgestellter Allrounder und ist sehr gut dokumentiert. Rund um Llama ist ein großes Ökosystem entstanden, was Betrieb und Fehlersuche erleichtert.
Mistral kommt aus Europa und wird häufig dort eingesetzt, wo europäische Sprachen eine Rolle spielen. Die Familie gilt als effizient: solide Ergebnisse bei überschaubarem Ressourcenbedarf. Für deutschsprachige Anwendungen ist sie regelmäßig ein aussichtsreicher Kandidat.
Qwen wird für mehrsprachige Aufgaben oft genannt und deckt ein breites Sprachspektrum ab. Die Familie ist in vielen Größen verfügbar, vom sehr kleinen bis zum sehr großen Modell. Das macht sie flexibel, wenn Hardware und Anspruch weit auseinanderliegen.
DeepSeek hat sich einen Namen bei technischen Aufgaben gemacht. Programmierung und mehrstufiges Schlussfolgern gelten als Schwerpunkte der Familie. In Entwicklungsabteilungen steht sie deshalb häufig auf der Kandidatenliste.
Gemma ist als vergleichsweise kompakte Familie bekannt. Sie wird oft dort eingesetzt, wo Modelle auf begrenzter Hardware laufen sollen – etwa an einzelnen Arbeitsplätzen oder in kleineren Installationen.
Phi verfolgt einen ähnlichen Ansatz und setzt auf kleine, sorgfältig trainierte Modelle. Für eng umrissene Aufgaben liefern solche Modelle erstaunlich brauchbare Ergebnisse, bei geringem Bedarf an Rechenleistung.
Alle sechs Familien gibt es in mehreren Ausprägungen, dazu kommen von der Community angepasste Varianten. Welche davon passt, zeigt der Test. Die Familie gibt die Richtung vor, die konkrete Variante entscheidet der Anwendungsfall.
Modelle werden in Größen angeboten – klein, mittel, groß. Größer bedeutet in der Tendenz: mehr Weltwissen, mehr Sicherheit bei kniffligen Formulierungen, bessere Ergebnisse bei komplexen Aufgaben. Es bedeutet aber auch: mehr Speicherbedarf, mehr Rechenleistung, längere Antwortzeiten.
Die praktische Grenze zieht die Hardware. Ein Modell muss vollständig geladen werden können, sonst läuft es gar nicht oder sehr zäh. Deshalb hängen Modellwahl und passende Serverausstattung immer zusammen. Wir planen beides gemeinsam, nie nacheinander.
Dazu kommt ein Verfahren namens Quantisierung. Dabei wird das Modell komprimiert, um Speicher zu sparen. Das macht größere Modelle auf kleinerer Hardware nutzbar. Bei starker Komprimierung leidet allerdings die Qualität. Wie weit man gehen kann, zeigt wieder nur der Test am eigenen Material.
Ein größeres Modell ist nicht automatisch das bessere Werkzeug. Im Tagesgeschäft zählt Antwortzeit. Wer auf jede Zusammenfassung spürbar wartet, nutzt das System seltener. Und ein Werkzeug, das nicht benutzt wird, bringt keinen Nutzen – unabhängig davon, wie stark es auf dem Papier ist.
Viele typische Aufgaben sind außerdem gar nicht so anspruchsvoll. Eine E-Mail zusammenfassen, ein Feld aus einem Formular ziehen, eine Anfrage einsortieren: Dafür reichen kleinere Modelle meist locker. Die volle Leistung braucht es nur bei einem Bruchteil der Anfragen.
Deshalb betreiben viele Unternehmen zwei Modelle parallel. Ein schnelles für den Alltag, ein stärkeres für die schwierigen Fälle. Das kostet weniger Ressourcen als ein großes Modell für alles – und fühlt sich im Betrieb deutlich besser an.
In einem sauber gebauten Aufbau sitzt zwischen Deinen Kolleg:innen und dem Modell eine zentrale Vermittlungsschicht. Alle Anfragen laufen über diese eine Stelle. Sie kennt die verfügbaren Modelle und reicht jede Anfrage weiter. Für die Nutzer:innen ist sie unsichtbar.
Genau das verändert die Bedeutung eines Modellwechsels. Er wird zu einer Einstellung und ist kein Umbau. Die Oberfläche bleibt dieselbe. Benutzerverwaltung und Rechte bleiben bestehen. Angebundene Wissensquellen bleiben angebunden. Getauscht wird nur, was hinter dieser Schicht läuft.
Das ist der eigentliche praktische Wert offener Modelle. Du legst Dich nicht auf Jahre fest. Erscheint später ein besserer Kandidat, ist er eine Option und kein neues Projekt. Beweglich zu bleiben ist im Alltag mehr wert als eine perfekte erste Wahl.
Technisch ist der Wechsel schnell erledigt, organisatorisch ist er nicht umsonst. Ein anderes Modell verhält sich anders. Es formuliert anders und reagiert anders auf dieselbe Anweisung.
Deshalb müssen Prompts und Vorlagen nachgezogen werden. Was beim alten Modell zuverlässig lief, braucht manchmal eine andere Formulierung. Auch die Ergebnisse gehören neu geprüft, besonders bei Extraktion und festen Ausgabeformaten. Und Dein Team gewöhnt sich an einen leicht veränderten Ton.
Wir planen das deshalb bewusst ein. Vor der Umstellung treten alter und neuer Kandidat an denselben echten Aufgaben gegeneinander an. Erst wenn das Ergebnis überzeugt, wird gewechselt. Ein Wechsel ohne diesen Zwischenschritt erzeugt Unruhe, die niemand gebrauchen kann.
Die Modelllandschaft verändert sich laufend. Es erscheinen neue Versionen, neue Familien kommen dazu, Lizenzbedingungen werden angepasst. Was heute als Empfehlung gilt, kann in einigen Monaten überholt sein. Deshalb nennen wir hier bewusst keine Versionsnummern und keine Ranglisten.
Wir prüfen diese Seite in festen Abständen und passen sie an. Was stabil bleibt, ist die Methode: Kriterien festlegen, Kandidaten eingrenzen, am eigenen Material testen. Diese Reihenfolge funktioniert unabhängig davon, welches Modell gerade neu ist.
Jede Modellfamilie bringt eigene Nutzungsbedingungen mit. Diese Bedingungen unterscheiden sich, und sie ändern sich mit neuen Veröffentlichungen. Pauschale Aussagen sind deshalb wertlos. Geprüft wird immer am konkreten Modell, das Ihr einsetzen wollt.
Worauf wir dabei schauen: Ist eine kommerzielle Nutzung erlaubt? Gibt es Einschränkungen für bestimmte Zwecke oder Unternehmensgrößen? Dürfen Ergebnisse weiterverwendet werden, etwa zum Anlernen eigener Modelle? Sind Hinweispflichten oder Namensnennungen vorgesehen? Und was gilt, wenn Ihr die Lösung an Kund:innen weitergebt?
Zwei Punkte kommen dabei regelmäßig zu kurz. Der erste betrifft sehr große Nutzerzahlen. Manche Bedingungen greifen erst ab einer bestimmten Größenordnung. Für den Mittelstand ist das selten relevant, für eine weitergegebene Lösung durchaus. Der zweite Punkt ist die Herkunft des Modells. Wer hat es veröffentlicht? Wie regelmäßig geschieht das? Und wie klar sind die Bedingungen dokumentiert?
Konkrete Lizenznamen helfen an dieser Stelle wenig. Sie wechseln mit jeder Veröffentlichung. Die Fragen dahinter bleiben gleich: erlaubt, eingeschränkt oder ausgeschlossen – und zwar für Euren konkreten Zweck.
Dokumentiert wird das Ergebnis einmal sauber – mit Modellname, Fundstelle und Datum. Das dauert nicht lange und beantwortet später jede Rückfrage aus Recht oder Einkauf. Eine vollständige Rechtsberatung können wir dabei nicht leisten. Für die verbindliche Bewertung zieh bitte fachkundige Jurist:innen hinzu.
Warum KI-Helden
Keine lange Vertragsbindung. Volle Flexibilität, volle Kostenkontrolle.
Statt sechsstelliger Projektkosten: flexibles Monatsmodell.
Modellunabhängig und immer am neuesten Stand — keine Bindung an ein LLM.
Persönlicher Ansprechpartner, Jour-Fixe-Calls und dediziertes Umsetzungsteam.
Diese sechs Aufgabentypen begegnen uns in Projekten am häufigsten. Für jeden beschreiben wir, welche Modelleigenschaften zählen – nicht, welches Modell zu nehmen ist. Das entscheidet der Test.
Angebote, Gutachten, Arbeitsanweisungen, Behördenschreiben: Hier zählt Sprachqualität vor allem anderen. Gefragt sind Modelle mit viel deutschsprachigem Training, die Fachbegriffe sauber treffen und den Ton halten. Achte im Test auf englische Einsprengsel und auf holprige Formulierungen. Modellgröße hilft hier oft, ist aber kein Ersatz für Sprachkompetenz in der Familie.
Code erklären, Fehler finden, Tests schreiben, Migrationen vorbereiten: Dafür gibt es Modelle mit klarem technischen Schwerpunkt. Wichtig sind lange Kontexte, weil Quellcode schnell umfangreich wird. Gute Ergebnisse erkennst Du daran, dass das Modell Zusammenhänge über mehrere Dateien hinweg versteht – nicht nur einzelne Zeilen korrekt kommentiert.
Rechnungsdaten, Vertragsfristen, Prüfwerte, Formularfelder: Hier zählt Verlässlichkeit mehr als Eloquenz. Das Modell muss dieselbe Struktur immer wieder gleich liefern. Sprachliche Brillanz ist nebensächlich. Häufig genügen kleinere, schnelle Modelle, weil die Aufgabe eng umrissen ist. Mehr dazu auf unserer Seite zur KI-Dokumentenverarbeitung.
Protokolle, Berichte, Aktenvorgänge, lange Mailverläufe: Entscheidend ist die Kontextlänge. Das Modell muss den gesamten Text auf einmal verarbeiten können. Prüfe im Test besonders das Ende langer Dokumente. Manche Modelle verlieren dort an Genauigkeit, obwohl sie den Text formal noch aufnehmen.
Internationale Standorte, mehrsprachige Dokumentation, Support in mehreren Sprachen: Dafür braucht es Familien mit breitem Sprachspektrum. Wichtig ist der Test in allen relevanten Sprachen, nicht nur in Deutsch und Englisch. Achte auch darauf, ob das Modell die Sprache der Frage zuverlässig beibehält. Genau da scheitern viele Kandidaten.
Antworten aus Handbüchern, Wikis und Ticketsystemen laufen über eine Anbindung an Euer Firmenwissen. Das Modell muss dabei weniger selbst wissen. Es muss vorgelegte Quellen sauber lesen, treu wiedergeben und Widersprüche benennen. Solche Aufgaben lösen kleinere Modelle oft überraschend gut – und sie sind die Grundlage vieler Schritte Richtung KI-Prozessautomatisierung.
Offene Modelle sind nicht in jeder Disziplin so stark wie die größten kommerziellen Systeme. Bei sehr komplexen Denkaufgaben, bei anspruchsvoller Bild- und Videoverarbeitung oder bei extrem langen Zusammenhängen liegen die Spitzenmodelle der großen Anbieter je nach Aufgabe vorn. Für Textverständnis, Zusammenfassungen, Klassifikation, Extraktion und Arbeit mit eigenen Dokumenten sind gute offene Modelle in der Praxis stark genug.
Dazu kommt der Aufwand. Ein offenes Modell ist kostenlos verfügbar, aber nicht kostenlos im Betrieb. Hardware, Strom, Einrichtung, Updates und Betreuung gehören dazu. Wer das nicht selbst leisten will, denkt besser über betreutes Hosting auf eigener Infrastruktur nach. Oder prüft ehrlich, ob ein Cloud-Dienst nicht doch besser passt.
Und ein offenes Modell löst nicht automatisch alle Fragen. Auch hier können Antworten falsch sein. Auch hier braucht es Rechtegrenzen, Quellenangaben und klare Zuständigkeiten für Freigaben. Die Wahl des Modells ist ein Baustein. Die Qualität im Alltag entsteht aus dem Zusammenspiel von Modell, Datenanbindung, Oberfläche und den Menschen, die damit arbeiten.
Lass uns gemeinsam herausfinden, welches offene Sprachmodell zu Euren Aufgaben, Eurer Hardware und Euren Anforderungen passt. Kostenlos und unverbindlich.
KI-Helden ist die KI-Abteilung der Suchhelden GmbH aus Osnabrück. Seit über einem Jahrzehnt arbeiten wir mit Unternehmen an digitalen Projekten. Vom Start-up bis zum internationalen Konzern, branchenunabhängig. Über 4.000 realisierte Projekte, ein Team aus über 140 Held:innen.
Was das für Eure Modellauswahl bedeutet: Wir empfehlen nichts, was wir nicht an echten Aufgaben gesehen haben. Uns interessiert weniger, welches Modell gerade gefeiert wird, als die Frage, ob Euer Team in einem halben Jahr noch damit arbeitet.
Ein Open-Source-LLM ist ein großes Sprachmodell, dessen trainierte Gewichte öffentlich verfügbar sind. Du darfst es herunterladen, auf eigener Hardware ausführen und in eigene Anwendungen einbauen. Damit unterscheidet es sich von geschlossenen Modellen, die ausschließlich beim Anbieter laufen. Für Unternehmen ist das der entscheidende Punkt: Nur ein verfügbares Modell lässt sich in einer Umgebung betreiben, die Ihr selbst kontrolliert.
Es gibt kein bestes Modell, sondern ein passendes. Für deutschsprachige Fachtexte fällt die Antwort anders aus als für Programmierung oder Dokumentenextraktion. Dazu kommen Hardware, Antwortzeit und Lizenzlage als Auswahlkriterien. Wer eine pauschale Empfehlung ausspricht, kennt Eure Aufgaben nicht. Wir grenzen deshalb drei bis vier Kandidaten ein und lassen sie an Euren echten Unterlagen gegeneinander antreten.
Das Modell selbst ist meist kostenlos verfügbar, der Betrieb ist es nicht. Es braucht einen Server, den Ihr mietet, dazu Einrichtung, Betreuung und Training. Dafür entfällt die Abrechnung pro Abfrage, was bei intensiver Nutzung ein Vorteil ist. Was ein Setup konkret kostet, hängt von Modellgröße und Nutzungsumfang ab. In der Erstberatung klären wir das und Du bekommst ein unverbindliches Angebot.
Das hängt vom einzelnen Modell ab und muss vor dem Einsatz geprüft werden. Viele Modelle erlauben die kommerzielle Nutzung uneingeschränkt. Andere knüpfen Bedingungen daran oder schließen bestimmte Zwecke aus. Verfügbarkeit sagt nichts über Erlaubnis. Wir prüfen die Nutzungsbedingungen jedes Kandidaten, bevor getestet wird. Das Ergebnis dokumentieren wir mit Modellname, Fundstelle und Datum. So ist die Frage später in wenigen Minuten beantwortet, statt kurz vor dem Livegang neu aufzuploppen.
Auf fünf Fragen, geprüft immer am konkreten Modell. Ist die kommerzielle Nutzung erlaubt? Darf die Lösung an Kund:innen weitergegeben werden? Was darf mit den Ausgaben geschehen, etwa zum Anlernen eigener Modelle? Gelten ab sehr großen Nutzerzahlen besondere Bedingungen? Und wer hat das Modell veröffentlicht, wie regelmäßig und wie klar dokumentiert? Das Ergebnis halten wir mit Modellname, Fundstelle und Datum fest. Eine verbindliche juristische Bewertung ersetzt das nicht – dafür zieh bitte fachkundige Jurist:innen hinzu.
Dafür kommen Familien in Frage, die viel deutschsprachiges Material gesehen haben. Europäische Modellfamilien sind hier oft aussichtsreiche Kandidaten, treffen Eure Fachsprache aber nicht automatisch. Entscheidend ist der Test an Euren eigenen Texten. Achte dabei auf englische Einsprengsel und auf falsch übersetzte Fachbegriffe. Prüfe außerdem, ob der Ton zu Euren Dokumenten passt. Genau daran scheitern viele Kandidaten, die sonst überzeugen.
Dafür gibt es Familien mit klarem technischen Schwerpunkt, die für Code-Aufgaben bekannt sind. Wichtig ist neben der Codequalität die Kontextlänge, weil Quellcode schnell umfangreich wird. Ein gutes Modell versteht Zusammenhänge über mehrere Dateien hinweg. Teste mit echtem Code aus Eurem Repository, nicht mit Beispielaufgaben aus dem Netz. Die Unterschiede zeigen sich erst bei gewachsenem Code.
Für die meisten Aufgaben ja. Zusammenfassen, Extrahieren, Klassifizieren, Entwürfe schreiben und Fragen an eigene Dokumente beantworten – das leisten gute offene Modelle heute zuverlässig. Bei sehr komplexen Denkaufgaben oder anspruchsvoller Bildverarbeitung liegen die größten kommerziellen Modelle je nach Aufgabe noch vorn. Der Abstand ist in den vergangenen Jahren allerdings deutlich kleiner geworden. Für den Mittelstand ist Eigenbetrieb deshalb längst kein Kompromiss mehr.
So groß wie nötig und so klein wie möglich. Größere Modelle bringen mehr Wissen und mehr Sicherheit bei schwierigen Aufgaben, brauchen aber mehr Hardware und antworten langsamer. Viele Alltagsaufgaben laufen mit kleineren Modellen genauso gut. Wir ermitteln im Test, ab welcher Größe die Qualität für Eure Aufgaben ausreicht. Dort bleiben wir dann bewusst stehen, statt Reserven zu bezahlen, die niemand nutzt.
Quantisierung ist ein Verfahren, das ein Modell komprimiert, damit es weniger Speicher benötigt. Dadurch laufen größere Modelle auch auf kleinerer Hardware. Der Preis ist ein Qualitätsverlust, der bei moderater Komprimierung kaum auffällt und bei starker Komprimierung deutlich wird. Wie weit man gehen kann, hängt an der Aufgabe. Wir prüfen das immer am eigenen Material statt nach Faustregel.
Ja, und oft ist genau das sinnvoll. Ein schnelles kleines Modell für Alltagsfragen, ein größeres für komplexe Analysen, dazu vielleicht ein Spezialmodell für Code. Die Oberfläche zeigt Deinem Team die passende Auswahl, ohne dass jemand über Technik nachdenkt. Ob sich der zusätzliche Ressourcenbedarf lohnt, entscheidet die tatsächliche Auslastung. Nicht jedes weitere Modell rechtfertigt seine Hardware.
Mit denselben Aufgaben, demselben Material und einer einfachen Bewertung. Nimm typische Dokumente und typische Fragen aus Eurem Alltag. Alle Kandidaten bekommen exakt dieselben Vorgaben. Bewertet werden inhaltliche Richtigkeit, sprachliche Qualität und Antwortzeit. Wichtig: Die Fachabteilung bewertet mit. Sie erkennt Schwächen, die in einer rein technischen Prüfung niemandem auffallen. Halte die Ergebnisse schriftlich fest, sonst diskutiert Ihr die Entscheidung in drei Monaten noch einmal von vorn.
Ja, und das solltet Ihr von Anfang an einplanen. In einem sauber gebauten Aufbau ist das Modell austauschbar, während Oberfläche, Rechte und Wissensanbindung bestehen bleiben. Genau deshalb achten wir auf klare Schnittstellen. Wir prüfen die Auswahl zudem in festen Abständen erneut, weil regelmäßig bessere Optionen erscheinen. Ein vorbereiteter Wechsel ist deutlich günstiger als ein erzwungener.
Technisch ist er schnell erledigt, organisatorisch nicht umsonst. Sitzt zwischen Nutzer:innen und Modell eine zentrale Vermittlungsschicht, ist der Wechsel eine Einstellung. Oberfläche, Benutzerverwaltung, Rechte und angebundene Wissensquellen bleiben unverändert. Der Aufwand entsteht danach: Ein anderes Modell formuliert anders. Prompts und Vorlagen müssen nachgezogen, Ergebnisse neu geprüft werden. Wir lassen deshalb alten und neuen Kandidaten vorher an denselben echten Aufgaben antreten und stellen erst danach um.
Sie schaffen eine bessere Ausgangslage, weil die Verarbeitung in Deiner eigenen Umgebung stattfinden kann. Inhalte müssen dann nicht an einen Anbieter übertragen werden. Das Modell selbst ist dabei neutral – entscheidend ist, wo und wie Ihr es betreibt. Eine vollständige Rechtsberatung können wir nicht leisten. Für die datenschutzrechtliche Bewertung zieh bitte spezialisierte Datenschutzberater:innen oder Deine:n Datenschutzbeauftragte:n hinzu.
Selbst trainieren müsst Ihr nichts. Das Training übernehmen wir in Schritt 6 unseres Ablaufs. Wir messen die Antworten gegen Eure Ziele. Dann verbessern wir die Wissensanbindung und die Vorlagen für wiederkehrende Aufgaben. Rückmeldungen Eurer Mitarbeitenden arbeiten wir laufend ein. Ein Feintuning kommt dazu, wenn es messbar hilft und die Lizenz es erlaubt. Die Trainingsdaten dafür erfinden wir gemeinsam mit Euch – niemals mit echten Daten. Mehr dazu auf unserer Seite zur automatischen Datengenerierung.
Offene Modelle werden über bekannte Modellplattformen verteilt. Wichtig ist, nur offizielle Veröffentlichungen der jeweiligen Anbieter zu verwenden und die Dateien zu prüfen. Von Community-Varianten unbekannter Herkunft raten wir im Unternehmenseinsatz ab. Wir dokumentieren, welches Modell in welcher Fassung aus welcher Quelle läuft. Das gehört zu einem nachvollziehbaren Betrieb genauso wie Protokollierung und Updates – und hilft auch bei späteren Rückfragen aus der Revision.
Regelmäßig, aber nicht ständig. Ein Wechsel bei jeder Neuveröffentlichung bringt nur Unruhe. Sinnvoll ist ein fester Turnus, in dem aktuelle Kandidaten an denselben Testaufgaben antreten wie beim ersten Mal. Bewertet wird wieder von der Fachabteilung, nicht nur von der IT. Bleibt das Ergebnis gleich, bleibt das Modell. Sind die neuen Kandidaten spürbar besser, lässt sich der Wechsel ruhig planen und vorbereiten.