Neue multimodale Modelle für Künstliche Intelligenz (KI) verarbeiten mehrere Medienarten wie Text, Bilder, Audio und Video. Google, Qwen und weitere Anbieter bringen dafür günstigere, spezialisierte oder offen lizenzierte Varianten auf den Markt. Für dich ist deshalb weniger entscheidend, welches Modell allgemein als das stärkste gilt, sondern welches deine konkrete Aufgabe zu vertretbaren Kosten erledigt.
Warum günstigere multimodale Modelle relevant sind
Google positioniert Gemini 3.8 Flash als günstigere Alternative zu Claude. Das Modell ist laut Google auf komplexe Schlussfolgerungen, Programmierung und KI-Agenten ausgerichtet; ein KI-Agent kann Aufgaben planen und dafür selbstständig Werkzeuge aufrufen. Parallel erschien Gemini 3.8 Flash Cyber für die Suche und Behebung von Software-Schwachstellen. Für Übersetzungen oder Dokumente ist diese Cyber-Variante allerdings kaum der naheliegende Aufpreis.
Gemini 3.8 Flash kostet zum Einführungspreis 0,75 US-Dollar je Million Eingabe-Tokens und 3,75 US-Dollar je Million Ausgabe-Tokens. Tokens sind kleine Texteinheiten, nach denen Programmierschnittstellen ihre Nutzung abrechnen. Laut dem Vergleich mit Qwen sollen sich diese Preise am 1. Januar 2027 verdoppeln. Die Schlagzeile «halb so teuer wie Claude» liefert damit Orientierung, aber keinen vollständigen Kostenvergleich für jede Aufgabe.
Qwen3.8-Omni-Flash setzt deutlich tiefere Preise an: 0,15 US-Dollar je Million Eingabe-Tokens und 0,47 US-Dollar je Million Ausgabe-Tokens. Qwen schätzt eine Stunde Audio auf weniger als 0,01 US-Dollar und ein 720p-Video mit Audio bei einem ausgewerteten Bild pro Sekunde auf 0,20 US-Dollar, jeweils ohne die Kosten der Antwort. Das sind Anbieterangaben und keine unabhängig geprüften Gesamtkosten.
Ein niedriger Preis pro Token macht ein Modell nicht automatisch günstiger. Lange Antworten, häufige Wiederholungen und die Verarbeitung von Video können mehr Nutzung erzeugen als eine kurze Textzusammenfassung. Ein Vergleich unterschiedlicher KI-Modelle kommt deshalb zum vernünftigen Grundsatz, schnelle Modelle für einfache Aufgaben und spezialisierte Modelle für komplexere Arbeiten einzusetzen.
Was die Angebote unterscheidet
Qwen3.8-Omni-Flash versteht Audio und Video gemeinsam, kann daraus Schlüsse ziehen und Werkzeuge verwenden. Als konkrete Anwendungen nennt Qwen den Schnitt eines Vlogs, die Übersetzung kurzer Videos und die Zusammenfassung von Filmen. Das Kontextfenster umfasst eine Million Tokens, also die Menge an Inhalt, die das Modell in einem Arbeitsgang berücksichtigen kann. Bei kombinierten Audio-Video-Aufgaben erreicht es laut Anbieter fast das Niveau von Gemini 3.8 Flash.
Der Zugang erfolgt über Qwen Studio, Qwen Cloud oder eine Programmierschnittstelle (API), also eine Verbindung, über die andere Dienste das Modell aufrufen. Offene Qwen-MM-Erweiterungen ergänzen bestehende Agenten um Videoschnitt, Sprechererkennung, PDF-Videonotizen und wiederverwendbare Abläufe. Qwen-Live Harness verbindet zudem Kamera und Mikrofon für Echtzeitinteraktionen. «Offen» bezieht sich hier auf die Erweiterungen und bedeutet nicht automatisch, dass der gesamte Onlinedienst lokal läuft oder keine Daten an einen Anbieter sendet.
Für Gespräche über Sprachgrenzen hinweg ist Qwen3.8-LiveTranslate stärker spezialisiert. Das Modell versteht laut Qwen 60 Sprachen, spricht 29 und senkt die durchschnittliche Verzögerung von 2,8 auf 2,3 Sekunden. Es trennt Sprecher in Echtzeit, zeigt zwei Sprachen synchron an und soll Namen sowie Fachbegriffe über längere Gesprächsabschnitte hinweg zuordnen. Verfügbar ist es über APIs von Alibaba Cloud Model Studio und QwenCloud.
Das passt etwa zu einer mehrsprachigen Besprechung, in der Beiträge laufend übersetzt und verschiedenen Personen zugeordnet werden müssen. Für die Schweiz ist das wegen des mehrsprachigen Umfelds grundsätzlich interessant. Die Quellen nennen jedoch weder die konkret unterstützten Sprachen noch die Erkennung von Schweizerdeutsch, den Datenstandort oder besondere Verfügbarkeitsbedingungen für die Schweiz.
Für reine Transkription bietet Grok Voice Transcribe 2.0 eine schmalere Alternative. Stapelverarbeitung kostet 0,10 US-Dollar pro Audiostunde, laufende Übertragung 0,20 US-Dollar. Der Anbieter meldet für kurze Äusserungen in 19 Sprachen einen Rückgang der Wortfehlerrate von 20,6 auf 6,8 Prozent und insgesamt die doppelte Genauigkeit gegenüber Version 1.0. Diese Behauptungen sind nicht unabhängig geprüft.
Für die Verschriftlichung eines aufgezeichneten Interviews genügt ein solches Sprache-zu-Text-Modell eher als ein vollständiges Audio-Video-System. Bei einer Live-Veranstaltung ist dagegen die laufende Übertragung entscheidend, während eine zweisprachige Anzeige und Sprechertrennung eher für LiveTranslate sprechen. Die Aufgabe bestimmt also das Modell, nicht die längste Funktionsliste.
Was Preis und Offenheit wirklich bedeuten
Lokale Nutzung verspricht mehr Kontrolle über Daten und laufende Kosten, setzt aber ein passendes Modellformat und geeignete Hardware voraus. PrismMLs Ternary Bonsai 2 27B belegt 5,93 Gigabyte, während das Ausgangsmodell Qwen3.8 27B im 16-Bit-Format 53,80 Gigabyte benötigt. Es verarbeitet Text und Bilder, unterstützt einen Kontext von 262’000 Tokens und steht laut Quelle unter der offenen Apache-2.0-Lizenz.
PrismML gibt an, dass die kompakte Variante über 20 Leistungstests hinweg 98,2 Prozent des Durchschnitts des Ausgangsmodells erreicht. Der Wert stammt vom Anbieter und sagt noch nicht, wie zuverlässig das Modell deine Rechnungen, gescannten Dokumente oder Bilder verarbeitet. Zudem deckt es Text und Bilder ab, nicht die Audio- und Videoaufgaben von Qwen3.8-Omni-Flash.
Die geringe Dateigrösse entsteht durch ternäre Gewichte, bei denen Modellwerte stark vereinfacht gespeichert werden. Das gehört zur Quantisierung, also zur Verringerung der rechnerischen Genauigkeit zugunsten eines kleineren Modells. Eine Übersicht zu GGUF, GPTQ, AWQ und EXL2 warnt sinngemäss davor, Dateicontainer und Quantisierungsmethoden gleichzusetzen. Welches Format passt, hängt unter anderem davon ab, ob du einen Mac, eine herkömmliche Grafikkarte oder eine Serverumgebung nutzt.
Offene Lizenz, kompakte Datei und lokale Ausführung sind deshalb drei verschiedene Eigenschaften. Eine Lizenz kann die Nutzung und Anpassung erlauben, während die vorhandene Hardware das Modell trotzdem ausbremst. Umgekehrt kann ein günstiger Onlinedienst praktischer sein, obwohl du weniger Kontrolle über Verarbeitung und spätere Preise hast.
Auch das billigste Modell ist nicht für jede Ausgabeart geeignet. TypeSafe AI bietet mit Jev ein Modell für strukturierte Entscheidungen, das Wahrscheinlichkeiten statt frei formuliertem Text liefert. Die Eingabe kostet 0,042 US-Dollar je Million Tokens, Ausgabetokens sind kostenlos. Das kann für klar definierte Auswahlfragen interessant sein, ersetzt aber weder Übersetzung noch Transkription oder eine verständlich formulierte Dokumentzusammenfassung.
Pro und Kontra günstiger und offener Modelle
Pro:
- Niedrigere Nutzungskosten – Qwen3.8-Omni-Flash unterbietet die genannten Einführungspreise von Gemini 3.8 Flash deutlich.
- Passende Spezialisierung – LiveTranslate konzentriert sich auf Dolmetschen, Grok Voice auf Transkription und Jev auf strukturierte Entscheidungen.
- Lokale Optionen – Ein 5,93 Gigabyte grosses Text-Bild-Modell kann lokale Verarbeitung realistischer machen als eine Datei mit 53,80 Gigabyte.
- Breitere Medienverarbeitung – Multimodale Modelle können Dokumente, Bilder, Ton und Video innerhalb eines Arbeitsablaufs verbinden.
Kontra:
- Anbieterwerte – Leistungs-, Genauigkeits- und Verzögerungsangaben sind in den vorliegenden Meldungen nicht unabhängig bestätigt.
- Schwer vergleichbare Preise – Token, Audiostunden, Videolänge sowie Ein- und Ausgabe werden unterschiedlich abgerechnet.
- Unklare Datenwege – Die Quellen nennen für Cloud-Angebote keine vollständigen Angaben zu Speicherort, Aufbewahrung oder Schweizer Datenschutzanforderungen.
- Begrenzte Austauschbarkeit – Ein günstiges Transkriptionsmodell kann keine Bilder auswerten, während ein lokales Text-Bild-Modell keine Live-Übersetzung bietet.
Was das für dich heisst
Für Einsteiger: Beginne mit einer klar abgegrenzten Aufgabe und einer kleinen, unkritischen Testdatei. Vergleiche nicht nur die Antwortqualität, sondern auch Bearbeitungszeit, Abrechnungsart und den Aufwand für Korrekturen. Ein günstiges Transkript mit vielen Fehlern kann teurer werden als ein höherer Minutenpreis mit brauchbarer Ausgabe.
Für Fortgeschrittene: Trenne Arbeitsabläufe nach Medienart und Schwierigkeit. Du kannst beispielsweise ein spezialisiertes Modell für die Transkription verwenden und erst danach ein Textmodell mit der Zusammenfassung beauftragen. Bei wiederkehrenden Bild- und Dokumentaufgaben lohnt sich zudem ein Vergleich zwischen einem kompakten lokalen Modell und einer Cloud-API, sofern deine Hardware und deine Datenschutzvorgaben dazu passen.
Schritt 1: Aufgabe und Ausgabe festlegen
- Bestimme, ob du Text, Bilder, Audio, Video oder mehrere Medien gemeinsam verarbeiten willst.
- Lege fest, ob du eine Übersetzung, ein Transkript, eine Zusammenfassung oder eine strukturierte Entscheidung benötigst.
- Prüfe, ob die Verarbeitung live erfolgen muss oder eine spätere Stapelverarbeitung genügt.
Schritt 2: Kosten vergleichbar machen
- Rechne bei Text mit Ein- und Ausgabetokens und bei Audio mit dem Preis pro Stunde.
- Beziehe bei Video die Auflösung, die Zahl ausgewerteter Bilder und die Antwortkosten ein.
- Berücksichtige angekündigte Preisänderungen wie die geplante Verdoppelung bei Gemini 3.8 Flash.
Schritt 3: Mit eigenen Beispielen prüfen
- Teste mehrere typische Dateien statt nur einer besonders einfachen Probe.
- Kontrolliere Namen, Zahlen, Fachbegriffe und die Zuordnung verschiedener Sprecher.
- Prüfe bei lokalen Modellen, welches Format zu deinem Gerät passt und ob die Geschwindigkeit ausreicht.
Die neuen Angebote senken die Kosten für einzelne Aufgaben und machen lokale Text-Bild-Verarbeitung zugänglicher. Ein einziges Modell deckt Übersetzung, Transkription, Dokumente und strukturierte Entscheidungen trotzdem nicht gleich gut ab. Offen bleiben vor allem die unabhängige Bestätigung der Anbieterwerte sowie Fragen zu Sprachen, Datenstandorten und langfristigen Preisen.
Quellen
- Halb so teuer wie Claude: Google veröffentlicht Gemini 3.8 Flash – t3n, 2026-09-19
- Qwen3.8-Omni-Flash: Multimodales KI-Modell mit Agenten-Fähigkeiten fordert Gemini Flash heraus – THE DECODER, 2026-09-19
- Alibaba Qwen Team Releases Qwen3.8-LiveTranslate – MarkTechPost, 2026-09-20
- SpaceXAI Releases Grok Voice Transcribe 2.0 – MarkTechPost, 2026-09-19
- PrismML Releases Ternary Bonsai 2 27B – MarkTechPost, 2026-09-18
- GGUF vs GPTQ vs AWQ vs EXL2: LLM Model Formats Explained – MarkTechPost, 2026-09-19
- KI-Modelle im Vergleich: Wie du das passende Tool findest – ohne zu viel zu zahlen – t3n, 2026-09-19
- TypeSafe AI Releases Jev – MarkTechPost, 2026-09-19


Bild: Eduardo Rosas via Pexels
