• Deutsch
  • English
  • Qwen3.8-Omni-Flash verarbeitet Text, Audio und Video gemeinsam und soll dabei deutlich günstiger sein als vergleichbare Angebote. Das betrifft dich, wenn du Videos auswerten, Gespräche transkribieren oder umfangreiche Dokumente analysieren möchtest. Mehrere zeitgleich veröffentlichte Modelle zeigen, dass der Wettbewerb nicht nur über Leistung, sondern zunehmend über Preis und Spezialisierung läuft.

    Warum der Preiskampf relevant ist

    Multimodale Künstliche Intelligenz (KI) bezeichnet Modelle, die unterschiedliche Medien wie Text, Bilder, Audio und Video verarbeiten. Bisher konnten solche Aufgaben schnell teuer werden, weil lange Aufnahmen sehr viele Tokens verbrauchen. Ein Token ist eine kleine Verarbeitungseinheit, in die ein Modell seine Eingaben und Antworten zerlegt.

    Qwen3.8-Omni-Flash kostet laut der Meldung zu Qwens neuem Omni-Modell 0,15 US-Dollar je Million Eingabe-Tokens und 0,47 US-Dollar je Million Ausgabe-Tokens. Der Anbieter schätzt eine Stunde Audio auf weniger als 0,01 US-Dollar. Ein 720p-Video mit Ton soll bei einem ausgewerteten Bild pro Sekunde 0,20 US-Dollar kosten, wobei die Kosten für die erzeugte Antwort noch nicht enthalten sind.

    Zum Vergleich werden für Gemini 3.8 Flash Einführungspreise von 0,75 US-Dollar für die Eingabe und 3,75 US-Dollar für die Ausgabe je Million Tokens genannt. Ab dem 1. Januar 2027 sollen sich diese Preise verdoppeln. Das sind Preise für eine Programmierschnittstelle, auf Englisch Application Programming Interface (API), über die andere Dienste auf ein Modell zugreifen. Sie entsprechen deshalb nicht automatisch dem Preis eines fertigen Abonnements für Privatpersonen.

    Google positioniert Gemini 3.8 Flash nach dem Bericht über den neuen Flash-Release für Programmierung, KI-Agenten und komplexe Schlussfolgerungen. Ein KI-Agent ist ein System, das Aufgaben plant und dafür selbstständig Werkzeuge aufrufen kann. Gemini 3.8 Flash Cyber wurde dagegen speziell auf die Suche und Behebung von Software-Schwachstellen ausgerichtet. Es war bereits Googles dritter Flash-Release innerhalb weniger Wochen; Gemini 3.7 Flash war erst drei Wochen zuvor erschienen.

    Was die neuen Modelle leisten

    Qwen3.8-Omni-Flash ist laut Qwen das erste multimodale Modell des Unternehmens, das ausdrücklich für KI-Agenten entwickelt wurde. Es kann Audio und Video gemeinsam auswerten, Schlussfolgerungen ziehen und Werkzeuge einsetzen. Als konkrete Anwendungen nennt Qwen den Schnitt eines Vlogs, die Übersetzung kurzer Videos und die Zusammenfassung von Filmen. Das Kontextfenster, also die Informationsmenge, die das Modell in einem Arbeitsgang berücksichtigen kann, umfasst eine Million Tokens.

    Qwen berichtet, das Modell erreiche bei kombinierten Audio-Video-Aufgaben fast das Niveau von Gemini 3.8 Flash. Eine weitere Zusammenfassung des Qwen-Releases nennt zudem 45,7 Prozent weniger verbrauchte Tokens beim OmniVideoBench. Dieser Benchmark ist ein standardisierter Modelltest für Videoaufgaben. Beide Angaben stammen vom Anbieter und wurden in den vorliegenden Quellen nicht unabhängig bestätigt.

    Der Zugang erfolgt über Qwen Studio, Qwen Cloud und die API. Ergänzende Qwen-MM-Plugins sollen bereits vorhandene Agenten um Videoschnitt, Sprechererkennung, PDF-Videonotizen und wiederverwendbare Arbeitsabläufe erweitern. Mit Qwen-Live Harness ist zudem eine Interaktion in Echtzeit über Kamera und Mikrofon vorgesehen.

    Andere Anbieter teilen den Markt gleichzeitig in engere Aufgaben auf. Grok Voice Transcribe 2.0 konzentriert sich auf Speech-to-Text, also die Umwandlung gesprochener Sprache in geschriebenen Text. Das Modell verarbeitet gespeicherte und laufende Audioübertragungen. Laut Anbieterangaben zum Transkriptionsmodell kostet die Stapelverarbeitung 0,10 US-Dollar pro Stunde und die laufende Übertragung 0,20 US-Dollar pro Stunde.

    SpaceXAI behauptet, die Genauigkeit gegenüber Version 1.0 bei gleichem Preis verdoppelt zu haben. Die Wortfehlerrate für kurze Äusserungen über 19 Sprachen soll von 20,6 auf 6,8 Prozent gefallen sein. Welche Sprachen enthalten sind und wie gut das Modell unter realen Bedingungen mit Akzenten, Hintergrundgeräuschen oder Fachwörtern umgeht, geht aus der Kurzfassung nicht hervor.

    Pro und Kontra günstiger multimodaler KI

    Pro:

    • Niedrigere Verarbeitungskosten – Lange Audio- und Videoaufnahmen lassen sich zu Preisen auswerten, die neue regelmässige Anwendungen ermöglichen können.
    • Weniger Werkzeugwechsel – Ein einziges Modell kann Ton, Bild und Text gemeinsam betrachten, statt jeden Teil getrennt zu verarbeiten.
    • Mehr Automatisierung – Agenten-Funktionen verbinden Analyse mit Aufgaben wie Schnitt, Übersetzung oder strukturierten Notizen.
    • Grössere Auswahl – Allgemeine Modelle konkurrieren mit spezialisierten Angeboten für Transkription, Entscheidungen und einzelne Branchen.

    Kontra:

    • Schwer vergleichbare Preise – Token-, Stunden- und Abonnementpreise messen unterschiedliche Leistungen und enthalten nicht immer die Antwortkosten.
    • Anbieter-Benchmarks – Viele Leistungswerte stammen von den Unternehmen selbst und sind noch nicht unabhängig geprüft.
    • Datenschutzrisiken – Audio, Video und Dokumente können besonders sensible Informationen über Personen, Unternehmen oder Kunden enthalten.
    • Schneller Modellwechsel – Mehrere Releases innerhalb weniger Wochen erschweren langfristige Entscheidungen und stabile Arbeitsabläufe.

    Günstiger bedeutet zudem nicht automatisch vielseitiger. TypeSafe AI verfolgt mit Jev einen engeren Ansatz: Das Modell beantwortet vorgegebene Arten von Fragen mit Wahrscheinlichkeiten, statt frei formulierten Text zu erzeugen. Laut der Vorstellung von Jev kostet die Eingabe 0,042 US-Dollar je Million Tokens, während Ausgabe-Tokens kostenlos sind. Diese Preisstruktur eignet sich eher für klar definierte Entscheidungen als für Videozusammenfassungen oder kreative Texte.

    Auch kleinere lokal nutzbare Modelle erhöhen den Preisdruck. Ternary Bonsai 2 27B belegt laut PrismML 5,93 Gigabyte statt 53,80 Gigabyte bei der FP16-Ausführung des Ausgangsmodells. Ternäre Gewichte speichern Modellwerte in einer stark reduzierten Form und senken dadurch den Speicherbedarf. Der Anbieter meldet 98,2 Prozent der durchschnittlichen Ausgangsleistung über 20 Benchmarks. Das Modell verarbeitet Text und Bilder und besitzt ein Kontextfenster von 262’000 Tokens; auch diese Resultate sind Anbieterangaben.

    Was die Preise im Alltag bedeuten

    Für Einsteigerinnen und Einsteiger: Beginne mit einer klar abgegrenzten Aufgabe in Qwen Studio oder einem vergleichbaren fertigen Zugang. Du könntest beispielsweise ein kurzes, nicht vertrauliches Video zusammenfassen oder die Tonspur eines eigenen Vlogs prüfen lassen. So erkennst du, ob das Modell Sprecher, Handlung und relevante Szenen zuverlässig erfasst, ohne gleich einen ganzen Medienbestand hochzuladen.

    Ein zweites praktisches Beispiel ist die Transkription einer Besprechung. Ein spezialisiertes Speech-to-Text-Modell kann dafür günstiger und übersichtlicher sein als ein umfassendes multimodales System. Vor der Verwendung solltest du klären, ob alle Beteiligten mit der Verarbeitung einverstanden sind und ob Namen, Kundendaten oder interne Entscheidungen in der Aufnahme vorkommen.

    Für Fortgeschrittene: Vergleiche Modelle anhand eines kleinen, gleichbleibenden Bestands eigener Testaufgaben. Dazu können ein Video mit mehreren Sprechern, eine Aufnahme mit Hintergrundgeräuschen und ein langes Dokument gehören. Bewerte nicht nur den Preis, sondern auch Fehler, benötigte Nacharbeit, Antwortlänge und den Umgang mit vertraulichen Daten. Ein günstiges Modell, dessen Resultate du ständig korrigieren musst, pflegt lediglich eine kreative Definition von Sparsamkeit.

    Für spezialisierte Berufe wird zudem die Verbindung aus allgemeinem Modell und geprüfter Suchquelle wichtiger. OpenAI kombiniert bei Astra for Law GPT-6 Astra mit einem juristischen Suchindex, der US-Rechtsprechung, Gesetze und Verordnungen über mehr als 230 Millionen URLs durchsucht. In einem von OpenAI selbst durchgeführten Test bestand das System 54 Prozent von 200 Fragen, verglichen mit 38,7 Prozent für GPT-6 Astra mit reiner Websuche. Der Bericht über Astra for Law nennt ausserdem ein Trusted-Access-Programm mit Datenschutzkontrollen wie Zero Data Retention, also ohne dauerhafte Speicherung der übermittelten Daten.

    Was für die Schweiz offenbleibt

    Für Anwenderinnen und Anwender in der Schweiz sind Preis und Mehrsprachigkeit besonders interessant, doch die Quellen lassen zentrale Fragen offen. Grok Voice Transcribe 2.0 wurde zwar über 19 Sprachen ausgewertet, die konkrete Sprachenliste wird aber nicht genannt. Damit bleibt unklar, wie zuverlässig Deutsch, Schweizer Hochdeutsch oder mehrsprachige Gespräche verarbeitet werden.

    Ebenso fehlen Angaben zu Datenstandorten in der Schweiz, Aufbewahrungsfristen und der Verfügbarkeit einzelner Angebote für Schweizer Konten. Qwen nennt Studio, Cloud und API als Zugänge, bestätigt in den vorliegenden Informationen aber keine besonderen Bedingungen für die Schweiz. Für Schulen, Unternehmen und öffentliche Stellen reicht ein niedriger Tokenpreis deshalb nicht als Auswahlkriterium; entscheidend ist auch, was mit hochgeladenen Stimmen, Gesichtern und Dokumenten geschieht.

    Astra for Law zeigt ausserdem die Grenzen regionaler Spezialisierung. Der beschriebene Index konzentriert sich auf US-Recht und lässt sich deshalb nicht einfach auf schweizerische Rechtsfragen übertragen. Das Angebot illustriert dennoch, warum branchenspezifische Suchbestände nützlich sein können: Ein allgemeines Modell erhält einen engeren, nachvollziehbareren Informationsraum. Die ausgewiesenen Testergebnisse stammen allerdings von OpenAI selbst.

    Qwen3.8-Omni-Flash macht die gemeinsame Verarbeitung von Audio, Video und Text deutlich erschwinglicher, während Gemini, Grok, Jev und Bonsai unterschiedliche Antworten auf denselben Kostendruck liefern. Für dich zählt weniger der niedrigste Einzelpreis als die Kombination aus passender Aufgabe, verlässlicher Qualität und kontrollierbarem Datenfluss. Offen bleiben vor allem die unabhängige Bestätigung der Leistungswerte, regionale Datenschutzbedingungen und die Frage, wie stabil die angekündigten Preise in diesem schnellen Veröffentlichungsrhythmus bleiben.

    Quellen

    AI-FunghiAI-Funghi

    Bild: Amar Preciado via Pexels

    © 2024 - 2026 ai-funghi.com | All Rights Reserved | Impressum | Datenschutz