Qwen-Image-2.1 von Alibaba verbindet die Erzeugung und Bearbeitung von Bildern in einem Modell, dessen Gewichte öffentlich verfügbar sind und das auf leistungsfähigen Heimcomputern laufen kann. Parallel entwickeln Anbieter Werkzeuge für interaktive Videos, automatisierte Kurzfilme und geklonte Stimmen. Damit rückt kreative Künstliche Intelligenz (KI) näher an kleine Unternehmen, Kreativberufe und private Anwenderinnen und Anwender – allerdings nicht ohne Lizenz-, Qualitäts- und Einwilligungsfragen.
Ein Modell für Erzeugen und Bearbeiten
Qwen-Image-2.1 ist ein sogenanntes Open-Weight-Modell: Die trainierten Modellgewichte, also die erlernten Einstellungen des Systems, können heruntergeladen werden. Das Modell umfasst sieben Milliarden Parameter und vereint Texterzeugung von Bildern, Bearbeitung bestehender Bilder und die Arbeit mit mehreren Vorlagen. Laut dem Bericht über Qwen-Image-2.1 soll es auf einer leistungsfähigen heimischen Grafikkarte wie einer Nvidia 3090 laufen.
Der praktische Unterschied zu vielen bisherigen Werkzeugen liegt darin, dass du nicht zwischen einem Generator und einem separaten Bildeditor wechseln musst. Du kannst ein Bild neu erzeugen, Bereiche einkreisen oder maskieren und anschliessend gezielt verändern. Bis zu zehn Referenzbilder lassen sich gleichzeitig einbeziehen, etwa um Personen in einem Gruppenporträt konsistent darzustellen, Kleidung virtuell anzuprobieren oder eine Raumgestaltung an mehreren Vorlagen auszurichten.
Eine weitere Besonderheit ist die native Unterstützung transparenter RGBA-Bilder. RGBA bezeichnet ein Farbformat mit zusätzlichem Transparenzkanal, sodass sich beispielsweise ein Produkt ohne Hintergrund ausgeben oder Text auf einer transparenten Ebene ändern lässt. Eine zweite Darstellung des Modells bestätigt die Kombination aus Bilderzeugung, Bearbeitung, Transparenz und bis zu zehn Referenzbildern in einem einzigen Modell.
Die versprochene Qualität bleibt vorerst mit Vorsicht zu behandeln. Qwen gibt an, dass der visuelle Teil auf einem eigenen Vergleichstest die meisten geschlossenen Modelle übertreffe, doch unabhängige Prüfungen fehlen. Die öffentliche Verfügbarkeit der Gewichte bedeutet zudem nicht, dass jede Nutzung frei erlaubt ist: Die Forschungslizenz schliesst kommerzielle Anwendungen aus, für die eine separate Genehmigung von Qwen nötig ist.
Lokale Bild-KI gibt dir mehr Kontrolle
Ein lokal laufendes Modell verarbeitet Bilder auf deinem eigenen Rechner statt zwingend über einen externen Onlinedienst. Das kann interessant sein, wenn du interne Produktbilder, Entwürfe oder persönliche Fotos nicht standardmässig hochladen möchtest. Es macht die Einrichtung aber nicht automatisch einfach: Die Quelle nennt eine leistungsfähige Grafikkarte als Voraussetzung, liefert jedoch keine allgemeine Aussage dazu, welche Rechnerkonfigurationen zuverlässig genügen.
Für Anwenderinnen und Anwender in der Schweiz ist vor allem diese lokale Option relevant. Sie kann mehr technische Kontrolle darüber geben, wo Bilddateien verarbeitet werden; eine vollständige Datenschutzgarantie folgt daraus jedoch nicht. Die Quellen machen keine Angaben zu Schweizer Support, deutschsprachiger Bedienung oder besonderen Angeboten für Schulen und Unternehmen in der Schweiz.
Auch „offen“ darf nicht mit „kostenlos für jeden Zweck“ verwechselt werden. Du kannst das Modell über die genannten Modellplattformen beziehen und eine Demo ausprobieren, aber ein geschäftlich erzeugtes Produktbild oder Werbemotiv fällt nicht automatisch unter die Forschungslizenz. Gerade für Selbstständige und kleine Unternehmen ist deshalb die Nutzungsart mindestens so relevant wie die technische Bildqualität.
Video wird vom Ergebnis zum Arbeitsablauf
Bei Video-KI verschiebt sich der Schwerpunkt von einzelnen Clips hin zu vollständigen Produktionsabläufen. ByteDance beschreibt Dramagic als Plattform, die Skripte analysiert, Figuren und Storyboards erzeugt und daraus eine Videovorschau erstellt. Mehrere Personen sollen gleichzeitig daran arbeiten können, während eingebaute Prüfungen die Konsistenz sichern; der Zugang wird über BytePlus auf Anfrage angeboten.
Ein konkretes Beispiel wäre ein kleines Produktionsteam, das ein Kurzdrama nicht Szene für Szene in getrennten Werkzeugen vorbereitet, sondern Skript, Figurenentwürfe, Storyboard und Vorschau in einem Ablauf entwickelt. Laut dem Bericht zu Dramagic wurden in China im ersten Quartal 2026 rund 128’000 Kurzdramen veröffentlicht, dreimal so viele wie im gesamten Vorjahr; 95 Prozent davon seien KI-generiert. Ein Professor der Tsinghua-Universität beziffert die Kosten pro Minute KI-Video auf 90 bis 120 US-Dollar, rund ein Zehntel früherer Produktionskosten.
Diese Zahlen zeigen eine starke industrielle Nutzung, stammen aber aus den im Bericht genannten chinesischen Branchen- und Expertenangaben. Gleichzeitig beschäftigt die Branche direkt 690’000 Menschen. Der Bericht nennt auch Vorwürfe, wonach manche Darsteller gezwungen würden, Stimme und Aussehen an KI-Systeme zu übertragen, bevor sie ihre Stelle verlieren – ein deutlicher Hinweis darauf, dass niedrigere Produktionskosten nicht automatisch faire Arbeitsbedingungen schaffen.
Runway verfolgt einen anderen Ansatz: Videos sollen bereits während deiner Beschreibung entstehen und laufend gestreamt werden. Statt einen Textbefehl, einen sogenannten Prompt, einzugeben und auf einen fertigen Clip zu warten, würdest du das Ergebnis unmittelbar steuern und korrigieren. Die vorgestellte Echtzeit-Videogenerierung ist jedoch ein Einblick in die Forschung und kein in der Quelle beschriebenes, allgemein verfügbares Endprodukt.
Runway erwartet durch schnellere Modelle weniger belegte Rechenzeit auf Grafikprozessoren (GPU) und damit niedrigere Kosten pro Ausgabe. Technisch bleibt das anspruchsvoll, weil jedes Videobild auf dem vorherigen aufbaut: Ein kleiner Fehler kann sich über viele Bilder zu einer grossen Verformung entwickeln. Das Unternehmen trainiert sein Modell deshalb nach eigenen Angaben auch mit dessen eigenen Ausgaben, damit es Abweichungen eher korrigiert als verstärkt; unabhängig bestätigte Resultate nennt die Quelle nicht.
Im gleichen Bereich meldet OpenAI, dass Higgsfield AI mit GPT-6 Astra neue Funktionen für Videowerbung innerhalb eines Tages bereitstellen könne. Laut der Darstellung von OpenAI soll dies kleinen Unternehmen die Erstellung von Videoanzeigen erleichtern. Die kurze Anbieterbeschreibung enthält allerdings weder Preise noch unabhängige Qualitätsvergleiche, weshalb sie eher die Richtung als den belegten Nutzen zeigt.
Stimmen werden zum prüfbaren Produktionsmittel
Stimmklonen erzeugt eine künstliche Stimme anhand einer Aufnahme einer realen Person. Eine Auswertung von sieben Programmierschnittstellen (API), also technischen Zugängen für die Verbindung mit anderen Anwendungen, verwendete dafür jeweils eine zehn Sekunden lange Sprachaufnahme. Bewertet wurden die Ähnlichkeit zur Referenzstimme, Einwilligungsprüfungen, Lizenzbedingungen und Kosten.
Damit wird deutlich, dass Klangähnlichkeit allein kein ausreichendes Auswahlkriterium ist. Für ein eingesprochenes Schulungsvideo oder eine wiederkehrende Audioversion eines Firmenbeitrags zählen ebenso die Erlaubnis der betroffenen Person und die zulässige kommerzielle Nutzung. Die Übersicht zu sieben Stimmklon-APIs vergleicht auch die Kosten pro einer Million Zeichen, die bereitgestellte Kurzfassung nennt jedoch keine einzelnen Preise oder Testsieger.
Die Verbindung zu Bild- und Video-KI liegt nahe: Figuren, Szenen und Stimmen können zunehmend innerhalb eines Produktionsablaufs entstehen. Das spart Übergaben zwischen Werkzeugen, erhöht aber auch das Missbrauchsrisiko. Besonders heikel wird es, wenn Aussehen oder Stimme ohne freiwillige, verständliche Einwilligung weiterverwendet werden.
Pro und Kontra kreativer KI-Werkzeuge
Pro:
- Mehrere Aufgaben in einem Modell – Qwen-Image-2.1 erzeugt und bearbeitet Bilder, verarbeitet Referenzen und unterstützt transparente Ebenen.
- Lokale Verarbeitung – Das Bildmodell kann auf geeigneter eigener Hardware laufen und reduziert damit die zwingende Abhängigkeit von einem Onlinedienst.
- Schnellere Rückmeldung – Runways Forschungsansatz soll Video während der Eingabe zeigen, statt nach jedem Prompt eine längere Wartephase einzulegen.
- Durchgängige Produktion – Dramagic verbindet Skriptanalyse, Figuren, Storyboards und Videovorschau in einem gemeinsamen Ablauf.
Kontra:
- Ungeprüfte Leistungsversprechen – Für Qwens Vergleich mit geschlossenen Modellen fehlen unabhängige Benchmarks, und auch andere Angaben stammen teils direkt von Anbietern.
- Begrenzte Nutzungsrechte – Öffentliche Modellgewichte bedeuten bei Qwen keine automatische Erlaubnis für kommerzielle Projekte.
- Fehler über viele Videobilder – Kleine visuelle Abweichungen können sich bei fortlaufender Generierung verstärken.
- Einwilligung und Arbeitsschutz – Geklonte Stimmen und digitale Abbilder können Menschen benachteiligen, wenn Zustimmung und Lizenzierung nicht sauber geregelt sind.
Was das für deine Praxis heisst
Wenn du einsteigst, ist ein klar begrenztes Bildprojekt der sinnvollste erste Schritt. Du könntest ein vorhandenes Objekt freistellen, Text auf einer transparenten Ebene ändern oder mehrere Referenzbilder für einen Raumentwurf einsetzen. Prüfe das Resultat auf sichtbare Fehler und kläre vor einer geschäftlichen Nutzung, ob die Lizenz dein Vorhaben erlaubt.
Wenn du bereits Erfahrung hast, kannst du den gesamten Ablauf betrachten statt nur einzelne Ausgaben. Vergleiche, wie viel Zeit zwischen Skript, Storyboard, Bildmaterial, Video und Stimme verloren geht, und teste Werkzeuge dort, wo sie eine konkrete Übergabe ersetzen. Bei einer API für Stimmklonen gehören Einwilligungsprüfung, Lizenz und Kosten ebenso in den Vergleich wie die Ähnlichkeit der Stimme.
Für anspruchsvollere Videoprojekte bleibt Geduld nötig. Dramagic ist nur auf Anfrage zugänglich, Runways Echtzeitansatz wird als Forschung beschrieben, und die OpenAI-Darstellung zu Higgsfield nennt keine Preise oder unabhängigen Ergebnisse. „Bald ausprobierbar“ reicht damit von bereits herunterladbaren Bildgewichten bis zu Funktionen, deren allgemeine Verfügbarkeit noch offen ist.
Die neue Werkzeugklasse macht kreative KI vielseitiger: Bilder lassen sich lokal erzeugen und bearbeiten, Videoprozesse werden stärker gebündelt, und Stimmen können über Schnittstellen in Produktionen einfliessen. Der grösste unmittelbare Nutzen liegt in weniger Werkzeugwechseln und schnellerem Ausprobieren. Offen bleiben vor allem verlässliche Qualitätsvergleiche, kommerzielle Rechte und der Schutz von Menschen, deren Stimme oder Aussehen als Ausgangsmaterial dient.
Quellen
- Alibabas Qwen-Image-2.1 vereint Bildgenerierung und -bearbeitung in einem einzigen Open-Weight-Modell, das lokal läuft – THE DECODER, 2026-09-20
- Alibaba Qwen Releases Qwen-Image-2.1: A 7B Open-Weight Model for Image Generation and Editing – MarkTechPost, 2026-09-21
- Dramagic von Bytedance automatisiert Kurzfilm-Produktion von Skript bis Videovorschau – THE DECODER, 2026-09-21
- Higgsfield AI ships new video features in a day with GPT-6 Astra – OpenAI, 2026-09-21
- Runway zeigt Echtzeit-Videogenerierung: Vom Prompt direkt zum laufenden Video – THE DECODER, 2026-09-20
- Best Voice Cloning APIs in 2026: Speaker Similarity, Consent Checks, and Price per 1M Characters – MarkTechPost, 2026-09-21


Bild: Tranmautritam via Pexels
