Together Link verbindet bekannte KI-Werkzeuge mit offenen Modellen wie Kimi K3 oder GLM 5.3 und soll dadurch die laufenden Kosten senken. Das betrifft vor allem Menschen und Teams, die häufig mit KI schreiben, analysieren oder programmieren und nicht jede Aufgabe an ein teures Spitzenmodell schicken wollen. Gleichzeitig zeigen neue Modelle aus den USA, Deutschland und China, dass offene Gewichte mehr Auswahl schaffen, aber nicht automatisch günstigen, lokalen oder neutralen Betrieb garantieren.
Was sind offene KI-Modelle?
Bei einem Modell mit offenen Gewichten kannst du die trainierten Modellparameter herunterladen oder über einen frei gewählten Dienst betreiben lassen. Diese Gewichte bestimmen, wie das Modell Eingaben verarbeitet und Antworten erzeugt. «Offen» bedeutet dabei nicht zwingend, dass auch Trainingsdaten, Trainingsverfahren und jede Nutzungsmöglichkeit vollständig offengelegt sind.
Für Anwenderinnen und Anwender liegt der wichtigste Unterschied deshalb weniger in einer philosophischen Definition als in der Wahlfreiheit. Du kannst ein Modell über einen Anbieter nutzen, einen spezialisierten Betreiber beauftragen oder es auf eigener Infrastruktur ausführen, sofern Lizenz und Hardware das erlauben. Damit lassen sich Anbieterabhängigkeit, Datenwege und Kosten besser steuern als bei einem ausschliesslich geschlossenen Dienst.
Wie breit das Angebot inzwischen ist, zeigt die Entwicklung der Qwen-Modellfamilie von Alibaba. Sie reicht laut MarkTechPost von kleinen Modellen, die für vergleichsweise begrenzte Geräte gedacht sind, bis zu offenen Gewichten mit 2,4 Billionen Parametern. Grösser bedeutet allerdings nicht automatisch besser für deine Aufgabe: Ein kleines, spezialisiertes Modell kann günstiger und einfacher zu kontrollieren sein.
Auch «kostenlos» braucht eine Einschränkung. Eine frei verfügbare Software oder ein herunterladbares Modell verursacht weiterhin Kosten für Rechenleistung, Speicher, Betreuung und gegebenenfalls einen externen Zugang. Die Rechnung verschwindet nicht; sie bekommt lediglich mehr Zeilen.
Wie erleichtert Together Link den Zugang?
Together Link ist ein kostenloses Werkzeug mit MIT-Lizenz, das sich derzeit in der Betaphase befindet. Es verbindet bestehende Anwendungen wie Claude Code, Claude Desktop, Codex, ChatGPT Desktop, OpenCode und Pi mit offenen Modellen, die bei Together AI gehostet werden. Eine Kommandozeilenschnittstelle, kurz CLI, ist eine Bedienung über Textbefehle statt über Schaltflächen.
Das Prinzip lautet: Oberfläche behalten, Modell austauschen. Ein Team könnte eine kurze Korrektur an GLM 5.3 Flash oder DeepSeek V4.1 Flash senden und ein schwierigeres Programmierproblem Kimi K3 oder GLM 5.3 überlassen. Genau diese Trennung zwischen kleinen Alltagsaufgaben und umfangreichen Überarbeitungen soll verhindern, dass jede Anfrage beim gleichen teuren Modell landet.
Der Einstieg ist dennoch nicht auf den typischen Chat-Anwender zugeschnitten. Together Link läuft laut Bericht auf macOS und Linux, benötigt einen Together-API-Schlüssel und wird über einen einzelnen Terminalbefehl installiert. Eine Programmierschnittstelle, kurz API, stellt dabei die Verbindung zwischen Werkzeug und gehostetem Modell her.
Wichtig ist die Abgrenzung zum lokalen Betrieb: Das Modell läuft bei diesem Angebot nicht auf deinem Computer. Die unterstützten Werkzeuge kommunizieren direkt mit dem gehosteten Zugang von Together AI; laut Bericht wird kein lokaler Vermittlungsdienst dauerhaft ausgeführt. Wer «offen» mit «meine Daten verlassen das Gerät nicht» gleichsetzt, würde hier also zwei verschiedene Dinge vermischen.
Hinzu kommt der Betastatus. Befehle, Weiterleitung und Modellauswahl können sich noch ändern. Die Software selbst ist kostenlos, doch die vorliegenden Informationen nennen keine konkreten Nutzungspreise für die darüber angesprochenen Modelle, weshalb sich eine tatsächliche Ersparnis nur anhand der eigenen Aufgaben und Abrechnung beurteilen lässt.
Welche Alternativen stehen bereit?
Reflection AI positioniert Beam als effizientere westliche Alternative zu grossen chinesischen Modellen. Beam ist ein Mixture-of-Experts-Modell (MoE), bei dem pro Eingabe nur ein Teil der spezialisierten Modellbereiche aktiv wird. Von insgesamt 501 Milliarden Parametern werden pro Token, also pro verarbeitetem Textbaustein, 23 Milliarden verwendet.
Laut Reflection soll Beam bei Schlussfolgerungsaufgaben drei- bis viermal weniger Rechenaufwand als vergleichbare grössere Modelle benötigen. TechCrunch weist jedoch darauf hin, dass diese Leistungsangaben nicht unabhängig bestätigt sind. Zudem räumt Reflection gemäss einem weiteren Bericht ein, dass Kimi K3 bei der reinen Leistungsfähigkeit vorne liege; Beam soll vor allem über Effizienz punkten.
Für eine unmittelbare Eigeninstallation ist Beam noch nicht bereit. Das Modell befindet sich im abschliessenden Red-Teaming, also in Sicherheitstests mit gezielten Angriffsversuchen, und der frühe Zugang läuft über eine Warteliste. Der einstellbare Denkaufwand von Beam könnte später helfen, kurze Routineantworten und schwierigere Analysen unterschiedlich zu behandeln, ist derzeit aber vor allem ein Versprechen des Anbieters.
Für deutschsprachige Anwendungen ist Kolibri von Aleph Alpha interessanter. Das deutsch-englische MoE-Modell besitzt 78 Milliarden Parameter, von denen etwa drei Milliarden je Token aktiv sind; 21,3 Prozent seiner Trainingsdaten sind deutsch. Die Gewichte stehen unter der Apache-2.0-Lizenz zum Download bereit, und Aleph Alpha nennt Verwaltung, Luftfahrt und Industrie als Einsatzfelder.
Ein konkretes Beispiel wäre die Bearbeitung umfangreicher deutsch-englischer Verwaltungs- oder Industriedokumente, für die Kolibri ein Kontextfenster von bis zu einer Million Tokens anbietet. Die Behauptung, das Modell liefere bei vergleichbaren Kosten besonders viel Qualität, stammt allerdings vom Hersteller. Für die Schweiz sind die deutsche Ausrichtung und herunterladbaren Gewichte relevant, besonders wenn eine Organisation Datenwege selbst bestimmen will; daraus folgt aber weder automatisch Unterstützung für Schweizer Besonderheiten noch ein einfacher Betrieb.
Andere offene Modelle setzen stärker auf Spezialisierung. Cantina Securitys apex-flash-1 wurde für die Suche nach Sicherheitslücken trainiert und löste laut Bericht 40 von 60 zurückgehaltenen Testaufgaben. Die MIT-lizenzierten Gewichte von apex-flash-1 sind verfügbar, benötigen in der genannten BF16-Ausführung aber ungefähr 640 GB Grafikspeicher. Offen und lokal möglich heisst somit noch lange nicht, dass ein gewöhnlicher Bürocomputer genügt.
Rho-1 von Reka AI zeigt eine andere Richtung. Die Forschungsvorschau verarbeitet Text, Bilder, Video und Robotersteuerung in einem Modell mit 19 Milliarden Parametern. Für Anwender könnte das etwa bedeuten, dass ein System laufendes Video erzeugt und auf neue Anweisungen reagiert, doch derzeit handelt es sich um eine Forschungsvorschau und nicht um eine ausgewiesene günstige Alltagslösung.
Pro und Kontra offener KI-Modelle
Pro:
- Modellwahl – Du kannst Routineaufgaben und anspruchsvolle Arbeiten an unterschiedlich leistungsfähige Modelle verteilen.
- Kostenkontrolle – Effiziente oder kleinere Modelle können den Rechenaufwand senken, sofern Hosting, Nutzung und Betreuung mitgerechnet werden.
- Datensouveränität – Herunterladbare Gewichte ermöglichen grundsätzlich den Betrieb auf selbst gewählter Infrastruktur und klarer kontrollierbare Datenwege.
- Spezialisierung – Modelle wie Kolibri oder apex-flash-1 richten sich gezielt an deutsche Texte beziehungsweise Sicherheitsforschung.
Kontra:
- Hardwarebedarf – Grosse Modelle können mehrere leistungsfähige Grafikprozessoren und erheblichen Speicher voraussetzen.
- Ungeprüfte Versprechen – Angaben zu Qualität, Geschwindigkeit und Ersparnis stammen häufig von den Anbietern und sind nicht unabhängig bestätigt.
- Betriebsaufwand – Installation, Aktualisierung, Zugriffsschutz und Überwachung bleiben auch bei frei verfügbaren Gewichten Aufgaben des Betreibers.
- Inhaltliche Verzerrung – Offene Gewichte machen die politischen und kulturellen Prägungen eines Modells nicht automatisch sichtbar oder harmlos.
Was bedeutet das für deine Praxis?
Besondere Vorsicht ist bei politisch sensiblen Themen angebracht. In einem Benchmark von Aleph Alpha mit 967 ausgewählten Tabuthemen wurden laut eigener Bewertung nur 17 bis 41 Prozent der Antworten chinesischer Modelle als ausgewogen eingestuft. Qwen, DeepSeek und Kimi wiederholten demnach häufig staatliche Positionen, wichen aus oder verweigerten Antworten.
Die Untersuchung zu politischen Verzerrungen passt zu früheren Audits und zu chinesischen Vorgaben für öffentliche Modelle. Sie muss dennoch eingeordnet werden: Aleph Alpha vermarktet selbst souveräne KI und hat ein wirtschaftliches Interesse an der Abgrenzung. Das Ergebnis ist damit ein ernstzunehmendes Warnsignal, aber kein neutraler Schlussbeweis über jede Version und jeden Einsatz chinesischer Modelle.
Wenn du einsteigst, wähle zuerst eine klar begrenzte, unkritische Aufgabe und vergleiche Ausgabe und Gesamtkosten mit deinem bisherigen Dienst. Geeignet ist beispielsweise die Zusammenfassung nicht vertraulicher Unterlagen oder eine kurze Textüberarbeitung. Prüfe dabei, ob das Modell gehostet oder tatsächlich lokal ausgeführt wird und welche Daten den eigenen Rechner verlassen.
Als fortgeschrittene Anwenderin oder fortgeschrittener Anwender kannst du Aufgaben nach Schwierigkeit, Sprache und Sensibilität aufteilen. Ein günstiges Modell übernimmt Routinearbeiten, ein stärkeres Modell schwierige Analysen, während vertrauliche Inhalte nur an eine kontrollierte Infrastruktur gehen. Bei politischen, historischen oder regulatorischen Recherchen solltest du Antworten verschiedener Modellfamilien gegenüberstellen und Behauptungen anhand deiner zugelassenen Primärquellen prüfen.
Offene Gewichte erweitern die Wahl zwischen Kosten, Leistung und Kontrolle, beseitigen diese Zielkonflikte aber nicht. Together Link macht den Modellwechsel bequemer, bleibt jedoch ein gehosteter Zugang, während echte Eigeninstallationen schnell an Hardware und Betriebsaufwand stossen. Das offene Risiko liegt neben unbestätigten Leistungsangaben vor allem in schwer erkennbaren Verzerrungen, die auch bei technisch frei verfügbaren Modellen erhalten bleiben.
Quellen
- Meet Together Link: A Free CLI That Runs Open Models Like Kimi K3 and GLM 5.3 Inside Claude Code, Codex, and OpenCode – MarkTechPost, 2026-10-05
- Reflection AI Introduces Beam: A 501B Open-Weight MoE Model With 23B Active Parameters for Coding and Agentic Workloads – MarkTechPost, 2026-10-05
- Reflection debuts Beam, an open-weight AI model to rival Chinese models at lower compute cost – TechCrunch, 2026-10-05
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und Robotersteuerung in einem einzigen Modell – THE DECODER, 2026-10-05
- KI-Lebenszeichen aus Deutschland: Aleph Alpha veröffentlicht deutsch-englisches Sprachmodell Kolibri – THE DECODER, 2026-10-05
- The Story of Qwen: Alibaba’s AI Models From 7B to 2.4T – MarkTechPost, 2026-10-05
- Can an Open Model Do Security Research? Cantina’s apex-flash-1 Solves 40 of 60 Held-Out Bug Tasks – MarkTechPost, 2026-10-05
- Chinesische KI-Modelle wiederholen bei sensiblen Themen Staatsdoktrin oder verweigern die Antwort – THE DECODER, 2026-10-04


Bild: Michal Hajtas via Pexels
