Die jüngsten KI-Nachrichten zeigen einen klaren Trend: Modelle sollen nicht mehr nur antworten, sondern sehen, zuhören, planen und direkt handeln. Gleichzeitig wandern leistungsfähige Systeme auf lokale Geräte und in spezialisierte Anwendungen.
Redaktionell zusammengefasst und mit den Originalquellen belegt.
Tencent zeigt Gander für Echtzeitgespräche und Agentenaufgaben
Tencent hat mit Gander ein Forschungsmodell vorgestellt, das natürliche Echtzeitgespräche mit eigenständiger Aufgabenbearbeitung verbindet. Eine schnelle Komponente steuert den Dialog, während ein separates System im Hintergrund komplexere Aufgaben plant und ausführt. Nutzer sollen das Modell jederzeit unterbrechen können, ohne dass der Gesprächsfluss zusammenbricht. Gander verarbeitet Sprache, Bilder und Text in einem gemeinsamen System.
Der Ansatz zielt auf ein Problem heutiger Sprachassistenten: Sie reagieren entweder schnell, können aber wenig erledigen, oder sie planen komplexe Aufgaben und wirken dabei langsam und unnatürlich. In einem Benchmark fiel Gander laut Tencent seltener ins Wort als Vergleichsmodelle, blieb bei der Genauigkeit jedoch noch zurück. Die Architektur könnte langfristig für Assistenten interessant werden, die gleichzeitig beobachten, sprechen und handeln müssen – etwa bei Support, Bildung oder Robotik.
Runway arbeitet an Videogenerierung in Echtzeit
Runway hat einen Forschungsansatz vorgestellt, bei dem Nutzer nicht mehr auf einen fertigen Videoclip warten müssen. Stattdessen soll das Video bereits während der Texteingabe entstehen und fortlaufend aktualisiert werden. Das System erzeugt die Bilder Frame für Frame und soll dadurch die Zeit bis zum ersten sichtbaren Ergebnis deutlich verkürzen. Grundlage ist Runways Weltmodell GWM-1.
Für Kreative könnte sich damit der Arbeitsablauf grundlegend verändern: Prompts würden nicht mehr erst nach einer langen Generierung bewertet, sondern könnten während der laufenden Ausgabe angepasst werden. Das verspricht schnellere Iterationen und weniger Fehlversuche. Runway sieht außerdem Anwendungen jenseits von Film und Werbung, etwa in Robotik und autonomem Fahren. Dort könnten Weltmodelle helfen, dynamische Umgebungen schneller zu simulieren und auf neue Situationen zu reagieren.
Qwen-Image-2.1 verbindet Bildgenerierung und Bildbearbeitung
Alibabas KI-Team Qwen hat Qwen-Image-2.1 veröffentlicht, ein Open-Weight-Modell, das Bilder erzeugen und bestehende Bilder bearbeiten kann. Der Generierungsteil umfasst sieben Milliarden Parameter und soll dadurch auch auf leistungsfähigen Heimcomputern laufen. Das Modell unterstützt transparente RGBA-Bilder, kann bis zu zehn Referenzbilder verarbeiten und erlaubt gezielte Änderungen per Markierung oder Maske. Dazu zählen etwa das Freistellen von Objekten, Gruppenbilder oder virtuelle Anproben.
Die Kombination aus Erzeugung und Bearbeitung in einem lokalen Modell könnte den praktischen Einsatz vereinfachen. Nutzer müssen nicht mehr zwischen mehreren spezialisierten Werkzeugen wechseln und können Bildänderungen direkt mit Referenzen steuern. Allerdings ist die Veröffentlichung zunächst nicht frei kommerziell nutzbar: Die Research-License verlangt für geschäftliche Einsätze eine separate Genehmigung. Unabhängige Benchmarks zur tatsächlichen Leistung stehen zudem noch aus.
Microsoft und University of Illinois entwickeln StudentSim
Microsoft und die University of Illinois haben StudentSim vorgestellt, ein System zur digitalen Nachbildung einzelner Schüler. Aus wenigen Aufzeichnungen erstellt es Stellvertreter, die typische Fehler, Wissenslücken und Reaktionen auf Erklärungen simulieren. Diese KI-Schüler können anschließend viele Tutorvarianten testen und schneller Rückmeldungen liefern als reale Lernende. Die Methode wurde mit Daten aus Schach, Englisch als Fremdsprache und Mathematik untersucht.
Die Bedeutung liegt vor allem im personalisierten Lernen. Ein Tutor muss nicht nur richtige Antworten geben, sondern erkennen, wann ein bestimmter Schüler einen Hinweis versteht, missversteht oder eine andere Erklärung braucht. StudentSim soll genau dieses Verhalten in Trainingsschleifen abbilden. In einem Test mit 60 Schülern sagte das System individuelle Züge und Korrekturreaktionen besser voraus als GPT-5.4. Die Forscher betonen jedoch, dass es sich zunächst um einen Machbarkeitsnachweis handelt.
Unity veröffentlicht Plugins für Claude Code und OpenAI Codex
Unity hat offizielle Erweiterungen für Claude Code und OpenAI Codex veröffentlicht. Sie geben den Coding-Agenten spezialisierte Fähigkeiten für die Spieleentwicklung, darunter Benutzeroberflächen, 2D-Grafik, Audio, Navigation, Physik, Multiplayer, In-App-Käufe und die Render-Pipeline URP. Für Codex standen zum Start 31 Skills bereit. Ein weiterer Skill kann Projekte samt Editor, Versionsverwaltung und benötigten Paketen einrichten.
Damit versucht Unity, die Schwächen allgemeiner Coding-Agenten bei komplexer Spezialsoftware zu reduzieren. Solche Modelle greifen häufig auf Foren, Tutorials oder veraltete Beispiele zurück, deren Code zwar funktionieren kann, aber nicht zuverlässig zur aktuellen Engine passt. Von Unity gepflegte Skills liefern stattdessen aktuelles Fachwissen direkt in den Arbeitsablauf. Das könnte Agenten vom allgemeinen Codehelfer zu produktiveren Assistenten für konkrete Entwicklungsumgebungen machen.