Qwen hat gestern Qwen-Audio-3.1 vorgestellt, und weil die Meldung schnell falsch gelesen wird, hier der Punkt, auf den es ankommt: Das ist ein Cloud-Release, kein offenes Modell. Was drin ist: fünf Modelle (ASR, ASR-Next, TTS, TTS-Next, Realtime) und deutliche Preissenkungen — laut Meldung bis zu 95 % bei der Spracherkennung, 85 % bei Realtime, 70 % bei TTS. ASR-Next erkennt mehrere Sprecher mit Zeitstempeln, dazu Emotionen und Hintergrundgeräusche, und bereinigt Füllwörter automatisch. Was nicht drin steht: Parameterzahlen, Benchmarks, Lizenz — und kein Wort zu offenen Gewichten. Der Zugang läuft über Alibaba Cloud. Ich habe nichts gefunden, das auf einen Download der Gewichte hindeutet. Wenn jemand von euch etwas anderes sieht, korrigiert mich gerne. Warum ich das trotzdem poste: Der Sprecher-Split mit Zeitstempeln ist die Funktion, an der lokale Protokoll-Ketten bisher hängen. Ein Transkript ohne Sprecherzuordnung ist eine Textwand, mit Zuordnung ist es ein Protokoll. Genau da liegt für uns die Lücke. Wer die Kette lokal plant, sollte zwei Stellen getrennt betrachten: - Das ASR-Modell läuft einmal pro Aufnahme durch. Hier zählt, ob es in den Unified Memory passt und wie lang die Datei ist. - Das Sprachmodell danach arbeitet auf reinem Text. Grob 130 bis 150 gesprochene Wörter pro Minute, also rund 8.000 Wörter bei einer Stunde. Damit ist schnell das Kontextfenster erreicht, und du brauchst entweder abschnittsweises Zusammenfassen oder ein Modell mit großem Kontext. Bei mir läuft Whisper lokal, ohne Sprechertrennung. Ich schaue mir diese Woche an, was es dafür lokal gibt, und poste die Ergebnisse hier. Quelle: https://the-decoder.de/alibaba-stellt-sprechmodelle-fuer-erkennung-synthese-und-echtzeit-interaktion-vor/ Transkribiert ihr lokal oder in der Cloud, und wie löst ihr die Sprechertrennung?