Google DeepMind
Gemini 3.5 Transcribe setzt Sprache in Text um, laufend oder aus Aufnahmen
Vom Abgerufen Themen Modelle
Google DeepMind hat ein Modell für Spracherkennung als Vorschau über die Gemini-API veröffentlicht. Eine Schnittstelle überträgt laufend mit, die andere verarbeitet Aufnahmen und ordnet bis zu drei Sprechern Zeitmarken je Wort zu. Erkannt werden über 85 Sprachen.