NSIG_

Google DeepMind

Gemini 3.5 Transcribe setzt Sprache in Text um, laufend oder aus Aufnahmen

Vom Abgerufen Themen Modelle

Google DeepMind hat ein Modell für Spracherkennung als Vorschau über die Gemini-API veröffentlicht. Eine Schnittstelle überträgt laufend mit, die andere verarbeitet Aufnahmen und ordnet bis zu drei Sprechern Zeitmarken je Wort zu. Erkannt werden über 85 Sprachen.

Bei deepmind.google lesen →

← Alle Meldungen