Hugging Face
Elf quelloffene ASR-Modelle reproduzieren Benchmark-Transkripte statt Gesprochenes
Vom Abgerufen
Eine auf Hugging Face veröffentlichte Untersuchung an elf quelloffenen ASR-Modellen zeigt, dass mehrere davon Referenztranskripte aus VoxPopuli und LibriSpeech reproduzieren, auch wenn das Gesprochene davon abweicht. Die Modelle reagieren auf akustische Hinweise, die den Benchmark verraten.