A real-time silent speech recognition tool.
-
Updated
Nov 2, 2025 - Python
A real-time silent speech recognition tool.
Audio-Visual Speech Recognition using Sequence to Sequence Models
Audio-Visual Corruption Modeling of our paper "Watch or Listen: Robust Audio-Visual Speech Recognition with Visual Corruption Modeling and Reliability Scoring" in CVPR23
The official implementation of OpenSR (ACL2023 Oral)
Official repo for "Audio-Visual Speech Recognition In-the-Wild: Multi-Angle Vehicle Cabin Corpus and Attention-based Method" in ICASSP 2024
Kaldi-based audio-visual speech recognition
🚀 SynthAVSR is a research framework for training and evaluating audiovisual speech recognition (AVSR) models using synthetic data — with a focus on low-resource languages like Spanish and Catalan.
Web interface for a real-time silent speech recognition tool.
Source-grounded VSR engineering handbook with linked evidence, decision routes, reproducibility audits, and GitHub Pages search.
A multimodal speech perception models that converts and understands speech to text through audio and lip-reading signals
Preprocessing and multimodal augmentation code for AV-HuBERT-based audio-visual speech recognition, including interpolation-based offsets and viseme-aware blurring.
To associate your repository with the avsr topic, visit your repo's landing page and select "manage topics."