Hugging Face Hub · seven audio pipeline tags

The State of Open Source Audio

55,887 open audio models
20K added in the last 12 months
1.9× the 12 months before that
7 tasks, from 36.6K models to 279

as of 2026-10-03

What open audio is made of

Every public model repo carrying one of the seven audio tags. Pick a field to follow it through the rest of the page.

New models per month, by field

Stacked, so the column height is all of open audio and each band is one field. ASR sets the scale; the fields moving fastest are underneath it.

01,0002,0003,0002023202420252026Apr 2022ASR249TTS18Classification10Text-to-audio0Audio-to-audio8Audio-text-to-text0VAD2all audio287May 2022ASR350TTS11Classification13Text-to-audio0Audio-to-audio0Audio-text-to-text0VAD0all audio374Jun 2022ASR235TTS6Classification16Text-to-audio0Audio-to-audio5Audio-text-to-text0VAD0all audio262Jul 2022ASR1,230TTS1Classification16Text-to-audio0Audio-to-audio2Audio-text-to-text0VAD0all audio1,249Aug 2022ASR149TTS4Classification16Text-to-audio0Audio-to-audio0Audio-text-to-text0VAD0all audio169Sep 2022ASR169TTS9Classification14Text-to-audio0Audio-to-audio2Audio-text-to-text0VAD0all audio194Oct 2022ASR171TTS8Classification23Text-to-audio0Audio-to-audio50Audio-text-to-text0VAD2all audio254Nov 2022ASR409TTS6Classification21Text-to-audio0Audio-to-audio0Audio-text-to-text0VAD2all audio438Dec 2022ASR1,124TTS4Classification11Text-to-audio12Audio-to-audio2Audio-text-to-text0VAD0all audio1,153Jan 2023ASR295TTS9Classification7Text-to-audio1Audio-to-audio9Audio-text-to-text0VAD0all audio321Feb 2023ASR427TTS7Classification40Text-to-audio0Audio-to-audio3Audio-text-to-text0VAD0all audio477Mar 2023ASR451TTS7Classification57Text-to-audio1Audio-to-audio1Audio-text-to-text0VAD1all audio518Apr 2023ASR351TTS11Classification60Text-to-audio13Audio-to-audio8Audio-text-to-text0VAD3all audio446May 2023ASR461TTS17Classification76Text-to-audio37Audio-to-audio9Audio-text-to-text0VAD0all audio600Jun 2023ASR413TTS13Classification111Text-to-audio66Audio-to-audio21Audio-text-to-text0VAD3all audio627Jul 2023ASR498TTS76Classification254Text-to-audio92Audio-to-audio24Audio-text-to-text0VAD2all audio946Aug 2023ASR1,144TTS102Classification213Text-to-audio73Audio-to-audio66Audio-text-to-text0VAD0all audio1,598Sep 2023ASR675TTS1,163Classification131Text-to-audio50Audio-to-audio98Audio-text-to-text0VAD3all audio2,120Oct 2023ASR908TTS22Classification74Text-to-audio54Audio-to-audio20Audio-text-to-text0VAD2all audio1,080Nov 2023ASR579TTS33Classification97Text-to-audio33Audio-to-audio13Audio-text-to-text0VAD1all audio756Dec 2023ASR655TTS50Classification96Text-to-audio40Audio-to-audio19Audio-text-to-text0VAD0all audio860Jan 2024ASR676TTS31Classification176Text-to-audio62Audio-to-audio17Audio-text-to-text0VAD1all audio963Feb 2024ASR622TTS39Classification127Text-to-audio53Audio-to-audio16Audio-text-to-text0VAD3all audio860Mar 2024ASR596TTS52Classification156Text-to-audio44Audio-to-audio28Audio-text-to-text0VAD1all audio877Apr 2024ASR746TTS47Classification155Text-to-audio124Audio-to-audio19Audio-text-to-text0VAD3all audio1,094May 2024ASR996TTS27Classification162Text-to-audio125Audio-to-audio17Audio-text-to-text0VAD0all audio1,327Jun 2024ASR946TTS26Classification136Text-to-audio147Audio-to-audio38Audio-text-to-text1VAD0all audio1,294Jul 2024ASR911TTS33Classification147Text-to-audio69Audio-to-audio41Audio-text-to-text3VAD4all audio1,208Aug 2024ASR342TTS28Classification54Text-to-audio36Audio-to-audio49Audio-text-to-text2VAD2all audio513Sep 2024ASR456TTS31Classification44Text-to-audio56Audio-to-audio28Audio-text-to-text4VAD4all audio623Oct 2024ASR519TTS51Classification50Text-to-audio137Audio-to-audio5Audio-text-to-text5VAD1all audio768Nov 2024ASR610TTS65Classification76Text-to-audio140Audio-to-audio24Audio-text-to-text11VAD3all audio929Dec 2024ASR581TTS102Classification76Text-to-audio92Audio-to-audio5Audio-text-to-text7VAD3all audio866Jan 2025ASR473TTS95Classification85Text-to-audio132Audio-to-audio35Audio-text-to-text5VAD2all audio827Feb 2025ASR587TTS78Classification93Text-to-audio106Audio-to-audio21Audio-text-to-text12VAD2all audio899Mar 2025ASR660TTS264Classification74Text-to-audio100Audio-to-audio14Audio-text-to-text8VAD2all audio1,122Apr 2025ASR584TTS178Classification86Text-to-audio96Audio-to-audio11Audio-text-to-text9VAD3all audio967May 2025ASR619TTS103Classification99Text-to-audio165Audio-to-audio12Audio-text-to-text17VAD2all audio1,017Jun 2025ASR575TTS89Classification70Text-to-audio91Audio-to-audio13Audio-text-to-text8VAD1all audio847Jul 2025ASR491TTS110Classification71Text-to-audio97Audio-to-audio8Audio-text-to-text18VAD4all audio799Aug 2025ASR485TTS108Classification70Text-to-audio49Audio-to-audio17Audio-text-to-text11VAD0all audio740Sep 2025ASR483TTS117Classification78Text-to-audio46Audio-to-audio21Audio-text-to-text8VAD31all audio784Oct 2025ASR336TTS96Classification129Text-to-audio74Audio-to-audio25Audio-text-to-text19VAD3all audio682Nov 2025ASR431TTS97Classification128Text-to-audio34Audio-to-audio11Audio-text-to-text5VAD3all audio709Dec 2025ASR619TTS180Classification78Text-to-audio48Audio-to-audio33Audio-text-to-text5VAD4all audio967Jan 2026ASR414TTS204Classification44Text-to-audio43Audio-to-audio37Audio-text-to-text12VAD8all audio762Feb 2026ASR668TTS266Classification84Text-to-audio78Audio-to-audio30Audio-text-to-text10VAD22all audio1,158Mar 2026ASR840TTS368Classification112Text-to-audio72Audio-to-audio72Audio-text-to-text8VAD13all audio1,485Apr 2026ASR1,224TTS481Classification144Text-to-audio75Audio-to-audio45Audio-text-to-text28VAD14all audio2,011May 2026ASR1,634TTS663Classification114Text-to-audio199Audio-to-audio95Audio-text-to-text21VAD15all audio2,741Jun 2026ASR1,221TTS498Classification159Text-to-audio98Audio-to-audio64Audio-text-to-text21VAD23all audio2,084Jul 2026ASR1,317TTS496Classification130Text-to-audio108Audio-to-audio107Audio-text-to-text20VAD18all audio2,196Aug 2026ASR1,167TTS617Classification181Text-to-audio130Audio-to-audio113Audio-text-to-text38VAD24all audio2,270Sep 2026ASR1,424TTS658Classification191Text-to-audio110Audio-to-audio75Audio-text-to-text68VAD52all audio2,578Oct 2026ASR84TTS64Classification12Text-to-audio8Audio-to-audio6Audio-text-to-text0VAD6all audio180

The current month is partial — 3 of 31 days.

Each field on its own scale

A shared axis would flatten six of these into nothing: ASR is 130× VAD. Each sparkline is scaled to its own field, so what you compare is shape, not size. Growth is the last 12 months against the 12 before.

Who ships what the field actually uses

A contribution grid weighted by engagement, not output: labs ranked by the likes their audio models have earned, months across, darker where a month's releases landed. Counting repos instead would rank format converters and checkpoint farms above every research lab — openai earns 14K likes from 8 models while facebook earns 5.9K from 110. Sibling repos are collapsed into one model, so facebook/mms-tts counts once rather than 1,140 times, one per language. The dot is the field each lab mostly works in; hover a row for its most-liked model.

The landmarks, all on one timeline

The most-liked release from each field, ringed in its colour. Hover for the model, click to open it on the Hub.

Classificationwav2vec2-large-robust-12-faudeering/wav2vec2-large-robust-12-ft-emotion-msp-dim2022-04-06464K · 174 likesClassificationast-finetuned-audioset-10-MIT/ast-finetuned-audioset-10-10-0.45932022-11-141M · 372 likesASRwhisper-large-v2openai/whisper-large-v22022-12-0579K · 1,810 likesVADsegmentation-3.0pyannote/segmentation-3.02023-09-225.4M · 2,066 likesTTSXTTS-v2coqui/XTTS-v22023-10-316.7M · 3,845 likesASRwhisper-large-v3openai/whisper-large-v32023-11-074.2M · 6,535 likesASRspeaker-diarization-3.1pyannote/speaker-diarization-3.12023-11-167.2M · 4,071 likesText-to-audiostable-audio-open-1.0stabilityai/stable-audio-open-1.02024-05-2421K · 1,676 likesText-to-audioChatTTS2Noise/ChatTTS2024-05-252.4K · 1,672 likesAudio-text-to-textQwen2-Audio-7BQwen/Qwen2-Audio-7B-Instruct2024-07-31300K · 560 likesASRwhisper-large-v3-turboopenai/whisper-large-v3-turbo2024-10-016.4M · 3,410 likesAudio-to-audiofish-agent-v0.1fishaudio/fish-agent-v0.1-3b2024-10-2959 · 276 likesTTSKokoro-82Mhexgrad/Kokoro-82M2024-12-2611.4M · 7,105 likesAudio-text-to-textStep-Audio-Chatstepfun-ai/Step-Audio-Chat2025-02-13336 · 461 likesASRPhi-4-multimodalmicrosoft/Phi-4-multimodal-instruct2025-02-24259K · 1,615 likesTTSCSM-1Bsesame/csm-1b2025-03-06137K · 2,464 likesASRspeaker-diarization-communpyannote/speaker-diarization-community-12025-04-155.5M · 2,423 likesASRparakeet-tdt-0.6b-v2nvidia/parakeet-tdt-0.6b-v22025-04-15183K · 1,549 likesTTSDia-1.6Bnari-labs/Dia-1.6B2025-04-2028K · 2,914 likesAudio-text-to-textVoxtral-Small-24B-2507mistralai/Voxtral-Small-24B-25072025-07-0124K · 529 likesTTSVibeVoicemicrosoft/VibeVoice-1.5B2025-08-25726K · 2,488 likesAudio-to-audioLFM2-AudioLiquidAI/LFM2-Audio-1.5B2025-08-28366 · 364 likesVADsmart-turn-v3pipecat-ai/smart-turn-v32025-09-110 · 207 likesAudio-to-audioLFM2.5-AudioLiquidAI/LFM2.5-Audio-1.5B2025-12-183.3K · 466 likesAudio-to-audiopersonaplex-7b-v1nvidia/personaplex-7b-v12025-12-31186K · 2,779 likesASRVibeVoice-ASRmicrosoft/VibeVoice-ASR2026-01-21728K · 1,302 likesAudio-text-to-textMOSS-Transcribe-DiarizeOpenMOSS-Team/MOSS-Transcribe-Diarize2026-05-19225K · 456 likesText-to-audioMiniMax-Music3MiniMaxAI/MiniMax-Music32026-08-078.3K · 1,419 likesVADNemotron-3-Diarizationnvidia/Nemotron-3-Diarization2026-09-0144K · 625 likesText-to-audioYuE2m-a-p/YuE2-3B2026-09-0932K · 1,061 likesASRAudio8-ASR-InfiniteEdge0/Audio8-ASR-Infinite2026-09-2137K · 2,403 likes
2023202420252026
Table view — every figure on this page
Every figure on this page, as text.
TaskModelsShareLast 12moPrior 12moGrowthLandmarks
ASR36,98566.2%11,2956,6671.69×52
TTS8,10214.5%4,6241,3603.40×54
Classification5,0249.0%1,4949281.61×52
Text-to-audio3,5166.3%1,0691,2510.85×52
Audio-to-audio1,5732.8%7071863.80×52
Audio-text-to-text3840.7%2551192.14×25
VAD3030.5%199543.69×20