Hugging Face Hub · seven audio pipeline tags
The State of Open Source Audio
as of 2026-10-03
What open audio is made of
Every public model repo carrying one of the seven audio tags. Pick a
field to follow it through the rest of the page.
ASR66% TTS14%
ASR TTS Classification Text-to-audio Audio-to-audio Audio-text-to-text VAD
show all
New models per month, by field
Stacked, so the column height is all of open audio and each band is one
field. ASR sets the scale; the fields moving fastest are underneath it.
0 1,000 2,000 3,000 2023 2024 2025 2026 Apr 2022 ASR 249 TTS 18 Classification 10 Text-to-audio 0 Audio-to-audio 8 Audio-text-to-text 0 VAD 2 all audio 287 May 2022 ASR 350 TTS 11 Classification 13 Text-to-audio 0 Audio-to-audio 0 Audio-text-to-text 0 VAD 0 all audio 374 Jun 2022 ASR 235 TTS 6 Classification 16 Text-to-audio 0 Audio-to-audio 5 Audio-text-to-text 0 VAD 0 all audio 262 Jul 2022 ASR 1,230 TTS 1 Classification 16 Text-to-audio 0 Audio-to-audio 2 Audio-text-to-text 0 VAD 0 all audio 1,249 Aug 2022 ASR 149 TTS 4 Classification 16 Text-to-audio 0 Audio-to-audio 0 Audio-text-to-text 0 VAD 0 all audio 169 Sep 2022 ASR 169 TTS 9 Classification 14 Text-to-audio 0 Audio-to-audio 2 Audio-text-to-text 0 VAD 0 all audio 194 Oct 2022 ASR 171 TTS 8 Classification 23 Text-to-audio 0 Audio-to-audio 50 Audio-text-to-text 0 VAD 2 all audio 254 Nov 2022 ASR 409 TTS 6 Classification 21 Text-to-audio 0 Audio-to-audio 0 Audio-text-to-text 0 VAD 2 all audio 438 Dec 2022 ASR 1,124 TTS 4 Classification 11 Text-to-audio 12 Audio-to-audio 2 Audio-text-to-text 0 VAD 0 all audio 1,153 Jan 2023 ASR 295 TTS 9 Classification 7 Text-to-audio 1 Audio-to-audio 9 Audio-text-to-text 0 VAD 0 all audio 321 Feb 2023 ASR 427 TTS 7 Classification 40 Text-to-audio 0 Audio-to-audio 3 Audio-text-to-text 0 VAD 0 all audio 477 Mar 2023 ASR 451 TTS 7 Classification 57 Text-to-audio 1 Audio-to-audio 1 Audio-text-to-text 0 VAD 1 all audio 518 Apr 2023 ASR 351 TTS 11 Classification 60 Text-to-audio 13 Audio-to-audio 8 Audio-text-to-text 0 VAD 3 all audio 446 May 2023 ASR 461 TTS 17 Classification 76 Text-to-audio 37 Audio-to-audio 9 Audio-text-to-text 0 VAD 0 all audio 600 Jun 2023 ASR 413 TTS 13 Classification 111 Text-to-audio 66 Audio-to-audio 21 Audio-text-to-text 0 VAD 3 all audio 627 Jul 2023 ASR 498 TTS 76 Classification 254 Text-to-audio 92 Audio-to-audio 24 Audio-text-to-text 0 VAD 2 all audio 946 Aug 2023 ASR 1,144 TTS 102 Classification 213 Text-to-audio 73 Audio-to-audio 66 Audio-text-to-text 0 VAD 0 all audio 1,598 Sep 2023 ASR 675 TTS 1,163 Classification 131 Text-to-audio 50 Audio-to-audio 98 Audio-text-to-text 0 VAD 3 all audio 2,120 Oct 2023 ASR 908 TTS 22 Classification 74 Text-to-audio 54 Audio-to-audio 20 Audio-text-to-text 0 VAD 2 all audio 1,080 Nov 2023 ASR 579 TTS 33 Classification 97 Text-to-audio 33 Audio-to-audio 13 Audio-text-to-text 0 VAD 1 all audio 756 Dec 2023 ASR 655 TTS 50 Classification 96 Text-to-audio 40 Audio-to-audio 19 Audio-text-to-text 0 VAD 0 all audio 860 Jan 2024 ASR 676 TTS 31 Classification 176 Text-to-audio 62 Audio-to-audio 17 Audio-text-to-text 0 VAD 1 all audio 963 Feb 2024 ASR 622 TTS 39 Classification 127 Text-to-audio 53 Audio-to-audio 16 Audio-text-to-text 0 VAD 3 all audio 860 Mar 2024 ASR 596 TTS 52 Classification 156 Text-to-audio 44 Audio-to-audio 28 Audio-text-to-text 0 VAD 1 all audio 877 Apr 2024 ASR 746 TTS 47 Classification 155 Text-to-audio 124 Audio-to-audio 19 Audio-text-to-text 0 VAD 3 all audio 1,094 May 2024 ASR 996 TTS 27 Classification 162 Text-to-audio 125 Audio-to-audio 17 Audio-text-to-text 0 VAD 0 all audio 1,327 Jun 2024 ASR 946 TTS 26 Classification 136 Text-to-audio 147 Audio-to-audio 38 Audio-text-to-text 1 VAD 0 all audio 1,294 Jul 2024 ASR 911 TTS 33 Classification 147 Text-to-audio 69 Audio-to-audio 41 Audio-text-to-text 3 VAD 4 all audio 1,208 Aug 2024 ASR 342 TTS 28 Classification 54 Text-to-audio 36 Audio-to-audio 49 Audio-text-to-text 2 VAD 2 all audio 513 Sep 2024 ASR 456 TTS 31 Classification 44 Text-to-audio 56 Audio-to-audio 28 Audio-text-to-text 4 VAD 4 all audio 623 Oct 2024 ASR 519 TTS 51 Classification 50 Text-to-audio 137 Audio-to-audio 5 Audio-text-to-text 5 VAD 1 all audio 768 Nov 2024 ASR 610 TTS 65 Classification 76 Text-to-audio 140 Audio-to-audio 24 Audio-text-to-text 11 VAD 3 all audio 929 Dec 2024 ASR 581 TTS 102 Classification 76 Text-to-audio 92 Audio-to-audio 5 Audio-text-to-text 7 VAD 3 all audio 866 Jan 2025 ASR 473 TTS 95 Classification 85 Text-to-audio 132 Audio-to-audio 35 Audio-text-to-text 5 VAD 2 all audio 827 Feb 2025 ASR 587 TTS 78 Classification 93 Text-to-audio 106 Audio-to-audio 21 Audio-text-to-text 12 VAD 2 all audio 899 Mar 2025 ASR 660 TTS 264 Classification 74 Text-to-audio 100 Audio-to-audio 14 Audio-text-to-text 8 VAD 2 all audio 1,122 Apr 2025 ASR 584 TTS 178 Classification 86 Text-to-audio 96 Audio-to-audio 11 Audio-text-to-text 9 VAD 3 all audio 967 May 2025 ASR 619 TTS 103 Classification 99 Text-to-audio 165 Audio-to-audio 12 Audio-text-to-text 17 VAD 2 all audio 1,017 Jun 2025 ASR 575 TTS 89 Classification 70 Text-to-audio 91 Audio-to-audio 13 Audio-text-to-text 8 VAD 1 all audio 847 Jul 2025 ASR 491 TTS 110 Classification 71 Text-to-audio 97 Audio-to-audio 8 Audio-text-to-text 18 VAD 4 all audio 799 Aug 2025 ASR 485 TTS 108 Classification 70 Text-to-audio 49 Audio-to-audio 17 Audio-text-to-text 11 VAD 0 all audio 740 Sep 2025 ASR 483 TTS 117 Classification 78 Text-to-audio 46 Audio-to-audio 21 Audio-text-to-text 8 VAD 31 all audio 784 Oct 2025 ASR 336 TTS 96 Classification 129 Text-to-audio 74 Audio-to-audio 25 Audio-text-to-text 19 VAD 3 all audio 682 Nov 2025 ASR 431 TTS 97 Classification 128 Text-to-audio 34 Audio-to-audio 11 Audio-text-to-text 5 VAD 3 all audio 709 Dec 2025 ASR 619 TTS 180 Classification 78 Text-to-audio 48 Audio-to-audio 33 Audio-text-to-text 5 VAD 4 all audio 967 Jan 2026 ASR 414 TTS 204 Classification 44 Text-to-audio 43 Audio-to-audio 37 Audio-text-to-text 12 VAD 8 all audio 762 Feb 2026 ASR 668 TTS 266 Classification 84 Text-to-audio 78 Audio-to-audio 30 Audio-text-to-text 10 VAD 22 all audio 1,158 Mar 2026 ASR 840 TTS 368 Classification 112 Text-to-audio 72 Audio-to-audio 72 Audio-text-to-text 8 VAD 13 all audio 1,485 Apr 2026 ASR 1,224 TTS 481 Classification 144 Text-to-audio 75 Audio-to-audio 45 Audio-text-to-text 28 VAD 14 all audio 2,011 May 2026 ASR 1,634 TTS 663 Classification 114 Text-to-audio 199 Audio-to-audio 95 Audio-text-to-text 21 VAD 15 all audio 2,741 Jun 2026 ASR 1,221 TTS 498 Classification 159 Text-to-audio 98 Audio-to-audio 64 Audio-text-to-text 21 VAD 23 all audio 2,084 Jul 2026 ASR 1,317 TTS 496 Classification 130 Text-to-audio 108 Audio-to-audio 107 Audio-text-to-text 20 VAD 18 all audio 2,196 Aug 2026 ASR 1,167 TTS 617 Classification 181 Text-to-audio 130 Audio-to-audio 113 Audio-text-to-text 38 VAD 24 all audio 2,270 Sep 2026 ASR 1,424 TTS 658 Classification 191 Text-to-audio 110 Audio-to-audio 75 Audio-text-to-text 68 VAD 52 all audio 2,578 Oct 2026 ASR 84 TTS 64 Classification 12 Text-to-audio 8 Audio-to-audio 6 Audio-text-to-text 0 VAD 6 all audio 180
The current month is partial — 3 of
31 days.
Each field on its own scale
A shared axis would flatten six of these into nothing: ASR is 130× VAD.
Each sparkline is scaled to its own field, so what you compare is shape, not size.
Growth is the last 12 months against the 12 before.
Who ships what the field actually uses
A contribution grid weighted by engagement, not output: labs ranked by
the likes their audio models have earned, months across, darker where a month's releases
landed. Counting repos instead would rank format converters and checkpoint farms above
every research lab — openai earns 14K likes from 8 models
while facebook earns 5.9K from 110 . Sibling repos are
collapsed into one model, so facebook/mms-tts counts once rather than 1,140
times, one per language. The dot is the field
each lab mostly works in; hover a row for its most-liked model.
The landmarks, all on one timeline
The most-liked release from each field, ringed in its colour. Hover for
the model, click to open it on the Hub.
Table view — every figure on this page