AI Tools.

Search

text to speech by k2-fsa

OmniVoice

OmniVoice from k2-fsa is a multilingual speech model targeting end-to-end ASR and voice processing tasks. Published as part of the k2/Lhotse/sherpa-onnx ecosystem for server and edge speech applications.

Summary text generated by an automated pipeline from the model card · Not individually reviewed or run by us · How this page is made

From the model card

Fields below are copied from the tags and counters on the HuggingFace repository k2-fsa/OmniVoice at our last fetch. They are set by the uploader, not verified by us; rows with no tag are omitted. How this page is made.

Publisher (HF namespace)
k2-fsa
Pipeline tag
text-to-speech
Framework tags
JAX
Weight formats
safetensors
Lineage
Language tags
multilingual; Abkhazian (ab), Adyghe (ady), Tunisian Arabic (aeb), Afrikaans (af), Judeo-Arabic (aju), Gheg Albanian (aln), Amharic (am), Aragonese (an), Angika (anp), Arabic (arb), Algerian Arabic (arq), Najdi Arabic (ars), Moroccan Arabic (ary), Egyptian Arabic (arz), Assamese (as), Asturian (ast), Azerbaijani (az), Bashkir (ba), Basaa (bas), Bamun (bax), Ghomala (bbj), Belarusian (be), Betawi (bew), Bafut (bfd), Bulgarian (bg), Bhojpuri (bho), Banjar (bjn), Kom (bkm), Bangla (bn), Tibetan (bo), Breton (br), Braj (bra), Brahui (brh), Bodo (brx), Bosnian (bs), Buginese (bug), Bulu (bum), Medumba (byv), Catalan (ca), Cebuano (ceb), Chiga (cgg), Central Kurdish (ckb), Czech (cs), Chuvash (cv), Welsh (cy), Danish (da), Dargwa (dar), Taita (dav), German (de), Dogri (dgo), Zarma (dje), Duala (dua), Divehi (dv), Dyula (dyu), Dazaga (dzg), Embu (ebu), Greek (el), English (en), Esperanto (eo), Spanish (es), Central Yupik (esu), Estonian (et), Basque (eu), Ewondo (ewo), Extremaduran (ext), Persian (fa), Fang (fan), Akan (fat), Fula (ff), Finnish (fi), Filipino (fil), French (fr), Fula (fuc), Western Frisian (fy), Irish (ga), Galician (gl), Guarani (gn), Konkani (gom), Gujarati (gu), Frafra (gur), Gusii (guz), Manx (gv), Gbaya (gya), Hausa (ha), Hawaiian (haw), Hebrew (he), Hindi (hi), Croatian (hr), Upper Sorbian (hsb), Haitian Creole (ht), Hungarian (hu), Armenian (hy), Herero (hz), Interlingua (ia), Ibibio (ibb), Indonesian (id), Igbo (ig), Inupiaq (ik), Icelandic (is), Italian (it), Japanese (ja), Ngomba (jgo), Javanese (jv), Georgian (ka), Kabyle (kab), Jju (kaj), Kamba (kam), Kabardian (kbd), Kanembu (kbl), Kabuverdianu (kea), Khowar (khw), Kuanyama (kj), Kazakh (kk), Kalenjin (kln), Khmer (km), Kurdish (kmr), Kannada (kn), Korean (ko), Kashmiri (ks), Bafia (ksf), Cornish (kw), Kyrgyz (ky), Langi (lag), Luxembourgish (lb), Ganda (lg), Ligurian (lij), Lingala (ln), Lao (lo), Lithuanian (lt), Latgalian (ltg), Luba-Lulua (lua), Luo (luo), Mizo (lus), Latvian (lv), Mafa (maf), Maithili (mai), Maba (mde), Moksha (mdf), Meru (mer), Mari (mhr), Māori (mi), Macedonian (mk), Malayalam (ml), Mongolian (mn), Manipuri (mni), Marathi (mr), Western Mari (mrj), Malay (ms), Maltese (mt), Mundang (mua), Burmese (my), Erzya (myv), Min Nan Chinese (nan), Neapolitan (nap), Norwegian Bokmål (nb), Ndonga (ng), Dutch (nl), Kwasio (nmg), Norwegian Nynorsk (nn), Ngiemboon (nnh), Norwegian (no), Nepali (npi), Northern Sotho (nso), Nyanja (ny), Occitan (oc), Oromo (om), Odia (ory), Ossetic (os), Punjabi (pa), Pashto (pbu), Nigerian Pidgin (pcm), Polish (pl), Malagasy (plt), Piedmontese (pms), Western Panjabi (pnb), Pashto (ps), Portuguese (pt), Chimborazo Highland Quichua (qug), Romansh (rm), Romanian (ro), Rombo (rof), Russian (ru), Aromanian (rup), Kinyarwanda (rw), Sanskrit (sa), Yakut (sah), Santali (sat), Sardinian (sc), Sicilian (scn), Sindhi (sd), Seri (sei), Chadian Arabic (shu), Sinhala (si), Slovak (sk), Slovenian (sl), Shona (sn), Soninke (snk), Somali (so), Albanian (sq), Serbian (sr), Sardinian (src), Swedish (sv), Swahili (sw), Tamil (ta), Tulu (tcy), Telugu (te), Tajik (tg), Thai (th), Tigrinya (ti), Tigre (tig), Turkmen (tk), Tlingit (tli), Tswana (tn), Toki Pona (tok), Turkish (tr), Taroko (trv), Torwali (trw), Tatar (tt), Akan (tw), Uyghur (ug), Ukrainian (uk), Umbundu (umb), Urdu (ur), Uzbek (uz), Uzbek (uzn), Vai (vai), Vietnamese (vi), Votic (vot), Võro (vro), Wolof (wo), Xhosa (xh), Mingrelian (xmf), Kpelle (xpe), Yangben (yav), Yiddish (ydd), Yiddish (yi), Yoruba (yo), Cantonese (yue), Standard Moroccan Tamazight (zgh), Chinese (zh), Zulu (zu), Zaza (zza)
Papers cited
arXiv:2604.00688
Downloads (HF counter at last fetch)
1,013,539
Likes (HF counter at last fetch)
1,334
Model card
https://huggingface.co/k2-fsa/OmniVoice

Use cases

  • Multilingual ASR in sherpa-onnx based applications
  • Speech recognition for embedded and edge deployment
  • Integration into k2/icefall training pipelines
  • Building multilingual speech interfaces without per-language models

Pros

  • Integrates with the sherpa-onnx ecosystem for production deployment
  • Multilingual coverage reduces per-language model management
  • Compatible with k2 training infrastructure for fine-tuning
  • Designed for edge deployment via ONNX runtime

Cons

  • Limited documentation outside the k2-fsa ecosystem
  • Benchmark comparisons against Whisper or SeamlessM4T not published
  • k2 framework has a steep learning curve for newcomers
  • License and training data details underdocumented

Tags

omnivoicesafetensorszero-shotmultilingualvoice-cloningvoice-designtext-to-speechaaeaalaaoababbabnabrabsabvacmacwacxadf