> For the complete documentation index, see [llms.txt](https://langtech-bsc.gitbook.io/alia-kit/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://langtech-bsc.gitbook.io/alia-kit/modelos/modelos-de-voz.md).

# Modelos de Voz

<table data-view="cards"><thead><tr><th>Descripció / Funció</th><th>Nom model</th><th data-type="content-ref">Model card</th><th>Comentaris</th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td>Síntesis de voz (español)</td><td>StyleTTS2 Spanish Multispeaker</td><td><a href="https://huggingface.co/BSC-LT/styletts2-spanish-multispeaker">https://huggingface.co/BSC-LT/styletts2-spanish-multispeaker</a></td><td>Modelo de síntesis de voz expresiva de extremo a extremo que genera automáticamente un estilo de habla adecuado al texto, sin necesidad de una grabación de referencia. Combina difusión de estilos, modelado de duración y entrenamiento adversarial con grandes modelos del habla para producir voces naturales, variadas y de calidad cercana a la humana.</td><td></td></tr><tr><td>Síntesis de voz (catalán)</td><td>StyleTTS2 Catalan Multispeaker</td><td><a href="https://huggingface.co/BSC-LT/styletts2-catalan-multispeaker">https://huggingface.co/BSC-LT/styletts2-catalan-multispeaker</a></td><td>Modelo de síntesis de voz expresiva de extremo a extremo que genera automáticamente un estilo de habla adecuado al texto, sin necesidad de una grabación de referencia. Combina difusión de estilos, modelado de duración y entrenamiento adversarial con grandes modelos del habla para producir voces naturales, variadas y de calidad cercana a la humana.</td><td></td></tr><tr><td>Síntesis de voz (euskera)</td><td>StyleTTS2-eu</td><td><a href="https://huggingface.co/HiTZ/StyleTTS2-eu">https://huggingface.co/HiTZ/StyleTTS2-eu</a></td><td>Modelo de síntesis de voz en euskera basado en la arquitectura <a href="https://github.com/yl4579/StyleTTS2">StyleTTS2</a> y adaptado específicamente a esta lengua. Fue entrenado desde cero con el corpus multihablante <a href="https://zenodo.org/records/17952596">Sonora</a> y permite generar voz en euskera de buena calidad.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_StyleTTS2-Celtia-GL</td><td><a href="https://huggingface.co/proxectonos/Nos_StyleTTS2-Celtia-GL">https://huggingface.co/proxectonos/Nos_StyleTTS2-Celtia-GL</a></td><td>Modelo de síntesis de voz  para gallego, basado en la arquitectura <a href="https://github.com/yl4579/StyleTTS2">StyleTTS2</a> y entrenado con la voz femenina de una única locutora. Integra un sistema nativo de procesamiento del gallego, que utiliza Cotovía para la conversión de grafemas a fonemas (G2P) y <a href="https://huggingface.co/proxectonos/PL-ModernBERT-gl">PL-ModernBERT-gl </a>como codificador lingüístico a nivel fonémico, lo que permite obtener representaciones fonémicas contextualizadas y enriquecidas.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_StyleTTS2-Brais-GL</td><td><a href="https://huggingface.co/proxectonos/Nos_StyleTTS2-Brais-GL">https://huggingface.co/proxectonos/Nos_StyleTTS2-Brais-GL</a></td><td>Modelo de síntesis de voz  para gallego, basado en la arquitectura <a href="https://github.com/yl4579/StyleTTS2">StyleTTS2</a> y entrenado con la voz masculina de un único locutor. Integra un sistema nativo de procesamiento del gallego, que utiliza Cotovía para la conversión de grafemas a fonemas (G2P) y <a href="https://huggingface.co/proxectonos/PL-ModernBERT-gl">PL-ModernBERT-gl </a>como codificador lingüístico a nivel fonémico, lo que permite obtener representaciones fonémicas contextualizadas y enriquecidas.</td><td></td></tr><tr><td>Síntesis de voz (euskera)</td><td>StyleTTS2-eu_emo</td><td><a href="https://huggingface.co/HiTZ/StyleTTS2-eu_emo">https://huggingface.co/HiTZ/StyleTTS2-eu_emo</a></td><td>Modelo de síntesis de voz emocional en euskera basado en la arquitectura <a href="https://github.com/yl4579/StyleTTS2">StyleTTS2</a>. Permite generar habla con tres estilos expresivos: neutro, alegre (poza) y triste (tristura).</td><td></td></tr><tr><td>Síntesis de voz (valenciano)</td><td>StyleTTS2-va</td><td><a href="https://huggingface.co/gplsi/StyleTTS2-va">https://huggingface.co/gplsi/StyleTTS2-va</a></td><td>Modelo de síntesis de voz para la variante valenciana del catalán, adaptado a partir de <a href="https://github.com/yl4579/StyleTTS2">StyleTTS2</a> y entrenado con grabaciones parlamentarias del <a href="https://huggingface.co/datasets/gplsi/corts-valencianes-asr">corpus de las Corts Valencianes</a>.</td><td></td></tr><tr><td>Síntesis de voz (catalán)</td><td>Matxa-TTS v2</td><td><a href="https://huggingface.co/BSC-LT/matxa-tts-v2-ca-central-graphemes">https://huggingface.co/BSC-LT/matxa-tts-v2-ca-central-graphemes</a></td><td>Modelo neuronal multihablante de síntesis de voz en catalán que trabaja a partir de grafemas. En combinación con un vocoder, como 🥑 <a href="https://huggingface.co/projecte-aina/alvocat-vocos-22khz">alVoCat</a> o <a href="https://huggingface.co/BSC-LT/wavenext-mel">Wavenext</a>, permite generar voz expresiva y de alta calidad de forma eficiente.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_TTS-sabela-vits-phonemes</td><td><a href="https://huggingface.co/proxectonos/Nos_TTS-sabela-vits-phonemes">https://huggingface.co/proxectonos/Nos_TTS-sabela-vits-phonemes</a></td><td>Modelo de síntesis de voz en gallego entrenado desde cero utilizando la librería <a href="https://github.com/coqui-ai/TTS">Coqui TTS</a>, a partir del corpus Sabela del dataset <a href="https://zenodo.org/records/8027725">CRPIH_UVigo-GL-Voices</a>.  Trabaja a partir de fonemas, por lo que necesita la herramienta <a href="https://gtm.uvigo.es/en/transfer/software/cotovia">Cotovía</a> para normalizar el texto y generar la transcripción fonética antes de sintetizar la voz.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_TTS-icia-vits-phonemes</td><td><a href="https://huggingface.co/proxectonos/Nos_TTS-icia-vits-phonemes">https://huggingface.co/proxectonos/Nos_TTS-icia-vits-phonemes</a></td><td>Modelo de síntesis de voz en gallego entrenado desde cero utilizando la librería <a href="https://github.com/coqui-ai/TTS">Coqui TTS</a> a partir del corpus Icía del dataset <a href="https://zenodo.org/records/8027725">CRPIH_UVigo-GL-Voices</a>.  Trabaja con fonemas, por lo que requiere la herramienta <a href="https://gtm.uvigo.es/en/transfer/software/cotovia">Cotovía</a> para normalizar el texto y generar la transcripción fonética antes de sintetizar la voz.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_TTS-iago-vits-phonemes</td><td><a href="https://huggingface.co/proxectonos/Nos_TTS-iago-vits-phonemes">https://huggingface.co/proxectonos/Nos_TTS-iago-vits-phonemes</a></td><td>Modelo de síntesis de voz en gallego entrenado desde cero utilizando la librería <a href="https://github.com/coqui-ai/TTS">Coqui TTS</a> a partir del corpus Iago del dataset <a href="https://zenodo.org/records/8027725">CRPIH_UVigo-GL-Voices</a>. Trabaja con fonemas, por lo que requiere la herramienta <a href="https://gtm.uvigo.es/en/transfer/software/cotovia">Cotovía</a> para normalizar el texto y generar la transcripción fonética antes de sintetizar la voz.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_TTS-paulo-vits-phonemes</td><td><a href="https://huggingface.co/proxectonos/Nos_TTS-paulo-vits-phonemes">https://huggingface.co/proxectonos/Nos_TTS-paulo-vits-phonemes</a></td><td>Modelo de síntesis de voz en gallego entrenado desde cero utilizando la librería <a href="https://github.com/coqui-ai/TTS">Coqui TTS</a> a partir del corpus Paulo del dataset <a href="https://zenodo.org/records/8027725">CRPIH_UVigo-GL-Voices</a>. Trabaja con fonemas, por lo que requiere la herramienta <a href="https://gtm.uvigo.es/en/transfer/software/cotovia">Cotovía</a> para normalizar el texto y generar la transcripción fonética antes de sintetizar la voz.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_TTS-celtia-vits-phonemes</td><td><a href="https://huggingface.co/proxectonos/Nos_TTS-celtia-vits-phonemes">https://huggingface.co/proxectonos/Nos_TTS-celtia-vits-phonemes</a></td><td>Modelo de síntesis de voz en gallego entrenado desde cero utilizando la librería <a href="https://github.com/coqui-ai/TTS">Coqui TTS</a> a partir del corpus <a href="https://zenodo.org/record/7716958">Nos_Celtia-GL</a>. Trabaja con fonemas, por lo que requiere la herramienta <a href="https://gtm.uvigo.es/en/transfer/software/cotovia">Cotovía</a> para normalizar el texto y generar la transcripción fonética antes de sintetizar la voz.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos_TTS-brais-vits-phonemes</td><td><a href="https://huggingface.co/proxectonos/Nos_TTS-brais-vits-phonemes">https://huggingface.co/proxectonos/Nos_TTS-brais-vits-phonemes</a></td><td>Modelo de síntesis de voz en gallego entrenado desde cero utilizando la librería <a href="https://github.com/coqui-ai/TTS">Coqui TTS</a> a partir del corpus <a href="https://zenodo.org/records/14265241">Nos_Brais-GL</a>. Trabaja con fonemas, por lo que requiere la herramienta <a href="https://gtm.uvigo.es/en/transfer/software/cotovia">Cotovía</a> para normalizar el texto y generar la transcripción fonética antes de sintetizar la voz.</td><td></td></tr><tr><td>Síntesis de voz (gallego)</td><td>Nos _TTS-brais-vits-graphemes</td><td><a href="https://huggingface.co/proxectonos/Nos_TTS-brais-vits-graphemes">https://huggingface.co/proxectonos/Nos_TTS-brais-vits-graphemes</a></td><td>Modelo de síntesis de voz en gallego entrenado desde cero utilizando la librería <a href="https://github.com/coqui-ai/TTS">Coqui TTS</a> a partir del corpus <a href="https://zenodo.org/records/14265241">Nos_Brais-GL</a>. Trabaja directamente con grafemas, por lo que no necesita transcripción fonética, aunque puede utilizar <a href="https://gtm.uvigo.es/en/transfer/software/cotovia">Cotovía</a> para normalizar el texto de entrada.</td><td></td></tr><tr><td>Síntesis de voz (lenguas ibéricas)</td><td>HiTZ-TTS-Models collection</td><td><a href="https://huggingface.co/collections/HiTZ/tts">https://huggingface.co/collections/HiTZ/tts</a></td><td>Colección de 12 modelos de síntesis de voz en euskera (2), gallego (6), catalán (2), español (2), entrenados para el modelo VITS. Requiere el uso del script de síntesis de <a href="https://github.com/hitz-zentroa/aHoTTS">https://github.com/hitz-zentroa/aHoTTS</a></td><td></td></tr><tr><td>Encoder para síntesis de voz (español)</td><td>ModernBERT-wp-es</td><td><a href="https://huggingface.co/BSC-LT/PL-ModernBERT-wp-es">https://huggingface.co/BSC-LT/PL-ModernBERT-wp-es</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado con texto en español. Combina el enfoque de PL-BERT con una arquitectura ModernBERT y tokenización WordPiece para generar representaciones fonéticas contextualizadas que pueden utilizarse en sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis (español)</td><td>PL-BERT-wp-es</td><td><a href="https://huggingface.co/BSC-LT/PL-BERT-wp-es">https://huggingface.co/BSC-LT/PL-BERT-wp-es</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado con texto en español y distintas variedades regionales. Basado en la <a href="https://github.com/yl4579/PL-BERT">arquitectura PL-BERT</a> y con tokenización WordPiece, genera representaciones fonéticas contextualizadas que pueden utilizarse como codificador en sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis de voz (español)</td><td>PL-BERT-es</td><td><a href="https://huggingface.co/BSC-LT/PL-BERT-es">https://huggingface.co/BSC-LT/PL-BERT-es</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado con texto en español y distintas variedades regionales. Basado en la <a href="https://github.com/yl4579/PL-BERT">arquitectura PL-BERT</a>, genera representaciones fonéticas contextualizadas y puede utilizarse como codificador en sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis de voz (catalán)</td><td>ModernBERT-wp-ca</td><td><a href="https://huggingface.co/BSC-LT/PL-ModernBERT-wp-ca">https://huggingface.co/BSC-LT/PL-ModernBERT-wp-ca</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado exclusivamente con texto fonetizado en catalán y con distintas variedades regionales. Combina el enfoque de PL-BERT con una arquitectura ModernBERT y tokenización WordPiece para generar representaciones fonéticas contextualizadas que pueden utilizarse en sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis de voz (catalán)</td><td>PL-BERT-wp-ca</td><td><a href="https://huggingface.co/BSC-LT/PL-BERT-wp-ca">https://huggingface.co/BSC-LT/PL-BERT-wp-ca</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado exclusivamente con texto  en catalán y distintas variedades regionales. Basado en la <a href="https://github.com/yl4579/PL-BERT">arquitectura PL-BERT</a> y con tokenización WordPiece, genera representaciones fonéticas contextualizadas que pueden utilizarse como codificador en sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis de voz (catalán)</td><td>PL-BERT-ca</td><td><a href="https://huggingface.co/BSC-LT/PL-BERT-ca">https://huggingface.co/BSC-LT/PL-BERT-ca</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado con texto en catalán y distintas variedades regionales. Basado en la <a href="https://github.com/yl4579/PL-BERT">arquitectura PL-BERT</a>, genera representaciones fonéticas contextualizadas y puede utilizarse como codificador en sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis de voz (gallego)</td><td>ModernBERT-gl</td><td><a href="https://huggingface.co/proxectonos/PL-ModernBERT-gl">https://huggingface.co/proxectonos/PL-ModernBERT-gl</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado con texto en gallego. Adapta el enfoque PL-BERT a la arquitectura ModernBERT para generar representaciones fonéticas contextualizadas y actuar como codificador de alta precisión en sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis de voz (euskera)</td><td>PL-BERT-wp-eu</td><td><a href="https://huggingface.co/HiTZ/PL-BERT-wp-eu">https://huggingface.co/HiTZ/PL-BERT-wp-eu</a></td><td>Modelo lingüístico enmascarado a nivel de fonemas, entrenado exclusivamente con texto de la Wikipedia en euskera. Basado en la arquitectura PL-BERT, utiliza un vocabulario reducido de 178 tokens y un tokenizador WordPiece para generar representaciones fonéticas contextualizadas aplicables a sistemas de síntesis de voz como StyleTTS2.</td><td></td></tr><tr><td>Encoder para síntesis de voz (valenciano)</td><td>PL-BERT-va</td><td><a href="https://huggingface.co/gplsi/PL-BERT-va">https://huggingface.co/gplsi/PL-BERT-va</a></td><td>Modelo PL-BERT entrenado para síntesis de voz en valenciano/catalán, diseñado para uso con StyleTTS2</td><td></td></tr></tbody></table>

<table data-view="cards"><thead><tr><th>Descripció / Funció</th><th>Nom model</th><th data-type="content-ref">Model card</th><th>Comentaris</th><th data-hidden data-card-target data-type="content-ref"></th></tr></thead><tbody><tr><td>Representación del habla (español, catalán, gallego, euskera)</td><td>hubert-base-los-2k</td><td><a href="https://huggingface.co/BSC-LT/hubert-base-los-2k">https://huggingface.co/BSC-LT/hubert-base-los-2k</a></td><td>Modelo HuBERT Base preentrenado con 2.000 horas de voz en español, catalán, euskera y gallego. Consta de 12 capas Transformer y genera representaciones del habla útiles para distintas tareas de procesamiento del habla., aunque para reconocimiento automático del habla requiere crear un tokenizador y ajustarlo con datos transcritos.</td><td></td></tr><tr><td>Reconocimiento de voz (español, catalán, gallego, euskera)</td><td>whisper-large-v3-LoS</td><td><a href="https://huggingface.co/BSC-LT/whisper-large-v3-LoS">https://huggingface.co/BSC-LT/whisper-large-v3-LoS</a></td><td>Modelo multilingüe de reconocimiento automático del habla para transcribir español, catalán, gallego y euskera. Está basado en  <a href="https://huggingface.co/openai/whisper-large-v3">openai/whisper-large-v3</a> y fue ajustado con 8.110 horas de audio equilibradas entre las cuatro lenguas para ofrecer un rendimiento comparable y transcripciones de alta calidad.</td><td></td></tr><tr><td>Reconocimiento de voz (español, catalán, gallego, euskera)</td><td>whisper-large-v3-LoS-punctuated</td><td><a href="https://huggingface.co/BSC-LT/whisper-large-v3-LoS-punctuated">https://huggingface.co/BSC-LT/whisper-large-v3-LoS-punctuated</a></td><td>Modelo multilingüe de reconocimiento automático del habla capaz de transcribir audio con puntuación en español, catalán, gallego y euskera. Está basado en <a href="https://huggingface.co/openai/whisper-large-v3">openai/whisper-large-v3</a> y fue ajustado con 8.110 horas de datos equilibrados entre las cuatro lenguas para generar transcripciones precisas, legibles y lingüísticamente consistentes.</td><td></td></tr><tr><td>Reconocimiento de voz (español, catalán, gallego, euskera)</td><td>stt_los_conformer_transducer_large</td><td><a href="https://huggingface.co/BSC-LT/stt_los_conformer_transducer_large">https://huggingface.co/BSC-LT/stt_los_conformer_transducer_large</a></td><td>Mdelo acústico multilingüe de reconocimiento automático del habla para catalán, español, gallego y euskera, basado en <a href="https://huggingface.co/nvidia/stt_es_conformer_transducer_large/">NVIDIA/stt_es_conformer_transducer_large</a>. Cuenta con unos 120 millones de parámetros y fue ajustado con 2.700 horas de audio para generar transcripciones en minúsculas, incluidos espacios.</td><td></td></tr><tr><td>Reconocimiento de voz (español, catalán, gallego, euskera)</td><td>stt_los_conformer_transducer_large_punctuated</td><td><a href="https://huggingface.co/BSC-LT/stt_los_conformer_transducer_large_punctuated">https://huggingface.co/BSC-LT/stt_los_conformer_transducer_large_punctuated</a></td><td>Modelo acústico multilingüe de reconocimiento automático del habla para catalán, español, gallego y euskera, basado en <a href="https://huggingface.co/nvidia/stt_es_conformer_transducer_large/">NVIDIA/stt_es_conformer_transducer_large</a>. Cuenta con unos 120 millones de parámetros y fue ajustado con 2.700 horas de audio para generar transcripciones con puntuación en las cuatro lenguas.</td><td></td></tr><tr><td>Reconocimiento de voz (catalán-español)</td><td>stt_ca-es_conformer_transducer_large</td><td><a href="https://huggingface.co/projecte-aina/stt_ca-es_conformer_transducer_large">https://huggingface.co/projecte-aina/stt_ca-es_conformer_transducer_large</a></td><td>Modelo de reconocimiento de voz derivado de <a href="https://huggingface.co/nvidia/stt_es_conformer_transducer_large">NVIDIA/stt_es_conformer_transducer_large</a>, ajustado mediante un corpus bilingüe catalán-español compuesto por 7.426 horas de audio.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera-español)</td><td>stt_eseu_conformer_transducer_large</td><td><a href="https://huggingface.co/HiTZ/stt_eseu_conformer_transducer_large">https://huggingface.co/HiTZ/stt_eseu_conformer_transducer_large</a></td><td>Modelo acústico bilingüe de reconocimiento automático del habla para español y euskera, capaz de transcribir también habla. Está basado en  <a href="https://huggingface.co/HiTZ/BBS-S2TC_conformer_transducer_large">BBS-S2TC_conformer_transducer_large</a> de unos 119 millones de parámetros y fue ajustado con 1.366,18 horas de audio mediante <a href="https://github.com/NVIDIA-NeMo/Speech">NVIDIA NeMo</a>.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera-español)</td><td>BBS-S2TC_conformer_transducer_large</td><td><a href="https://huggingface.co/HiTZ/BBS-S2TC_conformer_transducer_large">https://huggingface.co/HiTZ/BBS-S2TC_conformer_transducer_large</a></td><td>Modelo acústico de reconocimiento automático del habla en español, ajustado a partir de<a href="https://huggingface.co/HiTZ/stt_eu_conformer_transducer_large"><em>stt_eu_conformer_transducer_large</em></a><em>,</em> previamente entrenado para euskera. Cuenta con unos 119 millones de parámetros y fue afinado con 1.462 horas de audio en español y euskera mediante <a href="https://github.com/NVIDIA-NeMo/Speech">NVIDIA NeMo</a>.</td><td></td></tr><tr><td>Reconocimiento de voz (español)</td><td>ConMamba-small-es</td><td><a href="https://huggingface.co/BSC-LT/ConMamba-small-es">https://huggingface.co/BSC-LT/ConMamba-small-es</a></td><td>Modelo acústico para el reconocimiento automático de voz en español, basado en la arquitectura ConMamba, que combina modelos de espacio de estados con capas convolucionales para mejorar la eficiencia y el rendimiento en tareas de ASR. El modelo  ha sido entrenado con un corpus de 2.788 horas.</td><td></td></tr><tr><td>Reconocimiento de voz (español)</td><td>parakeet-rnnt-1.1b_cv17_es_ep18_1270h</td><td><a href="https://huggingface.co/projecte-aina/parakeet-rnnt-1.1b_cv17_es_ep18_1270h">https://huggingface.co/projecte-aina/parakeet-rnnt-1.1b_cv17_es_ep18_1270h</a></td><td>Modelo acústico derivado de <a href="https://huggingface.co/nvidia/parakeet-rnnt-1.1b">nvidia/parakeet-rnnt-1.1b</a>, optimizado para tareas de reconocimiento automático de voz en español.</td><td></td></tr><tr><td>Reconocimiento de voz (catalán)</td><td>faster-whisper-bsc-large-v3-cat</td><td><a href="https://huggingface.co/BSC-LT/faster-whisper-bsc-large-v3-cat">https://huggingface.co/BSC-LT/faster-whisper-bsc-large-v3-cat</a></td><td>Modelo de reconocimiento de voz, resultado de convertir el modelo <a href="https://huggingface.co/BSC-LT/whisper-bsc-large-v3-cat">whisper-bsc-large-v3-cat </a>en un modelo más ligero con <a href="https://github.com/SYSTRAN/faster-whisper/tree/master">faster-whisper</a>.</td><td></td></tr><tr><td>Reconocimiento de voz (catalán)</td><td>whisper-bsc-large-v3-cat</td><td><a href="https://huggingface.co/BSC-LT/whisper-bsc-large-v3-cat">https://huggingface.co/BSC-LT/whisper-bsc-large-v3-cat</a></td><td>Modelo de reconocimiento de voz en catalán, optimizado a partir del modelo <a href="https://huggingface.co/openai/whisper-large-v3">whisper-large-v3 </a>con 4.700 horas de grabaciones en catalán. El modelo está diseñado para transcribir audio en catalán a texto plano, sin signos de puntuación.</td><td></td></tr><tr><td>Reconocimiento de voz (valenciano)</td><td>faster-whisper-3cat-cv21-valencian</td><td><a href="https://huggingface.co/BSC-LT/faster-whisper-3cat-cv21-valencian">https://huggingface.co/BSC-LT/faster-whisper-3cat-cv21-valencian</a></td><td>Modelo de reconocimiento de voz, resultado de convertir el modelo <a href="https://huggingface.co/BSC-LT/whisper-3cat-cv21-valencian">whisper-3cat-cv21-valencian</a> en un modelo más ligero con <a href="https://github.com/SYSTRAN/faster-whisper/tree/master">faster-whisper</a>.</td><td></td></tr><tr><td>Reconocimiento de voz (valenciano)</td><td>whisper-3cat-cv21-valencian</td><td><a href="https://huggingface.co/BSC-LT/whisper-3cat-cv21-valencian">https://huggingface.co/BSC-LT/whisper-3cat-cv21-valencian</a></td><td>Modelo de reconocimiento de voz en valenciano, optimizado a partir del modelo <a href="https://huggingface.co/openai/whisper-large-v3">whisper-large-v3 </a>con 397 horas y 55 minutos de grabaciones.</td><td></td></tr><tr><td>Reconocimiento de voz (balear)</td><td>faster-whisper-3cat-balearic</td><td><a href="https://huggingface.co/BSC-LT/faster-whisper-3cat-balearic">https://huggingface.co/BSC-LT/faster-whisper-3cat-balearic</a></td><td>Modelo de reconocimiento de voz, resultado de convertir el modelo <a href="https://huggingface.co/BSC-LT/whisper-3cat-balearic">whisper-3cat-balearic</a> en un modelo más ligero con <a href="https://github.com/SYSTRAN/faster-whisper/tree/master">faster-whisper</a>.</td><td></td></tr><tr><td>Reconocimiento de voz (balear)</td><td>whisper-3cat-balearic</td><td><a href="https://huggingface.co/BSC-LT/whisper-3cat-balearic">https://huggingface.co/BSC-LT/whisper-3cat-balearic</a></td><td>Modelo de reconocimiento de voz en balear, optimizado a partir del modelo <a href="https://huggingface.co/openai/whisper-large-v3">whisper-large-v3 </a>con 90 horas de grabaciones.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>stt_eu_conformer_ctc_large</td><td><a href="https://huggingface.co/HiTZ/stt_eu_conformer_ctc_large">https://huggingface.co/HiTZ/stt_eu_conformer_ctc_large</a></td><td>Este modelo realiza la transcripción automática de habla en euskera utilizando el alfabeto vasco en minúsculas, incluyendo la segmentación por espacios. Ha sido entrenado con un conjunto de 548 horas de audio en euskera y posteriormente ajustado a partir del modelo español preentrenado <a href="https://catalog.ngc.nvidia.com/orgs/nvidia/teams/nemo/models/stt_es_conformer_ctc_large?version=1.8.0"><em>stt_es_conformer_ctc_large</em></a> mediante el <a href="https://github.com/NVIDIA-NeMo/NeMo">toolkit Nvidia NeMo</a>. </td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>stt_eu_conformer_transducer_large_v2</td><td><a href="https://huggingface.co/HiTZ/stt_eu_conformer_transducer_large_v2">https://huggingface.co/HiTZ/stt_eu_conformer_transducer_large_v2</a></td><td>Este modelo realiza la transcripción automática de habla en euskera utilizando el alfabeto vasco en minúsculas, incluyendo la segmentación por espacios. Ha sido entrenado con un conjunto de 771,73 horas de audio en euskera y posteriormente ajustado a partir del modelo español preentrenado <a href="https://catalog.ngc.nvidia.com/orgs/nvidia/teams/nemo/models/stt_es_conformer_transducer_large">stt_es_conformer_transducer_large</a> mediante el <a href="https://github.com/NVIDIA-NeMo/NeMo">toolkit Nvidia NeMo</a>. </td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>stt_eu_conformer_transducer_large</td><td><a href="https://huggingface.co/HiTZ/stt_eu_conformer_transducer_large">https://huggingface.co/HiTZ/stt_eu_conformer_transducer_large</a></td><td>Este modelo realiza la transcripción automática de habla en euskera utilizando el alfabeto vasco en minúsculas, incluyendo la segmentación por espacios. Ha sido entrenado con un conjunto de 548 horas de audio en euskera y posteriormente ajustado a partir del modelo español preentrenado <a href="https://catalog.ngc.nvidia.com/orgs/nvidia/teams/nemo/models/stt_es_conformer_transducer_large?version=1.8.0"><em>stt_es_conformer_transducer_large</em></a> utilizando el <a href="https://github.com/NVIDIA-NeMo/NeMo">toolkit Nvidia NeMo</a>. </td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>whisper-base-eu</td><td><a href="https://huggingface.co/HiTZ/whisper-base-eu">https://huggingface.co/HiTZ/whisper-base-eu</a></td><td>Modelo de reconocimiento de voz en euskera. Ha sido ajustado a partir de <a href="https://huggingface.co/openai/whisper-base">openai/whisper-base</a>, utilizando el conjunto de datos en euskera de Mozilla Common Voice 13.0.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>whisper-medium-eu</td><td><a href="https://huggingface.co/HiTZ/whisper-medium-eu">https://huggingface.co/HiTZ/whisper-medium-eu</a></td><td>Modelo de reconocimiento de voz en euskera. Ha sido ajustado a partir de <a href="https://huggingface.co/openai/whisper-medium">openai/whisper-medium</a>, utilizando el conjunto de datos en euskera de Mozilla Common Voice 13.0.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>whisper-small-eu</td><td><a href="https://huggingface.co/HiTZ/whisper-small-eu">https://huggingface.co/HiTZ/whisper-small-eu</a></td><td>Modelo de reconocimiento de voz en euskera. Ha sido ajustado a partir de <a href="https://huggingface.co/openai/whisper-small">openai/whisper-small</a>, utilizando el conjunto de datos en euskera de Mozilla Common Voice 13.0.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>whisper-tiny-eu</td><td><a href="https://huggingface.co/HiTZ/whisper-tiny-eu">https://huggingface.co/HiTZ/whisper-tiny-eu</a></td><td>Modelo de reconocimiento de voz en euskera. Ha sido ajustado a partir de <a href="https://huggingface.co/openai/whisper-tiny">openai/whisper-tiny</a>, utilizando el conjunto de datos en euskera de Mozilla Common Voice 13.0.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>whisper-large-v3-eu</td><td><a href="https://huggingface.co/HiTZ/whisper-large-v3-eu">https://huggingface.co/HiTZ/whisper-large-v3-eu</a></td><td>Modelo de reconocimiento de voz en euskera. Ha sido ajustado a partir de <a href="https://huggingface.co/openai/whisper-large-v3">openai/whisper-large-v3</a>, utilizando el conjunto de datos en euskera de Mozilla Common Voice 13.0.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>whisper-large-v2-eu</td><td><a href="https://huggingface.co/HiTZ/whisper-large-v2-eu">https://huggingface.co/HiTZ/whisper-large-v2-eu</a></td><td>Modelo de reconocimiento de voz en euskera. Ha sido ajustado a partir de <a href="https://huggingface.co/openai/whisper-large-v2">openai/whisper-large-v2</a>, utilizando el conjunto de datos en euskera de Mozilla Common Voice 13.0.</td><td></td></tr><tr><td>Reconocimiento de voz (euskera)</td><td>whisper-large-eu</td><td><a href="https://huggingface.co/HiTZ/whisper-large-eu">https://huggingface.co/HiTZ/whisper-large-eu</a></td><td>Modelo de reconocimiento de voz en euskera. Ha sido ajustado a partir de <a href="https://huggingface.co/openai/whisper-large">openai/whisper-large</a>, utilizando el conjunto de datos en euskera de Mozilla Common Voice 13.0.</td><td></td></tr><tr><td>Reconocimiento de voz (gallego)</td><td>whisper-large-v3-turbo-gl-v1.0</td><td><a href="https://huggingface.co/proxectonos/whisper-large-v3-turbo-gl-v1.0">https://huggingface.co/proxectonos/whisper-large-v3-turbo-gl-v1.0</a></td><td>Modelo de reconocimiento de voz ajustado para transcribir audio en gallego. Está basado en Whisper Large-v3-Turbo y entrenado con corpus de habla gallega para mejorar la precisión de las transcripciones.</td><td></td></tr><tr><td>Reconocimiento de voz (gallego)</td><td>stt_gl_conformer_ctc_large_v1.0</td><td><a href="https://huggingface.co/proxectonos/stt_gl_conformer_ctc_large_v1.0">https://huggingface.co/proxectonos/stt_gl_conformer_ctc_large_v1.0</a></td><td>Modelo de reconocimiento de voz en gallego, basado en la arquitectura Conformer-CTC de NVIDIA y ajustado con corpus públicos de voz. Convierte audios WAV mono de 16 kHz en transcripciones en gallego y también permite obtener marcas temporales por palabra, por lo que puede utilizarse en transcripción, subtitulado y alineación de audio y texto.</td><td></td></tr><tr><td>Reconocimiento de voz (gallego)</td><td>Nos_ASR-wav2vec2-xls-r-300m-gl</td><td></td><td>Modelo de reconocimiento de voz para transcribir audio en gallego. Está basado en Wav2Vec2 XLS-R 300M y ajustado con cinco corpus de voz gallega, entre ellos Common Voice, OpenSLR, FLEURS y Nós ParlaSpeech.</td><td></td></tr><tr><td>Reconocimiento de voz (gallego)</td><td>w2v-bert-2.0-gl</td><td><a href="https://huggingface.co/proxectonos/w2v-bert-2.0-gl">https://huggingface.co/proxectonos/w2v-bert-2.0-gl</a></td><td>Modelo de reconocimiento de voz en gallego ajustado para transcribir audio en gallego. Está basado en W2V-BERT 2.0 y entrenado con varios corpus públicos y seleccionados de habla gallega, incluyendo voz leída, conversacional y contenidos de tipo radiofónico.</td><td></td></tr><tr><td>Diarización de hablantes (español)</td><td>pyannote-segmentation-3.0-RTVE</td><td><a href="https://huggingface.co/HiTZ/pyannote-segmentation-3.0-RTVE">https://huggingface.co/HiTZ/pyannote-segmentation-3.0-RTVE</a></td><td>Tres modelos ajustados, que se combinan mediante <a href="https://github.com/desh2608/dover-lap">DOVER-Lap</a>. Cada modelo ha sido ajustado para optimizar un componente específico de la tasa de error de diarización: falsas alarmas, detecciones omitidas y confusión de hablante. Cada uno de los modelos es una versión afinada de <a href="https://huggingface.co/pyannote/segmentation-3.0"><em>pyannote/segmentation-3.0</em></a> , entrenada sobre la <a href="https://catedrartve.unizar.es/rtvedatabase.html">base de datos de RTVE</a>.</td><td></td></tr><tr><td>Verificación de transcripciones (español)</td><td>spanish-verification-model-pkt-a</td><td><a href="https://huggingface.co/BSC-LT/spanish-verification-model-pkt-a">https://huggingface.co/BSC-LT/spanish-verification-model-pkt-a</a></td><td>Modelo de verificación, basado en <a href="/users/hVFuNmnAkdYh2koa8IfCY68laDI2">nvidia/parakeet-rnnt-1.1b</a> diseñado para evaluar la fiabilidad de transcripciones. Este modelo se usa junto con el modelo <a href="https://huggingface.co/BSC-LT/spanish-verification-model-pkt-b">spanish-verification-model-pkt-b</a> para realizar verificación cruzada y aumentar la confianza en las transcripciones.</td><td></td></tr><tr><td>Verificación de transcripciones (español)</td><td>spanish-verification-model-pkt-b</td><td><a href="https://huggingface.co/BSC-LT/spanish-verification-model-pkt-b">https://huggingface.co/BSC-LT/spanish-verification-model-pkt-b</a></td><td>Modelo de verificación, basado en <a href="/users/hVFuNmnAkdYh2koa8IfCY68laDI2">nvidia/parakeet-rnnt-1.1b</a> diseñado para evaluar la fiabilidad de transcripciones. Este modelo se usa junto con el modelo <a href="https://huggingface.co/nvidia/parakeet-rnnt-1.1b">spanish-verification-model-pkt-a</a> para realizar verificación cruzada y aumentar la confianza en las transcripciones.</td><td></td></tr><tr><td>Verificación de transcripciones (español)</td><td>spanish-verification-model-pkt-c</td><td><a href="https://huggingface.co/BSC-LT/spanish-verification-model-pkt-c">https://huggingface.co/BSC-LT/spanish-verification-model-pkt-c</a></td><td>Modelo de verificación, basado en <a href="/users/hVFuNmnAkdYh2koa8IfCY68laDI2">nvidia/parakeet-rnnt-1.1b</a> diseñado para evaluar la fiabilidad de transcripciones. Este modelo se usa junto con el modelo <a href="https://huggingface.co/BSC-LT/spanish-verification-model-pkt-d">spanish-verification-model-pkt-d</a> para realizar verificación cruzada y aumentar la confianza en las transcripciones.</td><td></td></tr><tr><td>Verificación de transcripciones (español)</td><td>spanish-verification-model-pkt-d</td><td><a href="https://huggingface.co/BSC-LT/spanish-verification-model-pkt-d">https://huggingface.co/BSC-LT/spanish-verification-model-pkt-d</a></td><td>Modelo de verificación, basado en <a href="/users/hVFuNmnAkdYh2koa8IfCY68laDI2">nvidia/parakeet-rnnt-1.1b</a> diseñado para evaluar la fiabilidad de transcripciones. Este modelo se usa junto con el modelo <a href="https://huggingface.co/BSC-LT/spanish-verification-model-pkt-c">spanish-verification-model-pkt-c</a> para realizar verificación cruzada y aumentar la confianza en las transcripciones.</td><td></td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://langtech-bsc.gitbook.io/alia-kit/modelos/modelos-de-voz.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
