For the complete documentation index, see llms.txt. This page is also available as Markdown.

🗣️Models de parla

Descripció / Funció

Reconeixement de la parla

Nom model

whisper-timestamped-cs

Comentaris

Model acústic per al reconeixement automàtic de la parla en contextos d’alternança de parla entre el castellà i el català. És el resultat de l’afinament del model openai/whisper-large-v3 amb BSC-LT/CAESAR-TINY, un conjunt de dades de dues hores amb parla alternada en castellà i català.

Descripció / Funció

Reconeixement de la parla

Nom model

ConMamba-small-ca

Comentaris

Model acústic per al reconeixement automàtic de la parla en català, basat en l’arquitectura ConMamba, que combina models d’espai d’estats amb capes convolucionals per millorar l’eficiència i el rendiment en tasques d’ASR. El model ha estat entrenat amb un corpus de 4.929 hores.

Descripció / Funció

Síntesi de la parla (multiparlant)

Nom model

matxa-tts-v2-ca-central-graphemes

Comentaris

Model neuronal de text a veu (TTS) multiparlant en català que treballa amb grafemes. Funciona conjuntament amb un model de vocoder per generar veu expressiva i d’alta qualitat de manera eficient. Es pot utilitzar amb qualsevol vocoder, com ara 🥑 alVoCat o Wavenext.

Descripció / Funció

Reconeixement de la parla

Nom model

whisper-large-v3-ca-punctuated-3370h

Comentaris

Model per al reconeixement automàtic de la parla en català, optimitzat a partir del model whisper-large-v3 amb 4.700 hores d’enregistraments en català. Entrenat amb dades acuradament transcrites, que inclouen puntuació i majúscules, el model genera transcripcions estructurades i llegibles, superant els models estàndard de reconeixement de la parla.

Descripció / Funció

Reconeixement de la parla

Nom model

faster-whisper-large-v3-ca-punctuated-3370h

Comentaris

Model de reconeixement de la parla, resultat de convertir el model whisper-large-v3-ca-punctuated-3370 a un model més lleuger amb faster-whisper.

Descripció / Funció

Reconeixement de la parla

Nom model

whisper-bsc-large-v3-cat

Comentaris

Model per al reconeixement automàtic de la parla en català, optimitzat a partir del model whisper-large-v3 amb 4.700 hores d’enregistraments en català. El model està dissenyat per transcriure àudio en català a text pla, sense signes de puntuació.

Descripció / Funció

Reconeixement de la parla

Nom model

faster-whisper-bsc-large-v3-cat

Comentaris

Model de reconeixement de la parla, resultat de convertir el model whisper-bsc-large-v3-cat a un model més lleuger amb faster-whisper.

Descripció / Funció

Reconeixement de la parla

Nom model

hubert-base-ca-2k

Comentaris

Model HuBERT Base preentrenat amb 1.778 hores de registre de veu en català. Manté la mateixa arquitectura que el model hubert-base-ls960 original.

Descripció / Funció

Síntesi de la parla (multiparlant i multidialectal)

Nom model

Matxa-TTS Catalan Multiaccent

Comentaris

Model de síntesi de la parla multiparlant i multidialectal (balear, central, nord-occidental i valencià) entrenat amb el conjunt de dades LaFrescat.

Descripció / Funció

Síntesi de la parla (multiparlant)

Nom model

Matxa-TTS Catalan Multispeaker

Comentaris

Model de síntesi de parla multiparlant entrenat amb els conjunts de dades Festcat i OpenSLR69.

Descripció / Funció

Síntesi de la parla

Nom model

alvocat-vocos-22khz

Comentaris

Codificador de veu per a la síntesi de la parla en català a partir d'espectrogrames de mel basat en l'arquitectura Vocos entrenat amb els conjunts de dades Festcat, OpenSLR69 i LaFrescat.

Descripció / Funció

Reconeixement de la parla (bilingüe)

Nom model

stt_ca-es_conformer_transducer_large

Comentaris

Model de reconeixement de la parla derivat de NVIDIA/stt_es_conformer_transducer_large i ajustat amb un corpus bilingüe català-castellà de 7.426 hores d'àudio

Descripció / Funció

Reconeixement de la parla

Nom model

whisper-large-v3-tiny-caesar

Comentaris

Model de reconeixement de la parla derivat del model whisper-large-v3, optimitzat per al reconeixement automàtic de la parla en contextos de canvi de codi entre català i castellà.

Descripció / Funció

Reconeixement de la parla

Nom model

faster-whisper-large-v3-ca-3catparla

Comentaris

Model de reconeixement de la parla, resultat de convertir el model whisper-large-v3-ca-3catparla a un model més lleuger amb faster-whisper.

Descripció / Funció

Reconeixement de la parla

Nom model

catalan-verification-model-pkt-a

Comentaris

Model acústic basat en nvidia/parakeet-rnnt-1.1b i dissenyat per al reconeixement automàtic de la parla en català. Està pensat per utilitzar-se conjuntament amb el model catalan-verification-model-pkt-b, amb l’objectiu de facilitar la verificació creuada i incrementar la fiabilitat de les transcripcions en contextos sense anotació o amb supervisió feble.

Descripció / Funció

Reconeixement de la parla

Nom model

catalan-verification-model-pkt-b

Comentaris

Model acústic basat en nvidia/parakeet-rnnt-1.1b i dissenyat per al reconeixement automàtic de la parla en català. Està pensat per utilitzar-se conjuntament amb el model catalan-verification-model-pkt-a, amb l’objectiu de facilitar la verificació creuada i incrementar la fiabilitat de les transcripcions en contextos sense anotació o amb supervisió feble.

Last updated