> For the complete documentation index, see [llms.txt](https://langtech-bsc.gitbook.io/alia-kit/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://langtech-bsc.gitbook.io/alia-kit/modelos/modelos-de-texto.md).

# Modelos de texto

### Modelos generativos base

<table data-view="cards" data-full-width="false"><thead><tr><th>Descripción / Función</th><th>Nombre modelo</th><th>Model card</th><th>Comentarios</th></tr></thead><tbody><tr><td>LLM (multilingüe)</td><td>salamandra-7b</td><td><a href="https://huggingface.co/BSC-LT/salamandra-7b">https://huggingface.co/BSC-LT/salamandra-7b</a></td><td>Modelo generativo multilingüe, entrenado desde cero en 35 idiomas europeos, con 8.000 millones de parámetros y 12,875 billones de tokens.</td></tr><tr><td>LLM (multilingüe)</td><td>salamandra-2b</td><td><a href="https://huggingface.co/BSC-LT/salamandra-2b">https://huggingface.co/BSC-LT/salamandra-2b</a></td><td>Modelo generativo multilingüe, entrenado desde cero en 35 idiomas europeos, con 2.000 millones de parámetros y 12,875 billones de tokens.</td></tr><tr><td>LLM (gallego, portugués, español, catalán, inglés)</td><td>Llama-3.1-Carballo</td><td><a href="https://huggingface.co/proxectonos/Llama-3.1-Carballo">https://huggingface.co/proxectonos/Llama-3.1-Carballo</a></td><td>Modelo de 8.000 millones de parámetros, diseñado para gallego, portugués, español, catalán e inglés. Es el resultado de un preentrenamiento continuo del modelo <a href="https://huggingface.co/meta-llama/Llama-3.1-8B">meta-llama/Llama-3.1-8B</a> con un corpus multilingüe de casi 20.000 millones de tokens, con especial énfasis en textos en gallego.</td></tr><tr><td>LLM (gallego, portugués, español, catalán, inglés)</td><td>Carballo-Llama-Instr3</td><td><a href="https://huggingface.co/proxectonos/Llama-3.1-Carballo-Instr3">https://huggingface.co/proxectonos/Llama-3.1-Carballo-Instr3</a></td><td>Modelo de 8.000 millones de parámetros para gallego, portugués, español, inglés y catalán. Está basado en <a href="https://huggingface.co/meta-llama/Llama-3.1-8B">meta-llama/Llama-3.1-8B</a> y ha sido adaptado mediante preentrenamiento continuo con un corpus multilingüe de 340 millones de tokens, con especial énfasis en el gallego.</td></tr><tr><td>LLM (gallego, portugués, español, inglés)</td><td>Llama-Carvalho-PT-GL</td><td><a href="https://huggingface.co/Nos-PT/Llama-Carvalho-PT-GL">https://huggingface.co/Nos-PT/Llama-Carvalho-PT-GL</a></td><td>Modelo de 8.000 millones de parámetros para gallego, portugués, español e inglés. Está basado en  <a href="https://huggingface.co/meta-llama/Llama-3.1-8B">meta-llama/Llama-3.1-8B</a> y ha sido adaptado mediante preentrenamiento continuo con un corpus multilingüe de 540 millones de tokens de texto y 72 millones de tokens de instrucciones.</td></tr><tr><td>LLM (euskera)</td><td>Latxa 3.1 8B</td><td><a href="https://huggingface.co/HiTZ/Latxa-Llama-3.1-8B">https://huggingface.co/HiTZ/Latxa-Llama-3.1-8B</a></td><td>Modelo de lenguaje basado en Llama 3.1 y adaptado específicamente al euskera. Ha sido entrenado mediante técnicas de adaptación lingüística con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.</td></tr><tr><td>LLM (valenciano, español, inglés)</td><td>Aitana-7B-S-base</td><td><a href="https://huggingface.co/gplsi/Aitana-7B-S-base">https://huggingface.co/gplsi/Aitana-7B-S-base</a></td><td>Modelo de lenguaje generativo entrenado a partir de <a href="https://huggingface.co/BSC-LT/salamandra-7b">BSC-LT/salamandra-7b</a> utilizando datos en valenciano, español e inglés.</td></tr><tr><td>LLM (valenciano, español, inglés)</td><td>Aitana-2B-S-base</td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S-base">https://huggingface.co/gplsi/Aitana-2B-S-base</a></td><td>Modelo de lenguaje generativo entrenado a partir de <a href="https://huggingface.co/BSC-LT/salamandra-2b">salamandra-2b</a>, utilizando datos en valenciano, español e inglés.</td></tr><tr><td>LLM (valenciano)</td><td>Aitana-2B-S</td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S">https://huggingface.co/gplsi/Aitana-2B-S</a></td><td>Modelo de lenguaje generativo entrenado a partir de <a href="https://huggingface.co/BSC-LT/salamandra-2b">salamandra-2b</a>, utilizando datos en valenciano.</td></tr></tbody></table>

### Modelos generativos instruidos

<table data-view="cards"><thead><tr><th></th><th></th><th></th><th></th><th></th><th data-type="content-ref"></th><th></th><th></th></tr></thead><tbody><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (multilingüe)</td><td><sub>Nombre modelo</sub></td><td>ALIA-40b-instruct-2601</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/BSC-LT/ALIA-40b-instruct-2601">https://huggingface.co/BSC-LT/ALIA-40b-instruct-2601</a></td><td><sub>Comentarios</sub></td><td>Última versión de la familia de modelos ALIA. Aunque el desarrollo sigue en curso y se prevén nuevas actualizaciones, esta versión ya integra varias mejoras significativas con respecto a lanzamientos anteriores, destacando un seguimiento de instrucciones más preciso, mayor robustez ante entradas ruidosas o ambiguas, una alineación de seguridad reforzada y capacidades ampliadas para el manejo de contextos largos.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (multilingüe)</td><td></td><td>ALIA-40b-instruct-2601-GGUF</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/BSC-LT/ALIA-40b-instruct-2601-GGUF">https://huggingface.co/BSC-LT/ALIA-40b-instruct-2601-GGUF</a></td><td></td><td>Versión cuantizada GGUF del modelo ALIA-40b-instruct-2601</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (inglés, español, catalán)</td><td><sub>Nombre modelo</sub></td><td>salamandra-7b-instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/BSC-LT/salamandra-7b-instruct">https://huggingface.co/BSC-LT/salamandra-7b-instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo salamandra-7b entrenado con 276.000 instrucciones en inglés, español y catalán, recopiladas de diversos corpus abiertos.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (inglés, español, catalán)</td><td><sub>Nombre modelo</sub></td><td>salamandra-2b-instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/BSC-LT/salamandra-2b-instruct">https://huggingface.co/BSC-LT/salamandra-2b-instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo salamandra-2b entrenado con 276.000 instrucciones en inglés, español y catalán, recopiladas de diversos corpus abiertos.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (euskera)</td><td><sub>Nombre modelo</sub></td><td>Latxa 3.1 Instruct 70B</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/HiTZ/Latxa-Llama-3.1-70B-Instruct">https://huggingface.co/HiTZ/Latxa-Llama-3.1-70B-Instruct</a></td><td><sub>Comentarios</sub></td><td>Versión instruida de <a href="https://aclanthology.org/2024.acl-long.799/">Latxa</a> basada en Llama 3.1 Instruct y adaptada específicamente al euskera.mediante técnicas de adaptación lingüística. Fue entrenada con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (euskera)</td><td><sub>Nombre modelo</sub></td><td>Latxa 3.1 Instruct 8B</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/HiTZ/Latxa-Llama-3.1-8B-Instruct">https://huggingface.co/HiTZ/Latxa-Llama-3.1-8B-Instruct</a></td><td><sub>Comentarios</sub></td><td>Versión instruida de <a href="https://aclanthology.org/2024.acl-long.799/">Latxa</a> basada en Llama 3.1 Instruct y adaptada específicamente al euskera.mediante técnicas de adaptación lingüística. Fue entrenada con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (gallego, portugués, español, inglés y catalán)</td><td><sub>Nombre modelo</sub></td><td>Carvalho-Salamandra-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/Carvalho-Salamandra-Instruct">https://huggingface.co/proxectonos/Carvalho-Salamandra-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo transformer instruido de 7.000 millones de parámetros, ajustado para seguir instrucciones y generar texto en gallego, portugués, español, inglés y catalán. Está basado en <a href="https://huggingface.co/BSC-LT/salamandra-7b-instruct">Salamandra-7B-Instruct</a> y ha sido adaptado con corpus multilingües de alta calidad, con especial énfasis en gallego y portugués, para reforzar su rendimiento en lenguas menos representadas sin perder capacidad multilingüe.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (gallego)</td><td><sub>Nombre modelo</sub></td><td>CarvalhoChat_v4</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/carvalho-nos/CarvalhoChat_v4">https://huggingface.co/carvalho-nos/CarvalhoChat_v4</a></td><td><sub>Comentarios</sub></td><td>Cuarta versión de la familia CarvalhoChat, desarrollada mediante ajuste fino completo del modelo base <a href="https://huggingface.co/Nos-PT/Llama-Carvalho-PT-GL">Nos-PT/Llama-Carvalho-PT-GL</a>. Está orientada a la creación de un asistente conversacional capaz de comprender y generar respuestas en gallego.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (inglés, español, valenciano) </td><td><sub>Nombre modelo</sub></td><td>Aitana-7B-S-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-7B-S-Instruct">https://huggingface.co/gplsi/Aitana-7B-S-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo generativo instruido de la familia Aitana. Basado en <a href="https://huggingface.co/gplsi/Aitana-7B-S-base">gplsi/Aitana-7B-S-base</a>, ha sido ajustado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en mejorar su rendimiento en valenciano.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (inglés, español, valenciano) </td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-S-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S-Instruct">https://huggingface.co/gplsi/Aitana-2B-S-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo generativo instruido de la familia Aitana. Está basado en <a href="https://huggingface.co/gplsi/Aitana-2B-S-base">gplsi/Aitana-2B-S-base</a> y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en reforzar sus capacidades en valenciano.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido alineado (inglés, español, valenciano) </td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-SI-Instruct-Aligned</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-SI-Instruct-Aligned">https://huggingface.co/gplsi/Aitana-2B-SI-Instruct-Aligned</a></td><td><sub>Comentarios</sub></td><td>Modelo generativo instruido de la familia Aitana. Está basado en  <a href="https://huggingface.co/gplsi/Aitana-2B-SI-Instruct">Aitana-2B-SI-Instruct</a> y ha sido alineado mediante Direct Preference Optimization (DPO) para mejorar la calidad de las respuestas y su adecuación a las preferencias humanas en valenciano, español e inglés.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido alineado (inglés, español, valenciano) </td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-S-Instruct-Aligned</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S-Instruct-Aligned">https://huggingface.co/gplsi/Aitana-2B-S-Instruct-Aligned</a></td><td><sub>Comentarios</sub></td><td>Modelo generativo instruido de la familia Aitana. Está basado en  <a href="https://huggingface.co/gplsi/Aitana-2B-S-Instruct">Aitana-2B-S-Instruct</a> y ha sido alineado mediante Direct Preference Optimization (DPO) para mejorar la calidad de las respuestas y su adecuación a las preferencias humanas en valenciano, español e inglés.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido (inglés, español, valenciano) </td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-SI-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-SI-Instruct">https://huggingface.co/gplsi/Aitana-2B-SI-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo generativo instruido de la familia Aitana. Basado en <a href="https://huggingface.co/gplsi/Aitana-2B-S-base">gplsi/Aitana-2B-S-base</a>, ha sido ajustado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en mejorar sus capacidades en valenciano.</td></tr></tbody></table>

### Modelos encoders

<table data-view="cards" data-full-width="false"><thead><tr><th>Descripción / Función</th><th>Nombre modelo</th><th>Model card</th><th>Comentarios</th></tr></thead><tbody><tr><td>Modelo encoder (multilingüe)</td><td>MrBERT</td><td><a href="https://huggingface.co/BSC-LT/MrBERT">https://huggingface.co/BSC-LT/MrBERT</a></td><td>Modelo encoder fundacional multilingüe basado en la arquitectura  <a href="https://huggingface.co/answerdotai/ModernBERT-base/tree/main">ModernBERT</a> y preentrenado desde cero con 6,1 billones de tokens en 35 lenguas europeas y código. Genera representaciones bidireccionales y está orientado a tareas como clasificación, recuperación de información, reconocimiento de entidades y búsqueda semántica.</td></tr><tr><td>Modelo encoder (español, inglés)</td><td>MrBERT-es</td><td><a href="https://huggingface.co/BSC-LT/MrBERT-es">https://huggingface.co/BSC-LT/MrBERT-es</a></td><td>Modelo encoder fundacional bilingüe para español e inglés, basado en la arquitectura <a href="https://huggingface.co/answerdotai/ModernBERT-base/tree/main">ModernBERT</a>. Se inicializa a partir de <a href="https://huggingface.co/BSC-LT/MrBERT">MrBERT</a> mediante adaptación de vocabulario y se preentrena de forma continua con un corpus equilibrado de 615.000 millones de tokens en ambas lenguas.</td></tr><tr><td>Modelo encoder (catalán, inglés)</td><td>MrBERT-ca</td><td><a href="https://huggingface.co/BSC-LT/MrBERT-ca">https://huggingface.co/BSC-LT/MrBERT-ca</a></td><td>Modelo encoder fundacional bilingüe para catalán e inglés, basado en la arquitectura <a href="https://huggingface.co/answerdotai/ModernBERT-base/tree/main">ModernBERT</a>. Se inicializa a partir de <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a> mediante adaptación de vocabulario y se preentrena de forma continua con un corpus equilibrado de 47.400 millones de tokens en ambas lenguas.</td></tr><tr><td>Modelo encoder (multilingüe)</td><td>mRoBERTa</td><td><a href="https://huggingface.co/BSC-LT/mRoBERTa">https://huggingface.co/BSC-LT/mRoBERTa</a></td><td>Modelo encoder fundacional multilingüe basado en la arquitectura <a href="https://huggingface.co/FacebookAI/roberta-base">RoBERTa</a> y preentrenado desde cero con datos en 35 lenguas europeas y código. Su corpus de entrenamiento reúne 12,8 TB de datos de alta calidad, una escala muy superior a la utilizada por modelos anteriores como XLM-RoBERTa.</td></tr><tr><td>Modelo encoder (catalán)</td><td>RoBERTa-ca </td><td><a href="https://huggingface.co/BSC-LT/RoBERTa-ca">https://huggingface.co/BSC-LT/RoBERTa-ca</a></td><td>Modelo encoder fundacional para catalán basado en la arquitectura <a href="https://huggingface.co/FacebookAI/roberta-base">RoBERTa</a>. Se inicializa a partir de <a href="https://huggingface.co/BSC-LT/mRoBERTa">mRoBERTa</a> mediante adaptación de vocabulario y se preentrena de forma continua con un corpus monolingüe de 95 GB de datos de alta calidad en catalán.</td></tr><tr><td>Modelo encoder (gallego)</td><td>MrBERT-nos-gl</td><td><a href="https://huggingface.co/proxectonos/MrBERT-nos-gl">https://huggingface.co/proxectonos/MrBERT-nos-gl</a></td><td>Modelo encoder adaptado al gallego y al portugués mediante preentrenamiento continuo de <a href="https://huggingface.co/BSC-LT/MrBERT">MrBERT</a> con <a href="https://huggingface.co/datasets/proxectonos/corpusnos">CorpusNÓS</a>. Basado en la arquitectura ModernBERT, admite contextos de hasta 1.024 tokens y puede ajustarse para tareas como reconocimiento de entidades, clasificación de textos, similitud semántica, respuesta a preguntas y recuperación multilingüe.</td></tr><tr><td>Modelo encoder (euskera)</td><td>BERnaT-medium</td><td><a href="https://huggingface.co/HiTZ/BERnaT-medium">https://huggingface.co/HiTZ/BERnaT-medium</a></td><td>Modelo encoder  para euskera de 51 millones de parámetros, basado en la arquitectura <a href="https://huggingface.co/FacebookAI/roberta-base">RoBERTa</a> y entrenado desde cero con corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).</td></tr><tr><td>Modelo encoder (euskera)</td><td>BERnaT-base</td><td><a href="https://huggingface.co/HiTZ/BERnaT-base">https://huggingface.co/HiTZ/BERnaT-base</a></td><td>Modelo encoder  para euskera de 124 millones de parámetros, basado en la arquitectura <a href="https://huggingface.co/FacebookAI/roberta-base">RoBERTa</a> y entrenado desde cero con un corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).</td></tr><tr><td>Modelo encoder (euskera)</td><td>BERnaT-large</td><td><a href="https://huggingface.co/HiTZ/BERnaT-large">https://huggingface.co/HiTZ/BERnaT-large</a></td><td>Modelo encoder  para euskera de 355 millones de parámetros, basado en la arquitectura <a href="https://huggingface.co/FacebookAI/roberta-base">RoBERTa</a> y entrenado desde cero con un corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).</td></tr><tr><td>Modelo encoder (gallego)</td><td>mDeBERTa-gl</td><td><a href="https://huggingface.co/proxectonos/mdeberta-gl">https://huggingface.co/proxectonos/mdeberta-gl</a></td><td>Modelo encoder de propósito general para gallego, basado en <a href="https://huggingface.co/microsoft/mdeberta-v3-base">mDeBERTa-v3-base</a> y adaptado mediante preentrenamiento continuo con modelado de lenguaje enmascarado a gran escala. Está orientado a su posterior ajuste en distintas tareas de procesamiento del lenguaje natural en gallego.</td></tr><tr><td>Modelo encoder (gallego)</td><td>DeBERTa-xsmall-gl</td><td><a href="https://huggingface.co/proxectonos/deberta-xsmall-gl">https://huggingface.co/proxectonos/deberta-xsmall-gl</a></td><td>Modelo encoder compacto de propósito general para gallego, basado en <a href="https://huggingface.co/microsoft/deberta-v3-xsmall">DeBERTa-v3-xsmall</a> y adaptado mediante preentrenamiento continuo con modelado de lenguaje enmascarado a gran escala. Está orientado a su posterior ajuste en distintas tareas de procesamiento del lenguaje natural en gallego.</td></tr></tbody></table>

### Modelos especializados por dominios

#### Generativos de dominios

<table data-view="cards"><thead><tr><th></th><th></th><th></th><th></th><th></th><th data-type="content-ref"></th><th></th><th></th></tr></thead><tbody><tr><td><sub>Descripción / Función</sub></td><td>LLM dominio legal (gallego, español)</td><td><sub>Nombre modelo</sub></td><td>Carballo-Legal</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/Carballo-Legal">https://huggingface.co/proxectonos/Carballo-Legal</a></td><td><sub>Comentarios</sub></td><td>Modelo de 7.000 millones de parámetros especializado en la comprensión y generación de textos jurídicos en gallego y español. Está basado en <a href="https://huggingface.co/BSC-LT/salamandra-7b-instruct">Salamandra-7B-Instruct</a> y ha sido afinado con corpus legales de organismos públicos para mejorar el uso de terminología, estructuras documentales y patrones de razonamiento propios de los ámbitos administrativo y legislativo.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM dominio científico (gallego, español)</td><td><sub>Nombre modelo</sub></td><td>Carballo-Science</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/Carballo-Science">https://huggingface.co/proxectonos/Carballo-Science</a></td><td><sub>Comentarios</sub></td><td>Modelo de 7.000 millones de parámetros especializado en la comprensión y generación de textos científicos en gallego y español. Está basado en <a href="https://huggingface.co/BSC-LT/salamandra-7b-instruct">Salamandra-7B-Instruct</a> y ha sido afinado con corpus científicos de alta calidad procedentes de diversas fuentes.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido ámbito biomédico y clínico (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-es-biomedical-7B-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-es-biomedical-7B-Instruct">https://huggingface.co/SINAI/ALIA-es-biomedical-7B-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo de lenguaje instruido y especializado en el ámbito biomédico y clínico en español. Deriva de <a href="https://huggingface.co/SINAI/ALIA-es-biomedical-7B-Base">ALIA-es-biomedical-7B-Base</a>, basado en la familia <a href="https://huggingface.co/BSC-LT/salamandra-7b">Salamandra-7B</a>, y ha sido afinado con instrucciones sintéticas para responder consultas biomédicas y clínicas.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM ámbito biomédico y clínico (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-es-biomedical-7B-Base</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-es-biomedical-7B-Base">https://huggingface.co/SINAI/ALIA-es-biomedical-7B-Base</a></td><td><sub>Comentarios</sub></td><td>Versión de Salamandra 7B adaptada al ámbito biomédico y clínico en español. Ha sido optimizada mediante preentrenamiento continuo y un posterior ajuste para seguir instrucciones, utilizando corpus biomédicos cuidadosamente seleccionados. </td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido patrimonio cultural (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-es-cultural-heritage-7B-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-es-cultural-heritage-7B-Instruct">https://huggingface.co/SINAI/ALIA-es-cultural-heritage-7B-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo de lenguaje instruido y especializado en patrimonio cultural en español. Deriva de <a href="https://huggingface.co/SINAI/ALIA-es-cultural-heritage-7B-Base">ALIA-es-cultural-heritage-7B-Base</a>, basado en la familia <a href="https://huggingface.co/BSC-LT/salamandra-7b">Salamandra-7B</a>, y ha sido entrenado con instrucciones sintéticas para responder consultas sobre patrimonio cultural e historia.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM patrimonio cultural (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-es-cultural-heritage-7B-Base</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-es-cultural-heritage-7B-Base">https://huggingface.co/SINAI/ALIA-es-cultural-heritage-7B-Base</a></td><td><sub>Comentarios</sub></td><td>Versión de Salamandra 7B adaptada al ámbito del patrimonio cultural en español. Ha sido optimizada mediante preentrenamiento continuo y un posterior ajuste para seguir instrucciones, utilizando corpus especializados y cuidadosamente seleccionados sobre patrimonio cultural.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido dominio legal y administrativo (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA Legal-Administrative 7B Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-legal-administrative-7B-Instruct">https://huggingface.co/SINAI/ALIA-legal-administrative-7B-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo de lenguaje instruido y especializado en el ámbito jurídico y administrativo en español. Deriva de  <a href="https://huggingface.co/SINAI/ALIA-es-legal-administrative-7B-Base">ALIA-es-legal-administrative-7B-Base</a>, basado en la familia <a href="https://huggingface.co/BSC-LT/salamandra-7b">Salamandra-7B</a>, y ha sido entrenado con instrucciones sintéticas para responder consultas legales y administrativas.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM dominio legal y administrativo (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-es-legal-administrative-7B-Base</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-es-legal-administrative-7B-Base">https://huggingface.co/SINAI/ALIA-es-legal-administrative-7B-Base</a></td><td><sub>Comentarios</sub></td><td>Versión de Salamandra 7B adaptada al ámbito jurídico y administrativo en español. Ha sido optimizada mediante preentrenamiento continuo con datos especializados y un posterior ajuste para seguir instrucciones del dominio.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido turismo (inglés, español, valenciano) </td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-S-tourism-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S-tourism-Instruct">https://huggingface.co/gplsi/Aitana-2B-S-tourism-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo generativo instruido de la familia Aitana. Está basado en <a href="https://huggingface.co/gplsi/Aitana-2B-S-tourism-base">Aitana-2B-S-tourism-base</a> y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con capacidades especializadas para aplicaciones del ámbito turístico.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM turismo (inglés, español, valenciano) </td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-S-tourism-base</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S-tourism-base">https://huggingface.co/gplsi/Aitana-2B-S-tourism-base</a></td><td><sub>Comentarios</sub></td><td>Modelo de lenguaje generativo basado en <a href="https://huggingface.co/gplsi/Aitana-2B-S-base-1.0">Aitana-2B-S-base</a> y entrenado adicionalmente con datos del dominio turístico.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido - propiedad intelectual (inglés, español, valenciano)</td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-S-IP-Instruct</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S-IP-Instruct">https://huggingface.co/gplsi/Aitana-2B-S-IP-Instruct</a></td><td><sub>Comentarios</sub></td><td>Modelo generativo instruido de la familia Aitana. Está basado en <a href="https://huggingface.co/gplsi/Aitana-2B-S-IP-base">Aitana-2B-S-IP-base</a> y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con capacidades especializadas para tareas del ámbito de la propiedad intelectual.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM propiedad intelectual (inglés, español, valenciano)</td><td><sub>Nombre modelo</sub></td><td>Aitana-2B-S-IP-base</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-2B-S-IP-base">https://huggingface.co/gplsi/Aitana-2B-S-IP-base</a></td><td><sub>Comentarios</sub></td><td>Modelo de lenguaje generativo basado en Salamandra-2B y entrenado adicionalmente con datos especializados en propiedad intelectual.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>LLM instruido - psicología (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-es-gemma-clinical-psychology-sft</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-es-gemma-clinical-psychology-sft">https://huggingface.co/SINAI/ALIA-es-gemma-clinical-psychology-sft</a></td><td><sub>Comentarios</sub></td><td>Versión de Gemma 4 E4B IT afinada mediante aprendizaje supervisado para el asesoramiento psicológico y el diálogo terapéutico empático en español. Ha sido entrenada con un conjunto de conversaciones multitur­no cuidadosamente seleccionado, compuesto por diálogos profesionales entre terapeutas y pacientes.</td></tr></tbody></table>

#### Encoders de dominio&#x20;

<table data-view="cards" data-full-width="false"><thead><tr><th>Descripción / Función</th><th>Nombre modelo</th><th>Model card</th><th>Comentarios</th></tr></thead><tbody><tr><td>Modelo encoder - biomédico (multilingüe)</td><td>MrBERT-biomed</td><td><a href="https://huggingface.co/BSC-LT/MrBERT-biomed">https://huggingface.co/BSC-LT/MrBERT-biomed</a></td><td>Modelo encoder biomédico multilingüe basado en la arquitectura <a href="https://huggingface.co/answerdotai/ModernBERT-base/tree/main">ModernBERT</a>, . Se obtiene mediante adaptación de dominio a partir de <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a> y ha sido entrenado  con 24.130 millones de tokens, principalmente en inglés y español, junto con cantidades menores de otras lenguas europeas.</td></tr><tr><td>Modelo encoder - científico (bilingüe)</td><td>MrBERT-science</td><td><a href="https://huggingface.co/BSC-LT/MrBERT-science">https://huggingface.co/BSC-LT/MrBERT-science</a></td><td>Modelo encoder científico bilingüe basado en la arquitectura <a href="https://huggingface.co/answerdotai/ModernBERT-base/tree/main">ModernBERT</a>. Se obtiene mediante adaptación de dominio a partir de <a href="https://huggingface.co/BSC-LT/MrBERT">MrBERT</a> y ha sido entrenado con un corpus científico de 3.600 millones de tokens, compuesto por un 61,9% de inglés y un 38,1% de español.</td></tr><tr><td>Modelo encoder - jurídico (bilingüe)</td><td>MrBERT-legal</td><td><a href="https://huggingface.co/BSC-LT/MrBERT-legal">https://huggingface.co/BSC-LT/MrBERT-legal</a></td><td>Modelo encoder jurídico bilingüe basado en la arquitectura <a href="https://huggingface.co/answerdotai/ModernBERT-base/tree/main">ModernBERT</a>. Se obtiene mediante adaptación de dominio a partir de <a href="https://huggingface.co/BSC-LT/MrBERT">MrBERT</a> y ha sido entrenado con un corpus legal de 8.000 millones de tokens, compuesto por un 79,5% de inglés y un 20,5% de español.</td></tr><tr><td>Modelo encoder - propiedad intelectual (español e inglés)</td><td>Aitana-intellectual-property-mb-encoder</td><td><a href="https://huggingface.co/gplsi/Aitana-intellectual-property-mb-encoder">https://huggingface.co/gplsi/Aitana-intellectual-property-mb-encoder</a></td><td>Modelo encoder especializado en propiedad intelectual, basado en <a href="https://huggingface.co/answerdotai/ModernBERT-base">ModernBERT-base</a> y adaptado mediante preentrenamiento continuo con datos en español e inglés. Está optimizado para comprender y representar textos jurídicos y técnicos relacionados con este ámbito.</td></tr><tr><td>Modelo encoder - turismo  (estañol, valenciano)</td><td>Aitana-tourism-mb-encoder-1.0</td><td><a href="https://huggingface.co/gplsi/Aitana-tourism-mb-encoder-1.0">https://huggingface.co/gplsi/Aitana-tourism-mb-encoder-1.0</a></td><td>Modelo encoder especializado en turismo, basado en <a href="https://huggingface.co/answerdotai/ModernBERT-base">ModernBERT-base</a> y adaptado mediante preentrenamiento continuo con datos en español y valenciano. Está optimizado para comprender textos turísticos, como descripciones de hoteles, guías de destinos, servicios de viaje y contenidos sobre patrimonio cultural.</td></tr><tr><td>Modelo encoder - periodístico, legal-administrativo y parlamentari(euskera)</td><td>JaunBERT</td><td><a href="https://huggingface.co/HiTZ/JaunBERT">https://huggingface.co/HiTZ/JaunBERT</a></td><td>Modelo encoder basado en la arquitectura ModernBERT y obtenido mediante la adaptación de MrBERT al euskera y a los dominios periodístico, legal-administrativo y parlamentario. Fue entrenado con Latxa Corpus v2 y está orientado a tareas discriminativas como clasificación, reconocimiento de entidades, etiquetado morfosintáctico, detección de intenciones y recuperación de información.</td></tr><tr><td>Modelo bi-encoder - biomédico (español)</td><td>ALIA-MrBERT-es-biomedical-embeddings</td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-biomedical-embeddings">https://huggingface.co/SINAI/ALIA-MrBERT-es-biomedical-embeddings</a></td><td>Modelo bi-encoder especializado en el ámbito biomédico en español, orientado a tareas de similitud semántica y recuperación de información. Está basado en <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a>, con arquitectura ModernBERT, y ha sido afinado con datos biomédicos mediante una estrategia de aprendizaje curricular.</td></tr><tr><td>Modelo bi-encodern  - jurídico (español)</td><td>ALIA-MrBERT-es-legal-embeddings</td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-legal-embeddings">https://huggingface.co/SINAI/ALIA-MrBERT-es-legal-embeddings</a></td><td>Modelo bi-encoder especializado en los ámbitos jurídico y administrativo en español, orientado a tareas de similitud semántica y recuperación de información. Está bbasado en <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a> con arquitectura ModernBERT, y ha sido afinado con datos jurídicos y administrativos mediante una estrategia de aprendizaje curricular.</td></tr><tr><td>Modelo bi-encoder  - patrimonio cultural (español)</td><td>ALIA-MrBERT-es-cultural-embeddings</td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-cultural-embeddings">https://huggingface.co/SINAI/ALIA-MrBERT-es-cultural-embeddings</a></td><td>Modelo bi-encoder especializado en patrimonio cultural en español, orientado a tareas de similitud semántica y recuperación de información. Está basado en <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a>, con arquitectura ModernBERT, y ha sido afinado con datos del dominio mediante una estrategia de aprendizaje curricular.</td></tr><tr><td>Modelo cross-encoder - biomédico (español)</td><td>ALIA-MrBERT-es-biomedical-reranker</td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-biomedical-reranker">https://huggingface.co/SINAI/ALIA-MrBERT-es-biomedical-reranker</a></td><td>Modelo cross-encoder especializado en el ámbito biomédico en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a>, con arquitectura ModernBERT, y ha sido afinado con datos biomédicos mediante una estrategia de aprendizaje curricular.</td></tr><tr><td>Modelo cross-encoder - biomédico (español)</td><td>ALIA-MrBERT-es-legal-reranker</td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-legal-reranker">https://huggingface.co/SINAI/ALIA-MrBERT-es-legal-reranker</a></td><td>Modelo cross-encoder especializado en los ámbitos jurídico y administrativo en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a>, con arquitectura ModernBERT, y ha sido afinado con datos jurídicos y administrativos mediante una estrategia de aprendizaje curricular.</td></tr><tr><td>Modelo cross-encoder  - patrimonio cultural (español)</td><td>ALIA-MrBERT-es-cultural-reranker</td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-cultural-reranker">https://huggingface.co/SINAI/ALIA-MrBERT-es-cultural-reranker</a></td><td>Modelo cross-encoder especializado en patrimonio cultural en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en <a href="https://huggingface.co/BSC-LT/MrBERT-es">MrBERT-es</a>, con arquitectura ModernBERT, y ha sido afinado con datos del dominio mediante una estrategia de aprendizaje curricular.</td></tr></tbody></table>

### Modelos especializados en tareas de texto

<table data-view="cards"><thead><tr><th></th><th></th><th></th><th></th><th></th><th data-type="content-ref"></th><th></th><th></th></tr></thead><tbody><tr><td><sub>Descripción / Función</sub></td><td>Moderación de contenido</td><td><sub>Nombre modelo</sub></td><td>Salamandra-7b-instruct-guard</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/BSC-LT/salamandra-7b-instruct-guard">https://huggingface.co/BSC-LT/salamandra-7b-instruct-guard</a></td><td><sub>Comentarios</sub></td><td>Modelo de clasificación de seguridad diseñado para la moderación de contenido en catalán, español e inglés. Está construido sobre <a href="https://huggingface.co/BSC-LT/salamandra-7b-instruct">Salamandra-7b-Instruct</a>. </td></tr><tr><td><sub>Descripción / Función</sub></td><td>Detección de fraude</td><td><sub>Nombre modelo</sub></td><td>Aitana Enc Fraud Detection</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-FraudDetection-R-1.0">https://huggingface.co/gplsi/Aitana-FraudDetection-R-1.0</a></td><td><sub>Comentarios</sub></td><td>Modelo ajustado a partir de <a href="https://huggingface.co/BSC-LT/mRoBERTa">mRoBERTa</a> para la clasificación binaria de la detección de <em>phishing</em> en textos en inglés.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Detección marcas falsas</td><td><sub>Nombre modelo</sub></td><td>Aitana-MarcasFalsas-R-1.0</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-MarcasFalsas-R-1.0">https://huggingface.co/gplsi/Aitana-MarcasFalsas-R-1.0</a></td><td><sub>Comentarios</sub></td><td> Modelo basado en <a href="https://huggingface.co/BSC-LT/MrBERT">BSC-LT/MrBERT</a> y afinado para detectar menciones de marcas falsas en textos en español e inglés. Está diseñado como un clasificador binario que asigna cada texto a una de dos categorías.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Lenguaje claro</td><td><sub>Nombre modelo</sub></td><td>Aitana-ClearLangDetection-R-1.0</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/gplsi/Aitana-ClearLangDetection-R-1.0">https://huggingface.co/gplsi/Aitana-ClearLangDetection-R-1.0</a></td><td><sub>Comentarios</sub></td><td>Modelo ajustado a partir de <a href="https://huggingface.co/BSC-LT/mRoBERTa">mRoBERTa</a> para la tarea de clasificación de lenguaje claro en textos en español.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Detección de entidades nombradas - SNOMED (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-MrBERT-es-snomed-dental-ner-ctx8192</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-snomed-dental-ner-ctx8192">https://huggingface.co/SINAI/ALIA-MrBERT-es-snomed-dental-ner-ctx8192</a></td><td><sub>Comentarios</sub></td><td>Modelo NER en español especializado en odontología, basado en MrBERT-es y ajustado con datos clínicos del ámbito dental. Está diseñado para identificar entidades asociadas a unos 400 códigos SNOMED CT y actúa como módulo de extracción dentro de un sistema de vinculación y normalización de conceptos clínicos.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Detección de entidades nombradas - SNOMED (español)</td><td><sub>Nombre modelo</sub></td><td>ALIA-MrBERT-es-snomed-dental-ner-multiclass-ctx8192</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/SINAI/ALIA-MrBERT-es-snomed-dental-ner-multiclass-ctx8192">https://huggingface.co/SINAI/ALIA-MrBERT-es-snomed-dental-ner-multiclass-ctx8192</a></td><td><sub>Comentarios</sub></td><td>Modelo NER multiclase en español especializado en odontología, basado en MrBERT-es y ajustado con datos clínicos dentales. Funciona como un clasificador directo de tokens que identifica entidades clínicas y les asigna su código SNOMED CT correspondiente en una única inferencia, mediante un esquema de etiquetado BIO específico para cada concepto.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Corrección gramatical (gallego)</td><td><sub>Nombre modelo</sub></td><td>CarvalhoChat_GEC</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/CarvalhoChat_GEC">https://huggingface.co/proxectonos/CarvalhoChat_GEC</a></td><td><sub>Comentarios</sub></td><td>Adaptador LoRA especializado en la corrección de errores gramaticales en gallego, diseñado para introducir únicamente los cambios necesarios y preservar el significado original. Fue ajustado a partir de <a href="https://huggingface.co/carvalho-nos/CarvalhoChat_v4">CarvalhoChat_v4 </a>con datos de alta calidad y debe aplicarse sobre el modelo base, ya que no constituye un modelo completo.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Detección de entidades nombradas (gallego)</td><td><sub>Nombre modelo</sub></td><td>MrBERT-nos-gl-NER</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/MrBERT-nos-gl-NER">https://huggingface.co/proxectonos/MrBERT-nos-gl-NER</a></td><td><sub>Model card</sub></td><td>Versión ajustada de <a href="https://huggingface.co/proxectonos/MrBERT-nos-gl">MrBERT-nos-gl</a> para el reconocimiento de entidades nombradas (NER) en gallego, capaz de identificar cuatro tipos de entidades: PER, ORG, LOC, MISC.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>POS tagging (gallego)</td><td><sub>Nombre modelo</sub></td><td>MrBERT-nos-gl-POS</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/MrBERT-nos-gl-POS">https://huggingface.co/proxectonos/MrBERT-nos-gl-POS</a></td><td><sub>Model card</sub></td><td>Versión ajustada de <a href="https://huggingface.co/proxectonos/MrBERT-nos-gl">MrBERT-nos-gl</a> para el etiquetado morfosintáctico de categorías gramaticales (POS tagging) en gallego.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Análisis de sentimiento (gallego)</td><td><sub>Nombre modelo</sub></td><td>MrBERT-nos-gl-sentiment</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/MrBERT-nos-gl-sentiment">https://huggingface.co/proxectonos/MrBERT-nos-gl-sentiment</a></td><td><sub>Model card</sub></td><td>Versión ajustada de <a href="https://huggingface.co/proxectonos/MrBERT-nos-gl">MrBERT-nos-gl</a> para el análisis de sentimiento en gallego, con clasificación en tres categorías: positivo, neutral y negativo.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Clasificación temática de noticias (gallego)</td><td><sub>Nombre modelo</sub></td><td>MrBERT-nos-gl-thematic-press-classifier</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/proxectonos/MrBERT-nos-gl-thematic-press-classifier">https://huggingface.co/proxectonos/MrBERT-nos-gl-thematic-press-classifier</a></td><td><sub>Model card</sub></td><td>Versión ajustada de <a href="https://huggingface.co/proxectonos/MrBERT-nos-gl">MrBERT-nos-gl</a> para la clasificación temática de artículos de prensa en gallego según sus secciones editoriales.</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Normalización (euskera)</td><td><sub>Nombre modelo</sub></td><td>marianmt-cap-punct-eu</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/HiTZ/cap-punct-eu">https://huggingface.co/HiTZ/cap-punct-eu</a></td><td><sub>Comentarios</sub></td><td>Modelo de traducción automática que sirve para capitalizar y puntuar texto normalizado en euskera. El modelo ha sido entrenado desde cero utilizando <a href="https://huggingface.co/docs/transformers/model_doc/marian">Marian NMT</a> y un dataset de 9.784.905 frases en euskera</td></tr><tr><td><sub>Descripción / Función</sub></td><td>Normalización (euskera)</td><td><sub>Nombre modelo</sub></td><td>marianmt-cap-punct-es</td><td><sub>Model card</sub></td><td><a href="https://huggingface.co/HiTZ/cap-punct-es">https://huggingface.co/HiTZ/cap-punct-es</a></td><td><sub>Comentarios</sub></td><td>Modelo de traducción automática que sirve para capitalizar y puntuar texto normalizado en español. El modelo ha sido entrenado desde cero utilizando <a href="https://huggingface.co/docs/transformers/model_doc/marian">Marian NMT</a> y un dataset de 9.784.905 frases en castellano.</td></tr></tbody></table>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://langtech-bsc.gitbook.io/alia-kit/modelos/modelos-de-texto.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
