For the complete documentation index, see llms.txt. This page is also available as Markdown.

🔠Modelos de texto

Modelos generativos base

Descripción / Función

LLM (multilingüe)

Nombre modelo

salamandra-7b

Comentarios

Modelo generativo multilingüe, entrenado desde cero en 35 idiomas europeos, con 8.000 millones de parámetros y 12,875 billones de tokens.

Descripción / Función

LLM (multilingüe)

Nombre modelo

salamandra-2b

Comentarios

Modelo generativo multilingüe, entrenado desde cero en 35 idiomas europeos, con 2.000 millones de parámetros y 12,875 billones de tokens.

Descripción / Función

LLM (gallego, portugués, español, catalán, inglés)

Nombre modelo

Llama-3.1-Carballo

Comentarios

Modelo de 8.000 millones de parámetros, diseñado para gallego, portugués, español, catalán e inglés. Es el resultado de un preentrenamiento continuo del modelo meta-llama/Llama-3.1-8B con un corpus multilingüe de casi 20.000 millones de tokens, con especial énfasis en textos en gallego.

Descripción / Función

LLM (gallego, portugués, español, catalán, inglés)

Nombre modelo

Carballo-Llama-Instr3

Comentarios

Modelo de 8.000 millones de parámetros para gallego, portugués, español, inglés y catalán. Está basado en meta-llama/Llama-3.1-8B y ha sido adaptado mediante preentrenamiento continuo con un corpus multilingüe de 340 millones de tokens, con especial énfasis en el gallego.

Descripción / Función

LLM (gallego, portugués, español, inglés)

Nombre modelo

Llama-Carvalho-PT-GL

Comentarios

Modelo de 8.000 millones de parámetros para gallego, portugués, español e inglés. Está basado en meta-llama/Llama-3.1-8B y ha sido adaptado mediante preentrenamiento continuo con un corpus multilingüe de 540 millones de tokens de texto y 72 millones de tokens de instrucciones.

Descripción / Función

LLM (euskera)

Nombre modelo

Latxa 3.1 8B

Comentarios

Modelo de lenguaje basado en Llama 3.1 y adaptado específicamente al euskera. Ha sido entrenado mediante técnicas de adaptación lingüística con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.

Descripción / Función

LLM (valenciano, español, inglés)

Nombre modelo

Aitana-7B-S-base

Comentarios

Modelo de lenguaje generativo entrenado a partir de BSC-LT/salamandra-7b utilizando datos en valenciano, español e inglés.

Descripción / Función

LLM (valenciano, español, inglés)

Nombre modelo

Aitana-2B-S-base

Comentarios

Modelo de lenguaje generativo entrenado a partir de salamandra-2b, utilizando datos en valenciano, español e inglés.

Descripción / Función

LLM (valenciano)

Nombre modelo

Aitana-2B-S

Comentarios

Modelo de lenguaje generativo entrenado a partir de salamandra-2b, utilizando datos en valenciano.

Modelos generativos instruidos

Descripción / Función

LLM instruido (multilingüe)

Nombre modelo

ALIA-40b-instruct-2601

Model card

Comentarios

Última versión de la familia de modelos ALIA. Aunque el desarrollo sigue en curso y se prevén nuevas actualizaciones, esta versión ya integra varias mejoras significativas con respecto a lanzamientos anteriores, destacando un seguimiento de instrucciones más preciso, mayor robustez ante entradas ruidosas o ambiguas, una alineación de seguridad reforzada y capacidades ampliadas para el manejo de contextos largos.

Descripción / Función

LLM instruido (multilingüe)

ALIA-40b-instruct-2601-GGUF

Model card

Versión cuantizada GGUF del modelo ALIA-40b-instruct-2601

Descripción / Función

LLM instruido (inglés, español, catalán)

Nombre modelo

salamandra-7b-instruct

Model card

Comentarios

Modelo salamandra-7b entrenado con 276.000 instrucciones en inglés, español y catalán, recopiladas de diversos corpus abiertos.

Descripción / Función

LLM instruido (inglés, español, catalán)

Nombre modelo

salamandra-2b-instruct

Model card

Comentarios

Modelo salamandra-2b entrenado con 276.000 instrucciones en inglés, español y catalán, recopiladas de diversos corpus abiertos.

Descripción / Función

LLM instruido (euskera)

Nombre modelo

Latxa 3.1 Instruct 70B

Model card

Comentarios

Versión instruida de Latxa basada en Llama 3.1 Instruct y adaptada específicamente al euskera.mediante técnicas de adaptación lingüística. Fue entrenada con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.

Descripción / Función

LLM instruido (euskera)

Nombre modelo

Latxa 3.1 Instruct 8B

Model card

Comentarios

Versión instruida de Latxa basada en Llama 3.1 Instruct y adaptada específicamente al euskera.mediante técnicas de adaptación lingüística. Fue entrenada con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.

Descripción / Función

LLM instruido (gallego, portugués, español, inglés y catalán)

Nombre modelo

Carvalho-Salamandra-Instruct

Model card

Comentarios

Modelo transformer instruido de 7.000 millones de parámetros, ajustado para seguir instrucciones y generar texto en gallego, portugués, español, inglés y catalán. Está basado en Salamandra-7B-Instruct y ha sido adaptado con corpus multilingües de alta calidad, con especial énfasis en gallego y portugués, para reforzar su rendimiento en lenguas menos representadas sin perder capacidad multilingüe.

Descripción / Función

LLM instruido (gallego)

Nombre modelo

CarvalhoChat_v4

Model card

Comentarios

Cuarta versión de la familia CarvalhoChat, desarrollada mediante ajuste fino completo del modelo base Nos-PT/Llama-Carvalho-PT-GL. Está orientada a la creación de un asistente conversacional capaz de comprender y generar respuestas en gallego.

Descripción / Función

LLM instruido (inglés, español, valenciano)

Nombre modelo

Aitana-7B-S-Instruct

Model card

Comentarios

Modelo generativo instruido de la familia Aitana. Basado en gplsi/Aitana-7B-S-base, ha sido ajustado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en mejorar su rendimiento en valenciano.

Descripción / Función

LLM instruido (inglés, español, valenciano)

Nombre modelo

Aitana-2B-S-Instruct

Model card

Comentarios

Modelo generativo instruido de la familia Aitana. Está basado en gplsi/Aitana-2B-S-base y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en reforzar sus capacidades en valenciano.

Descripción / Función

LLM instruido alineado (inglés, español, valenciano)

Nombre modelo

Aitana-2B-SI-Instruct-Aligned

Model card

Comentarios

Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-SI-Instruct y ha sido alineado mediante Direct Preference Optimization (DPO) para mejorar la calidad de las respuestas y su adecuación a las preferencias humanas en valenciano, español e inglés.

Descripción / Función

LLM instruido alineado (inglés, español, valenciano)

Nombre modelo

Aitana-2B-S-Instruct-Aligned

Model card

Comentarios

Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-S-Instruct y ha sido alineado mediante Direct Preference Optimization (DPO) para mejorar la calidad de las respuestas y su adecuación a las preferencias humanas en valenciano, español e inglés.

Descripción / Función

LLM instruido (inglés, español, valenciano)

Nombre modelo

Aitana-2B-SI-Instruct

Model card

Comentarios

Modelo generativo instruido de la familia Aitana. Basado en gplsi/Aitana-2B-S-base, ha sido ajustado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en mejorar sus capacidades en valenciano.

Modelos encoders

Descripción / Función

Modelo encoder (multilingüe)

Nombre modelo

MrBERT

Comentarios

Modelo encoder fundacional multilingüe basado en la arquitectura ModernBERT y preentrenado desde cero con 6,1 billones de tokens en 35 lenguas europeas y código. Genera representaciones bidireccionales y está orientado a tareas como clasificación, recuperación de información, reconocimiento de entidades y búsqueda semántica.

Descripción / Función

Modelo encoder (español, inglés)

Nombre modelo

MrBERT-es

Comentarios

Modelo encoder fundacional bilingüe para español e inglés, basado en la arquitectura ModernBERT. Se inicializa a partir de MrBERT mediante adaptación de vocabulario y se preentrena de forma continua con un corpus equilibrado de 615.000 millones de tokens en ambas lenguas.

Descripción / Función

Modelo encoder (catalán, inglés)

Nombre modelo

MrBERT-ca

Comentarios

Modelo encoder fundacional bilingüe para catalán e inglés, basado en la arquitectura ModernBERT. Se inicializa a partir de MrBERT-es mediante adaptación de vocabulario y se preentrena de forma continua con un corpus equilibrado de 47.400 millones de tokens en ambas lenguas.

Descripción / Función

Modelo encoder (multilingüe)

Nombre modelo

mRoBERTa

Comentarios

Modelo encoder fundacional multilingüe basado en la arquitectura RoBERTa y preentrenado desde cero con datos en 35 lenguas europeas y código. Su corpus de entrenamiento reúne 12,8 TB de datos de alta calidad, una escala muy superior a la utilizada por modelos anteriores como XLM-RoBERTa.

Descripción / Función

Modelo encoder (catalán)

Nombre modelo

RoBERTa-ca

Comentarios

Modelo encoder fundacional para catalán basado en la arquitectura RoBERTa. Se inicializa a partir de mRoBERTa mediante adaptación de vocabulario y se preentrena de forma continua con un corpus monolingüe de 95 GB de datos de alta calidad en catalán.

Descripción / Función

Modelo encoder (gallego)

Nombre modelo

MrBERT-nos-gl

Comentarios

Modelo encoder adaptado al gallego y al portugués mediante preentrenamiento continuo de MrBERT con CorpusNÓS. Basado en la arquitectura ModernBERT, admite contextos de hasta 1.024 tokens y puede ajustarse para tareas como reconocimiento de entidades, clasificación de textos, similitud semántica, respuesta a preguntas y recuperación multilingüe.

Descripción / Función

Modelo encoder (euskera)

Nombre modelo

BERnaT-medium

Comentarios

Modelo encoder para euskera de 51 millones de parámetros, basado en la arquitectura RoBERTa y entrenado desde cero con corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).

Descripción / Función

Modelo encoder (euskera)

Nombre modelo

BERnaT-base

Comentarios

Modelo encoder para euskera de 124 millones de parámetros, basado en la arquitectura RoBERTa y entrenado desde cero con un corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).

Descripción / Función

Modelo encoder (euskera)

Nombre modelo

BERnaT-large

Comentarios

Modelo encoder para euskera de 355 millones de parámetros, basado en la arquitectura RoBERTa y entrenado desde cero con un corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).

Descripción / Función

Modelo encoder (gallego)

Nombre modelo

mDeBERTa-gl

Comentarios

Modelo encoder de propósito general para gallego, basado en mDeBERTa-v3-base y adaptado mediante preentrenamiento continuo con modelado de lenguaje enmascarado a gran escala. Está orientado a su posterior ajuste en distintas tareas de procesamiento del lenguaje natural en gallego.

Descripción / Función

Modelo encoder (gallego)

Nombre modelo

DeBERTa-xsmall-gl

Comentarios

Modelo encoder compacto de propósito general para gallego, basado en DeBERTa-v3-xsmall y adaptado mediante preentrenamiento continuo con modelado de lenguaje enmascarado a gran escala. Está orientado a su posterior ajuste en distintas tareas de procesamiento del lenguaje natural en gallego.

Modelos especializados por dominios

Generativos de dominios

Descripción / Función

LLM dominio legal (gallego, español)

Nombre modelo

Carballo-Legal

Model card

Comentarios

Modelo de 7.000 millones de parámetros especializado en la comprensión y generación de textos jurídicos en gallego y español. Está basado en Salamandra-7B-Instruct y ha sido afinado con corpus legales de organismos públicos para mejorar el uso de terminología, estructuras documentales y patrones de razonamiento propios de los ámbitos administrativo y legislativo.

Descripción / Función

LLM dominio científico (gallego, español)

Nombre modelo

Carballo-Science

Model card

Comentarios

Modelo de 7.000 millones de parámetros especializado en la comprensión y generación de textos científicos en gallego y español. Está basado en Salamandra-7B-Instruct y ha sido afinado con corpus científicos de alta calidad procedentes de diversas fuentes.

Descripción / Función

LLM instruido ámbito biomédico y clínico (español)

Nombre modelo

ALIA-es-biomedical-7B-Instruct

Model card

Comentarios

Modelo de lenguaje instruido y especializado en el ámbito biomédico y clínico en español. Deriva de ALIA-es-biomedical-7B-Base, basado en la familia Salamandra-7B, y ha sido afinado con instrucciones sintéticas para responder consultas biomédicas y clínicas.

Descripción / Función

LLM ámbito biomédico y clínico (español)

Nombre modelo

ALIA-es-biomedical-7B-Base

Model card

Comentarios

Versión de Salamandra 7B adaptada al ámbito biomédico y clínico en español. Ha sido optimizada mediante preentrenamiento continuo y un posterior ajuste para seguir instrucciones, utilizando corpus biomédicos cuidadosamente seleccionados.

Descripción / Función

LLM instruido patrimonio cultural (español)

Nombre modelo

ALIA-es-cultural-heritage-7B-Instruct

Model card

Comentarios

Modelo de lenguaje instruido y especializado en patrimonio cultural en español. Deriva de ALIA-es-cultural-heritage-7B-Base, basado en la familia Salamandra-7B, y ha sido entrenado con instrucciones sintéticas para responder consultas sobre patrimonio cultural e historia.

Descripción / Función

LLM patrimonio cultural (español)

Nombre modelo

ALIA-es-cultural-heritage-7B-Base

Model card

Comentarios

Versión de Salamandra 7B adaptada al ámbito del patrimonio cultural en español. Ha sido optimizada mediante preentrenamiento continuo y un posterior ajuste para seguir instrucciones, utilizando corpus especializados y cuidadosamente seleccionados sobre patrimonio cultural.

Descripción / Función

LLM instruido dominio legal y administrativo (español)

Nombre modelo

ALIA Legal-Administrative 7B Instruct

Model card

Comentarios

Modelo de lenguaje instruido y especializado en el ámbito jurídico y administrativo en español. Deriva de ALIA-es-legal-administrative-7B-Base, basado en la familia Salamandra-7B, y ha sido entrenado con instrucciones sintéticas para responder consultas legales y administrativas.

Descripción / Función

LLM dominio legal y administrativo (español)

Nombre modelo

ALIA-es-legal-administrative-7B-Base

Model card

Comentarios

Versión de Salamandra 7B adaptada al ámbito jurídico y administrativo en español. Ha sido optimizada mediante preentrenamiento continuo con datos especializados y un posterior ajuste para seguir instrucciones del dominio.

Descripción / Función

LLM instruido turismo (inglés, español, valenciano)

Nombre modelo

Aitana-2B-S-tourism-Instruct

Model card

Comentarios

Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-S-tourism-base y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con capacidades especializadas para aplicaciones del ámbito turístico.

Descripción / Función

LLM turismo (inglés, español, valenciano)

Nombre modelo

Aitana-2B-S-tourism-base

Model card

Comentarios

Modelo de lenguaje generativo basado en Aitana-2B-S-base y entrenado adicionalmente con datos del dominio turístico.

Descripción / Función

LLM instruido - propiedad intelectual (inglés, español, valenciano)

Nombre modelo

Aitana-2B-S-IP-Instruct

Model card

Comentarios

Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-S-IP-base y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con capacidades especializadas para tareas del ámbito de la propiedad intelectual.

Descripción / Función

LLM propiedad intelectual (inglés, español, valenciano)

Nombre modelo

Aitana-2B-S-IP-base

Model card

Comentarios

Modelo de lenguaje generativo basado en Salamandra-2B y entrenado adicionalmente con datos especializados en propiedad intelectual.

Descripción / Función

LLM instruido - psicología (español)

Nombre modelo

ALIA-es-gemma-clinical-psychology-sft

Model card

Comentarios

Versión de Gemma 4 E4B IT afinada mediante aprendizaje supervisado para el asesoramiento psicológico y el diálogo terapéutico empático en español. Ha sido entrenada con un conjunto de conversaciones multitur­no cuidadosamente seleccionado, compuesto por diálogos profesionales entre terapeutas y pacientes.

Encoders de dominio

Descripción / Función

Modelo encoder - biomédico (multilingüe)

Nombre modelo

MrBERT-biomed

Comentarios

Modelo encoder biomédico multilingüe basado en la arquitectura ModernBERT, . Se obtiene mediante adaptación de dominio a partir de MrBERT-es y ha sido entrenado con 24.130 millones de tokens, principalmente en inglés y español, junto con cantidades menores de otras lenguas europeas.

Descripción / Función

Modelo encoder - científico (bilingüe)

Nombre modelo

MrBERT-science

Comentarios

Modelo encoder científico bilingüe basado en la arquitectura ModernBERT. Se obtiene mediante adaptación de dominio a partir de MrBERT y ha sido entrenado con un corpus científico de 3.600 millones de tokens, compuesto por un 61,9% de inglés y un 38,1% de español.

Descripción / Función

Modelo encoder - jurídico (bilingüe)

Nombre modelo

MrBERT-legal

Comentarios

Modelo encoder jurídico bilingüe basado en la arquitectura ModernBERT. Se obtiene mediante adaptación de dominio a partir de MrBERT y ha sido entrenado con un corpus legal de 8.000 millones de tokens, compuesto por un 79,5% de inglés y un 20,5% de español.

Descripción / Función

Modelo encoder - propiedad intelectual (español e inglés)

Nombre modelo

Aitana-intellectual-property-mb-encoder

Comentarios

Modelo encoder especializado en propiedad intelectual, basado en ModernBERT-base y adaptado mediante preentrenamiento continuo con datos en español e inglés. Está optimizado para comprender y representar textos jurídicos y técnicos relacionados con este ámbito.

Descripción / Función

Modelo encoder - turismo (estañol, valenciano)

Nombre modelo

Aitana-tourism-mb-encoder-1.0

Comentarios

Modelo encoder especializado en turismo, basado en ModernBERT-base y adaptado mediante preentrenamiento continuo con datos en español y valenciano. Está optimizado para comprender textos turísticos, como descripciones de hoteles, guías de destinos, servicios de viaje y contenidos sobre patrimonio cultural.

Descripción / Función

Modelo encoder - periodístico, legal-administrativo y parlamentari(euskera)

Nombre modelo

JaunBERT

Comentarios

Modelo encoder basado en la arquitectura ModernBERT y obtenido mediante la adaptación de MrBERT al euskera y a los dominios periodístico, legal-administrativo y parlamentario. Fue entrenado con Latxa Corpus v2 y está orientado a tareas discriminativas como clasificación, reconocimiento de entidades, etiquetado morfosintáctico, detección de intenciones y recuperación de información.

Descripción / Función

Modelo bi-encoder - biomédico (español)

Nombre modelo

ALIA-MrBERT-es-biomedical-embeddings

Comentarios

Modelo bi-encoder especializado en el ámbito biomédico en español, orientado a tareas de similitud semántica y recuperación de información. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos biomédicos mediante una estrategia de aprendizaje curricular.

Descripción / Función

Modelo bi-encodern - jurídico (español)

Nombre modelo

ALIA-MrBERT-es-legal-embeddings

Comentarios

Modelo bi-encoder especializado en los ámbitos jurídico y administrativo en español, orientado a tareas de similitud semántica y recuperación de información. Está bbasado en MrBERT-es con arquitectura ModernBERT, y ha sido afinado con datos jurídicos y administrativos mediante una estrategia de aprendizaje curricular.

Descripción / Función

Modelo bi-encoder - patrimonio cultural (español)

Nombre modelo

ALIA-MrBERT-es-cultural-embeddings

Comentarios

Modelo bi-encoder especializado en patrimonio cultural en español, orientado a tareas de similitud semántica y recuperación de información. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos del dominio mediante una estrategia de aprendizaje curricular.

Descripción / Función

Modelo cross-encoder - biomédico (español)

Nombre modelo

ALIA-MrBERT-es-biomedical-reranker

Comentarios

Modelo cross-encoder especializado en el ámbito biomédico en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos biomédicos mediante una estrategia de aprendizaje curricular.

Descripción / Función

Modelo cross-encoder - biomédico (español)

Nombre modelo

ALIA-MrBERT-es-legal-reranker

Comentarios

Modelo cross-encoder especializado en los ámbitos jurídico y administrativo en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos jurídicos y administrativos mediante una estrategia de aprendizaje curricular.

Descripción / Función

Modelo cross-encoder - patrimonio cultural (español)

Nombre modelo

ALIA-MrBERT-es-cultural-reranker

Comentarios

Modelo cross-encoder especializado en patrimonio cultural en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos del dominio mediante una estrategia de aprendizaje curricular.

Modelos especializados en tareas de texto

Descripción / Función

Moderación de contenido

Nombre modelo

Salamandra-7b-instruct-guard

Model card

Comentarios

Modelo de clasificación de seguridad diseñado para la moderación de contenido en catalán, español e inglés. Está construido sobre Salamandra-7b-Instruct.

Descripción / Función

Detección de fraude

Nombre modelo

Aitana Enc Fraud Detection

Model card

Comentarios

Modelo ajustado a partir de mRoBERTa para la clasificación binaria de la detección de phishing en textos en inglés.

Descripción / Función

Detección marcas falsas

Nombre modelo

Aitana-MarcasFalsas-R-1.0

Model card

Comentarios

Modelo basado en BSC-LT/MrBERT y afinado para detectar menciones de marcas falsas en textos en español e inglés. Está diseñado como un clasificador binario que asigna cada texto a una de dos categorías.

Descripción / Función

Lenguaje claro

Nombre modelo

Aitana-ClearLangDetection-R-1.0

Model card

Comentarios

Modelo ajustado a partir de mRoBERTa para la tarea de clasificación de lenguaje claro en textos en español.

Descripción / Función

Detección de entidades nombradas - SNOMED (español)

Nombre modelo

ALIA-MrBERT-es-snomed-dental-ner-ctx8192

Model card

Comentarios

Modelo NER en español especializado en odontología, basado en MrBERT-es y ajustado con datos clínicos del ámbito dental. Está diseñado para identificar entidades asociadas a unos 400 códigos SNOMED CT y actúa como módulo de extracción dentro de un sistema de vinculación y normalización de conceptos clínicos.

Descripción / Función

Detección de entidades nombradas - SNOMED (español)

Nombre modelo

ALIA-MrBERT-es-snomed-dental-ner-multiclass-ctx8192

Model card

Comentarios

Modelo NER multiclase en español especializado en odontología, basado en MrBERT-es y ajustado con datos clínicos dentales. Funciona como un clasificador directo de tokens que identifica entidades clínicas y les asigna su código SNOMED CT correspondiente en una única inferencia, mediante un esquema de etiquetado BIO específico para cada concepto.

Descripción / Función

Corrección gramatical (gallego)

Nombre modelo

CarvalhoChat_GEC

Model card

Comentarios

Adaptador LoRA especializado en la corrección de errores gramaticales en gallego, diseñado para introducir únicamente los cambios necesarios y preservar el significado original. Fue ajustado a partir de CarvalhoChat_v4 con datos de alta calidad y debe aplicarse sobre el modelo base, ya que no constituye un modelo completo.

Descripción / Función

Detección de entidades nombradas (gallego)

Nombre modelo

MrBERT-nos-gl-NER

Model card

Model card

Versión ajustada de MrBERT-nos-gl para el reconocimiento de entidades nombradas (NER) en gallego, capaz de identificar cuatro tipos de entidades: PER, ORG, LOC, MISC.

Descripción / Función

POS tagging (gallego)

Nombre modelo

MrBERT-nos-gl-POS

Model card

Model card

Versión ajustada de MrBERT-nos-gl para el etiquetado morfosintáctico de categorías gramaticales (POS tagging) en gallego.

Descripción / Función

Análisis de sentimiento (gallego)

Nombre modelo

MrBERT-nos-gl-sentiment

Model card

Model card

Versión ajustada de MrBERT-nos-gl para el análisis de sentimiento en gallego, con clasificación en tres categorías: positivo, neutral y negativo.

Descripción / Función

Clasificación temática de noticias (gallego)

Nombre modelo

MrBERT-nos-gl-thematic-press-classifier

Model card

Model card

Versión ajustada de MrBERT-nos-gl para la clasificación temática de artículos de prensa en gallego según sus secciones editoriales.

Descripción / Función

Normalización (euskera)

Nombre modelo

marianmt-cap-punct-eu

Model card

Comentarios

Modelo de traducción automática que sirve para capitalizar y puntuar texto normalizado en euskera. El modelo ha sido entrenado desde cero utilizando Marian NMT y un dataset de 9.784.905 frases en euskera

Descripción / Función

Normalización (euskera)

Nombre modelo

marianmt-cap-punct-es

Model card

Comentarios

Modelo de traducción automática que sirve para capitalizar y puntuar texto normalizado en español. El modelo ha sido entrenado desde cero utilizando Marian NMT y un dataset de 9.784.905 frases en castellano.

Última actualización