🔠Modelos de texto
Modelos generativos base
LLM (multilingüe)
salamandra-7b
Modelo generativo multilingüe, entrenado desde cero en 35 idiomas europeos, con 8.000 millones de parámetros y 12,875 billones de tokens.
LLM (multilingüe)
salamandra-2b
Modelo generativo multilingüe, entrenado desde cero en 35 idiomas europeos, con 2.000 millones de parámetros y 12,875 billones de tokens.
LLM (gallego, portugués, español, catalán, inglés)
Llama-3.1-Carballo
Modelo de 8.000 millones de parámetros, diseñado para gallego, portugués, español, catalán e inglés. Es el resultado de un preentrenamiento continuo del modelo meta-llama/Llama-3.1-8B con un corpus multilingüe de casi 20.000 millones de tokens, con especial énfasis en textos en gallego.
LLM (gallego, portugués, español, catalán, inglés)
Carballo-Llama-Instr3
Modelo de 8.000 millones de parámetros para gallego, portugués, español, inglés y catalán. Está basado en meta-llama/Llama-3.1-8B y ha sido adaptado mediante preentrenamiento continuo con un corpus multilingüe de 340 millones de tokens, con especial énfasis en el gallego.
LLM (gallego, portugués, español, inglés)
Llama-Carvalho-PT-GL
Modelo de 8.000 millones de parámetros para gallego, portugués, español e inglés. Está basado en meta-llama/Llama-3.1-8B y ha sido adaptado mediante preentrenamiento continuo con un corpus multilingüe de 540 millones de tokens de texto y 72 millones de tokens de instrucciones.
LLM (euskera)
Latxa 3.1 8B
Modelo de lenguaje basado en Llama 3.1 y adaptado específicamente al euskera. Ha sido entrenado mediante técnicas de adaptación lingüística con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.
LLM (valenciano, español, inglés)
Aitana-7B-S-base
Modelo de lenguaje generativo entrenado a partir de BSC-LT/salamandra-7b utilizando datos en valenciano, español e inglés.
LLM (valenciano, español, inglés)
Aitana-2B-S-base
Modelo de lenguaje generativo entrenado a partir de salamandra-2b, utilizando datos en valenciano, español e inglés.
LLM (valenciano)
Aitana-2B-S
Modelo de lenguaje generativo entrenado a partir de salamandra-2b, utilizando datos en valenciano.
Modelos generativos instruidos
Descripción / Función
LLM instruido - function calling (multilingüe)
Nombre modelo
ALIA-40b-fc-2606
Model card
Comentarios
Versión de la familia ALIA especializada en function calling y tareas agénticas. Esta versión incorpora capacidades explícitas de razonamiento, una plantilla de chat actualizada para mejorar la fiabilidad en la llamada a funciones y un conjunto de entrenamiento más amplio y depurado. Destaca especialmente por su mejora en tareas complejas de varios pasos y por un rendimiento agéntico significativamente superior respecto a la versión anterior.
Descripción / Función
LLM instruido - function calling
Nombre modelo
ALIA-40b-fc-2606-GGUF
Model card
Comentarios
Versión cuantizada GGUF del modelo ALIA-40b-fc-2606
Descripción / Función
LLM instruido (multilingüe)
Nombre modelo
ALIA-40b-instruct-2606
Model card
Comentarios
Última versión de la familia de modelos ALIA. Esta versión incorpora mejoras en el seguimiento de instrucciones y la robustez ante entradas ruidosas o ambiguas, junto con una alineación de seguridad reforzada. Destaca además por una mayor coherencia y comprensión contextual en conversaciones de múltiples turnos, un mejor seguimiento de las instrucciones definidas en el system prompt y capacidades ampliadas para trabajar con contextos largos.
Descripción / Función
LLM instruido (multilingüe)
ALIA-40b-instruct-2606-GGUF
Model card
Versión cuantizada GGUF del modelo ALIA-40b-instruct-2606
Descripción / Función
LLM instruido (inglés, español, catalán)
Nombre modelo
salamandra-7b-instruct-2606
Model card
Comentarios
Última versión de la familia de modelos Salamandra-7B. Esta versión incorpora mejoras en el seguimiento de instrucciones y una mayor robustez ante entradas ruidosas, ambiguas o mal formuladas, junto con una alineación de seguridad reforzada. Destaca además por una mayor coherencia y comprensión contextual en conversaciones de múltiples turnos, un mejor seguimiento del system prompt y capacidades ampliadas para trabajar con contextos largos.
Descripción / Función
LLM instruido (inglés, español, catalán)
Nombre modelo
salamandra-2b-instruct
Model card
Comentarios
Modelo salamandra-2b entrenado con 276.000 instrucciones en inglés, español y catalán, recopiladas de diversos corpus abiertos.
Descripción / Función
LLM instruido (euskera)
Nombre modelo
Latxa 3.1 Instruct 70B
Model card
Comentarios
Versión instruida de Latxa basada en Llama 3.1 Instruct y adaptada específicamente al euskera.mediante técnicas de adaptación lingüística. Fue entrenada con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.
Descripción / Función
LLM instruido (euskera)
Nombre modelo
Latxa 3.1 Instruct 8B
Model card
Comentarios
Versión instruida de Latxa basada en Llama 3.1 Instruct y adaptada específicamente al euskera.mediante técnicas de adaptación lingüística. Fue entrenada con un corpus de 4,3 millones de documentos y 4.200 millones de tokens en euskera.
Descripción / Función
LLM instruido (gallego, portugués, español, inglés y catalán)
Nombre modelo
Carvalho-Salamandra-Instruct
Model card
Comentarios
Modelo transformer instruido de 7.000 millones de parámetros, ajustado para seguir instrucciones y generar texto en gallego, portugués, español, inglés y catalán. Está basado en Salamandra-7B-Instruct y ha sido adaptado con corpus multilingües de alta calidad, con especial énfasis en gallego y portugués, para reforzar su rendimiento en lenguas menos representadas sin perder capacidad multilingüe.
Descripción / Función
LLM instruido (gallego)
Nombre modelo
CarvalhoChat_v4
Model card
Comentarios
Cuarta versión de la familia CarvalhoChat, desarrollada mediante ajuste fino completo del modelo base Nos-PT/Llama-Carvalho-PT-GL. Está orientada a la creación de un asistente conversacional capaz de comprender y generar respuestas en gallego.
Descripción / Función
LLM instruido (inglés, español, valenciano)
Nombre modelo
Aitana-7B-S-Instruct
Model card
Comentarios
Modelo generativo instruido de la familia Aitana. Basado en gplsi/Aitana-7B-S-base, ha sido ajustado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en mejorar su rendimiento en valenciano.
Descripción / Función
LLM instruido (inglés, español, valenciano)
Nombre modelo
Aitana-2B-S-Instruct
Model card
Comentarios
Modelo generativo instruido de la familia Aitana. Está basado en gplsi/Aitana-2B-S-base y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en reforzar sus capacidades en valenciano.
Descripción / Función
LLM instruido alineado (inglés, español, valenciano)
Nombre modelo
Aitana-2B-SI-Instruct-Aligned
Model card
Comentarios
Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-SI-Instruct y ha sido alineado mediante Direct Preference Optimization (DPO) para mejorar la calidad de las respuestas y su adecuación a las preferencias humanas en valenciano, español e inglés.
Descripción / Función
LLM instruido alineado (inglés, español, valenciano)
Nombre modelo
Aitana-2B-S-Instruct-Aligned
Model card
Comentarios
Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-S-Instruct y ha sido alineado mediante Direct Preference Optimization (DPO) para mejorar la calidad de las respuestas y su adecuación a las preferencias humanas en valenciano, español e inglés.
Descripción / Función
LLM instruido (inglés, español, valenciano)
Nombre modelo
Aitana-2B-SI-Instruct
Model card
Comentarios
Modelo generativo instruido de la familia Aitana. Basado en gplsi/Aitana-2B-S-base, ha sido ajustado para seguir instrucciones en valenciano, español e inglés, con especial énfasis en mejorar sus capacidades en valenciano.
Modelos encoders
Modelo encoder (multilingüe)
MrBERT
Modelo encoder fundacional multilingüe basado en la arquitectura ModernBERT y preentrenado desde cero con 6,1 billones de tokens en 35 lenguas europeas y código. Genera representaciones bidireccionales y está orientado a tareas como clasificación, recuperación de información, reconocimiento de entidades y búsqueda semántica.
Modelo encoder (español, inglés)
MrBERT-es
Modelo encoder fundacional bilingüe para español e inglés, basado en la arquitectura ModernBERT. Se inicializa a partir de MrBERT mediante adaptación de vocabulario y se preentrena de forma continua con un corpus equilibrado de 615.000 millones de tokens en ambas lenguas.
Modelo encoder (catalán, inglés)
MrBERT-ca
Modelo encoder fundacional bilingüe para catalán e inglés, basado en la arquitectura ModernBERT. Se inicializa a partir de MrBERT-es mediante adaptación de vocabulario y se preentrena de forma continua con un corpus equilibrado de 47.400 millones de tokens en ambas lenguas.
Modelo encoder (multilingüe)
mRoBERTa
Modelo encoder fundacional multilingüe basado en la arquitectura RoBERTa y preentrenado desde cero con datos en 35 lenguas europeas y código. Su corpus de entrenamiento reúne 12,8 TB de datos de alta calidad, una escala muy superior a la utilizada por modelos anteriores como XLM-RoBERTa.
Modelo encoder (catalán)
RoBERTa-ca
Modelo encoder (gallego)
MrBERT-nos-gl
Modelo encoder adaptado al gallego y al portugués mediante preentrenamiento continuo de MrBERT con CorpusNÓS. Basado en la arquitectura ModernBERT, admite contextos de hasta 1.024 tokens y puede ajustarse para tareas como reconocimiento de entidades, clasificación de textos, similitud semántica, respuesta a preguntas y recuperación multilingüe.
Modelo encoder (euskera)
BERnaT-medium
Modelo encoder para euskera de 51 millones de parámetros, basado en la arquitectura RoBERTa y entrenado desde cero con corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).
Modelo encoder (euskera)
BERnaT-base
Modelo encoder para euskera de 124 millones de parámetros, basado en la arquitectura RoBERTa y entrenado desde cero con un corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).
Modelo encoder (euskera)
BERnaT-large
Modelo encoder para euskera de 355 millones de parámetros, basado en la arquitectura RoBERTa y entrenado desde cero con un corpus en euskera que combina texto estándar y no estándar (redes sociales e histórico).
Modelo encoder (gallego)
mDeBERTa-gl
Modelo encoder de propósito general para gallego, basado en mDeBERTa-v3-base y adaptado mediante preentrenamiento continuo con modelado de lenguaje enmascarado a gran escala. Está orientado a su posterior ajuste en distintas tareas de procesamiento del lenguaje natural en gallego.
Modelo encoder (gallego)
DeBERTa-xsmall-gl
Modelo encoder compacto de propósito general para gallego, basado en DeBERTa-v3-xsmall y adaptado mediante preentrenamiento continuo con modelado de lenguaje enmascarado a gran escala. Está orientado a su posterior ajuste en distintas tareas de procesamiento del lenguaje natural en gallego.
Modelos especializados por dominios
Generativos de dominios
Descripción / Función
LLM dominio legal (gallego, español)
Nombre modelo
Carballo-Legal
Model card
Comentarios
Modelo de 7.000 millones de parámetros especializado en la comprensión y generación de textos jurídicos en gallego y español. Está basado en Salamandra-7B-Instruct y ha sido afinado con corpus legales de organismos públicos para mejorar el uso de terminología, estructuras documentales y patrones de razonamiento propios de los ámbitos administrativo y legislativo.
Descripción / Función
LLM dominio científico (gallego, español)
Nombre modelo
Carballo-Science
Model card
Comentarios
Modelo de 7.000 millones de parámetros especializado en la comprensión y generación de textos científicos en gallego y español. Está basado en Salamandra-7B-Instruct y ha sido afinado con corpus científicos de alta calidad procedentes de diversas fuentes.
Descripción / Función
LLM instruido ámbito biomédico y clínico (español)
Nombre modelo
ALIA-es-biomedical-7B-Instruct
Model card
Comentarios
Modelo de lenguaje instruido y especializado en el ámbito biomédico y clínico en español. Deriva de ALIA-es-biomedical-7B-Base, basado en la familia Salamandra-7B, y ha sido afinado con instrucciones sintéticas para responder consultas biomédicas y clínicas.
Descripción / Función
LLM ámbito biomédico y clínico (español)
Nombre modelo
ALIA-es-biomedical-7B-Base
Model card
Comentarios
Versión de Salamandra 7B adaptada al ámbito biomédico y clínico en español. Ha sido optimizada mediante preentrenamiento continuo y un posterior ajuste para seguir instrucciones, utilizando corpus biomédicos cuidadosamente seleccionados.
Descripción / Función
LLM instruido patrimonio cultural (español)
Nombre modelo
ALIA-es-cultural-heritage-7B-Instruct
Model card
Comentarios
Modelo de lenguaje instruido y especializado en patrimonio cultural en español. Deriva de ALIA-es-cultural-heritage-7B-Base, basado en la familia Salamandra-7B, y ha sido entrenado con instrucciones sintéticas para responder consultas sobre patrimonio cultural e historia.
Descripción / Función
LLM patrimonio cultural (español)
Nombre modelo
ALIA-es-cultural-heritage-7B-Base
Model card
Comentarios
Versión de Salamandra 7B adaptada al ámbito del patrimonio cultural en español. Ha sido optimizada mediante preentrenamiento continuo y un posterior ajuste para seguir instrucciones, utilizando corpus especializados y cuidadosamente seleccionados sobre patrimonio cultural.
Descripción / Función
LLM instruido dominio legal y administrativo (español)
Nombre modelo
ALIA Legal-Administrative 7B Instruct
Model card
Comentarios
Modelo de lenguaje instruido y especializado en el ámbito jurídico y administrativo en español. Deriva de ALIA-es-legal-administrative-7B-Base, basado en la familia Salamandra-7B, y ha sido entrenado con instrucciones sintéticas para responder consultas legales y administrativas.
Descripción / Función
LLM dominio legal y administrativo (español)
Nombre modelo
ALIA-es-legal-administrative-7B-Base
Model card
Comentarios
Versión de Salamandra 7B adaptada al ámbito jurídico y administrativo en español. Ha sido optimizada mediante preentrenamiento continuo con datos especializados y un posterior ajuste para seguir instrucciones del dominio.
Descripción / Función
LLM instruido turismo (inglés, español, valenciano)
Nombre modelo
Aitana-2B-S-tourism-Instruct
Model card
Comentarios
Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-S-tourism-base y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con capacidades especializadas para aplicaciones del ámbito turístico.
Descripción / Función
LLM turismo (inglés, español, valenciano)
Nombre modelo
Aitana-2B-S-tourism-base
Model card
Comentarios
Modelo de lenguaje generativo basado en Aitana-2B-S-base y entrenado adicionalmente con datos del dominio turístico.
Descripción / Función
LLM instruido - propiedad intelectual (inglés, español, valenciano)
Nombre modelo
Aitana-2B-S-IP-Instruct
Model card
Comentarios
Modelo generativo instruido de la familia Aitana. Está basado en Aitana-2B-S-IP-base y ha sido afinado para seguir instrucciones en valenciano, español e inglés, con capacidades especializadas para tareas del ámbito de la propiedad intelectual.
Descripción / Función
LLM propiedad intelectual (inglés, español, valenciano)
Nombre modelo
Aitana-2B-S-IP-base
Model card
Comentarios
Modelo de lenguaje generativo basado en Salamandra-2B y entrenado adicionalmente con datos especializados en propiedad intelectual.
Descripción / Función
LLM instruido - psicología (español)
Nombre modelo
ALIA-es-gemma-clinical-psychology-sft
Model card
Comentarios
Versión de Gemma 4 E4B IT afinada mediante aprendizaje supervisado para el asesoramiento psicológico y el diálogo terapéutico empático en español. Ha sido entrenada con un conjunto de conversaciones multiturno cuidadosamente seleccionado, compuesto por diálogos profesionales entre terapeutas y pacientes.
Encoders de dominio
Modelo encoder - biomédico (multilingüe)
MrBERT-biomed
Modelo encoder biomédico multilingüe basado en la arquitectura ModernBERT, . Se obtiene mediante adaptación de dominio a partir de MrBERT-es y ha sido entrenado con 24.130 millones de tokens, principalmente en inglés y español, junto con cantidades menores de otras lenguas europeas.
Modelo encoder - científico (bilingüe)
MrBERT-science
Modelo encoder científico bilingüe basado en la arquitectura ModernBERT. Se obtiene mediante adaptación de dominio a partir de MrBERT y ha sido entrenado con un corpus científico de 3.600 millones de tokens, compuesto por un 61,9% de inglés y un 38,1% de español.
Modelo encoder - jurídico (bilingüe)
MrBERT-legal
Modelo encoder jurídico bilingüe basado en la arquitectura ModernBERT. Se obtiene mediante adaptación de dominio a partir de MrBERT y ha sido entrenado con un corpus legal de 8.000 millones de tokens, compuesto por un 79,5% de inglés y un 20,5% de español.
Modelo encoder - propiedad intelectual (español e inglés)
Aitana-intellectual-property-mb-encoder
Modelo encoder especializado en propiedad intelectual, basado en ModernBERT-base y adaptado mediante preentrenamiento continuo con datos en español e inglés. Está optimizado para comprender y representar textos jurídicos y técnicos relacionados con este ámbito.
Modelo encoder - turismo (estañol, valenciano)
Aitana-tourism-mb-encoder-1.0
Modelo encoder especializado en turismo, basado en ModernBERT-base y adaptado mediante preentrenamiento continuo con datos en español y valenciano. Está optimizado para comprender textos turísticos, como descripciones de hoteles, guías de destinos, servicios de viaje y contenidos sobre patrimonio cultural.
Modelo encoder - periodístico, legal-administrativo y parlamentari(euskera)
JaunBERT
Modelo encoder basado en la arquitectura ModernBERT y obtenido mediante la adaptación de MrBERT al euskera y a los dominios periodístico, legal-administrativo y parlamentario. Fue entrenado con Latxa Corpus v2 y está orientado a tareas discriminativas como clasificación, reconocimiento de entidades, etiquetado morfosintáctico, detección de intenciones y recuperación de información.
Modelo bi-encoder - biomédico (español)
ALIA-MrBERT-es-biomedical-embeddings
Modelo bi-encoder especializado en el ámbito biomédico en español, orientado a tareas de similitud semántica y recuperación de información. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos biomédicos mediante una estrategia de aprendizaje curricular.
Modelo bi-encodern - jurídico (español)
ALIA-MrBERT-es-legal-embeddings
Modelo bi-encoder especializado en los ámbitos jurídico y administrativo en español, orientado a tareas de similitud semántica y recuperación de información. Está bbasado en MrBERT-es con arquitectura ModernBERT, y ha sido afinado con datos jurídicos y administrativos mediante una estrategia de aprendizaje curricular.
Modelo bi-encoder - patrimonio cultural (español)
ALIA-MrBERT-es-cultural-embeddings
Modelo bi-encoder especializado en patrimonio cultural en español, orientado a tareas de similitud semántica y recuperación de información. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos del dominio mediante una estrategia de aprendizaje curricular.
Modelo cross-encoder - biomédico (español)
ALIA-MrBERT-es-biomedical-reranker
Modelo cross-encoder especializado en el ámbito biomédico en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos biomédicos mediante una estrategia de aprendizaje curricular.
Modelo cross-encoder - biomédico (español)
ALIA-MrBERT-es-legal-reranker
Modelo cross-encoder especializado en los ámbitos jurídico y administrativo en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos jurídicos y administrativos mediante una estrategia de aprendizaje curricular.
Modelo cross-encoder - patrimonio cultural (español)
ALIA-MrBERT-es-cultural-reranker
Modelo cross-encoder especializado en patrimonio cultural en español, orientado a tareas de recuperación de información y reordenación de documentos. Está basado en MrBERT-es, con arquitectura ModernBERT, y ha sido afinado con datos del dominio mediante una estrategia de aprendizaje curricular.
Modelos especializados en tareas de texto
Descripción / Función
Moderación de contenido
Nombre modelo
Salamandra-7b-instruct-guard
Model card
Comentarios
Modelo de clasificación de seguridad diseñado para la moderación de contenido en catalán, español e inglés. Está construido sobre Salamandra-7b-Instruct.
Descripción / Función
Detección de fraude
Nombre modelo
Aitana Enc Fraud Detection
Model card
Comentarios
Modelo ajustado a partir de mRoBERTa para la clasificación binaria de la detección de phishing en textos en inglés.
Descripción / Función
Detección marcas falsas
Nombre modelo
Aitana-MarcasFalsas-R-1.0
Model card
Comentarios
Modelo basado en BSC-LT/MrBERT y afinado para detectar menciones de marcas falsas en textos en español e inglés. Está diseñado como un clasificador binario que asigna cada texto a una de dos categorías.
Descripción / Función
Lenguaje claro
Nombre modelo
Aitana-ClearLangDetection-R-1.0
Model card
Comentarios
Modelo ajustado a partir de mRoBERTa para la tarea de clasificación de lenguaje claro en textos en español.
Descripción / Función
Detección de entidades nombradas - SNOMED (español)
Nombre modelo
ALIA-MrBERT-es-snomed-dental-ner-ctx8192
Model card
Comentarios
Modelo NER en español especializado en odontología, basado en MrBERT-es y ajustado con datos clínicos del ámbito dental. Está diseñado para identificar entidades asociadas a unos 400 códigos SNOMED CT y actúa como módulo de extracción dentro de un sistema de vinculación y normalización de conceptos clínicos.
Descripción / Función
Detección de entidades nombradas - SNOMED (español)
Nombre modelo
ALIA-MrBERT-es-snomed-dental-ner-multiclass-ctx8192
Model card
Comentarios
Modelo NER multiclase en español especializado en odontología, basado en MrBERT-es y ajustado con datos clínicos dentales. Funciona como un clasificador directo de tokens que identifica entidades clínicas y les asigna su código SNOMED CT correspondiente en una única inferencia, mediante un esquema de etiquetado BIO específico para cada concepto.
Descripción / Función
Corrección gramatical (gallego)
Nombre modelo
CarvalhoChat_GEC
Model card
Comentarios
Adaptador LoRA especializado en la corrección de errores gramaticales en gallego, diseñado para introducir únicamente los cambios necesarios y preservar el significado original. Fue ajustado a partir de CarvalhoChat_v4 con datos de alta calidad y debe aplicarse sobre el modelo base, ya que no constituye un modelo completo.
Descripción / Función
Detección de entidades nombradas (gallego)
Nombre modelo
MrBERT-nos-gl-NER
Model card
Model card
Versión ajustada de MrBERT-nos-gl para el reconocimiento de entidades nombradas (NER) en gallego, capaz de identificar cuatro tipos de entidades: PER, ORG, LOC, MISC.
Descripción / Función
POS tagging (gallego)
Nombre modelo
MrBERT-nos-gl-POS
Model card
Model card
Versión ajustada de MrBERT-nos-gl para el etiquetado morfosintáctico de categorías gramaticales (POS tagging) en gallego.
Descripción / Función
Análisis de sentimiento (gallego)
Nombre modelo
MrBERT-nos-gl-sentiment
Model card
Model card
Versión ajustada de MrBERT-nos-gl para el análisis de sentimiento en gallego, con clasificación en tres categorías: positivo, neutral y negativo.
Descripción / Función
Clasificación temática de noticias (gallego)
Nombre modelo
MrBERT-nos-gl-thematic-press-classifier
Model card
Model card
Versión ajustada de MrBERT-nos-gl para la clasificación temática de artículos de prensa en gallego según sus secciones editoriales.
Descripción / Función
Normalización (euskera)
Nombre modelo
marianmt-cap-punct-eu
Model card
Comentarios
Modelo de traducción automática que sirve para capitalizar y puntuar texto normalizado en euskera. El modelo ha sido entrenado desde cero utilizando Marian NMT y un dataset de 9.784.905 frases en euskera
Descripción / Función
Normalización (euskera)
Nombre modelo
marianmt-cap-punct-es
Model card
Comentarios
Modelo de traducción automática que sirve para capitalizar y puntuar texto normalizado en español. El modelo ha sido entrenado desde cero utilizando Marian NMT y un dataset de 9.784.905 frases en castellano.
Última actualización
