For the complete documentation index, see llms.txt. This page is also available as Markdown.

↔️Datos y herramientas para traducción automática

Corpus paralelos para entrenamiento

BSC_ParaMT_8

Idiomas: catalán, español, inglés, árabe, hindi, chino, japonés y coreano. Pares lingüísticos: catalán, español e inglés emparejados con árabe, hindi, chino, japonés y coreano; 15 combinaciones lingüísticas. Volumen: 717.809.877 pares de oraciones. Tipo de datos: combinación de datos paralelos auténticos procedentes de fuentes públicas y datos sintéticos. La parte española incluye traducciones desde textos ingleses y la parte catalana contiene traducciones generadas desde textos ingleses y españoles mediante SalamandraTA 7B Instruct. Licencia: ODbL 1.0. Acceso: https://huggingface.co/datasets/BSC-LT/BSC_ParaMT_8

ALIA Mixed Authentic Synthetic MT

Idiomas: inglés, español, árabe, hindi, chino, japonés y coreano. Pares lingüísticos: inglés y español emparejados con árabe, hindi, chino, japonés y coreano; diez combinaciones lingüísticas. Volumen: 453.783.349 pares de oraciones. Tipo de datos: combinación de corpus paralelos auténticos y traducciones sintéticas. Los subconjuntos español-hindi y español-chino contienen traducciones al español generadas desde textos originales en inglés mediante SalamandraTA 7B Instruct. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/BSC-LT/ALIA_mixed_authentic_synthetic_MT

ALIA Synthetic MT V2

Idiomas: euskera, español e inglés. Pares lingüísticos: euskera-español y euskera-inglés; algunos subconjuntos contienen las tres lenguas. Volumen: aproximadamente 385.000 filas. Incluye 337.650 registros de Berria en euskera y español, 193.337 registros trilingües de Berria, 27.130 registros del BOPV y 20.385 registros parlamentarios, distribuidos en diferentes configuraciones. Tipo de datos: recurso mixto con textos originales en euskera, textos oficiales bilingües euskera-español y traducciones sintéticas al español y al inglés generadas mediante Qwen3.5-27B y LatxaQ. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_syntethic_MT_V2

ALIA Synthetic MT

Idiomas: euskera, inglés y español. Pares lingüísticos: euskera-inglés y euskera-español. Volumen: 68.863 documentos originales. Tipo de datos: artículos originales de Berria en euskera acompañados de traducciones sintéticas al inglés y al español generadas mediante Qwen3-32B y LatxaQ. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_syntethic_MT

CA-GL Parallel Corpus

Idiomas: catalán y gallego. Pares lingüísticos: catalán-gallego. Volumen: 33.668.599 pares de oraciones. Tipo de datos: corpus sintético en el que los textos gallegos proceden de recursos auténticos y las versiones catalanas fueron generadas mediante traducción automática. Licencia: CC BY-NC-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/CA-GL_Parallel_Corpus

CA-EU Parallel Corpus

Idiomas: catalán y euskera. Pares lingüísticos: catalán-euskera. Volumen: 10.471.139 pares de oraciones. Tipo de datos: corpus sintético en el que los textos en euskera son originales y las versiones catalanas fueron generadas mediante traducción automática. Licencia: CC BY-NC-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/CA-EU_Parallel_Corpus

Catalan-Aranese Parallel Corpus

Idiomas: catalán y aranés. Pares lingüísticos: catalán-aranés. Volumen: 539.110 pares de oraciones. Tipo de datos: combinación de corpus paralelos auténticos y traducciones sintéticas al catalán generadas desde textos monolingües araneses mediante SalamandraTA 7B Instruct. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/BSC-LT/Catalan-Aranese_Parallel_Corpus

ES-AN Parallel Corpus

Idiomas: español y aragonés. Pares lingüísticos: español-aragonés. Volumen: 47.521 pares de oraciones. Tipo de datos: corpus predominantemente sintético generado mediante Apertium y complementado con materiales procedentes de OPUS. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/ES-AN_Parallel_Corpus

ES-OC Parallel Corpus

Idiomas: español y occitano, especialmente la variedad aranesa. Pares lingüísticos: español-occitano o español-aranés. Volumen: 419.908 pares de oraciones. Tipo de datos: corpus predominantemente sintético generado mediante Apertium y complementado con materiales procedentes de OPUS y PILAR. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/ES-OC_Parallel_Corpus

ES-AST Parallel Corpus

Idiomas: español y asturiano. Pares lingüísticos: español-asturiano. Volumen: 704.378 pares de oraciones. Tipo de datos: combinación de pares auténticos procedentes de OPUS y traducciones sintéticas al español generadas desde textos originales en asturiano. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/ES-AST_Parallel_Corpus

Spanish-Valencian Catalan Parallel Corpus

Idiomas: español y valenciano. Pares lingüísticos: español-valenciano. Volumen: 2.162.451 pares de oraciones. Tipo de datos: combinación de datos paralelos auténticos procedentes de fuentes institucionales y traducciones sintéticas al español generadas desde textos originales en valenciano mediante SalamandraTA 7B Instruct. Licencia: CC BY-NC 4.0. Acceso: https://huggingface.co/datasets/BSC-LT/Spanish-Valencian_Catalan_Parallel_Corpus

MT_es-gl

Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: 16.117.630 pares de oraciones. Tipo de datos: agregación de corpus paralelos procedentes de diferentes fuentes, con materiales originales y recursos adaptados o traducidos automáticamente al gallego. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/MT_es-gl

MT_en-gl

Idiomas: inglés y gallego. Pares lingüísticos: inglés-gallego. Volumen: 16.280.672 pares de oraciones. Tipo de datos: combinación de corpus paralelos naturales y datos traducidos o poseditados automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/MT_en-gl

ALIA Multilingual Parallel Sentences

Idiomas: principalmente español y valenciano. Pares lingüísticos: español-valenciano, con una estructura preparada para incorporar diferentes combinaciones multilingües. Volumen: aproximadamente 9,86 millones de filas. Tipo de datos: agregación de corpus paralelos para tareas de traducción. Cada registro contiene oraciones alineadas y sus correspondientes códigos lingüísticos. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/alia_multilingual_parallel_sentences

Corpus paralelos institucionales y especializados por dominio

ALIA Parallel Translation

Idiomas: español e inglés. Pares lingüísticos: español-inglés. Volumen: 35.753.765 segmentos paralelos. Tipo de datos: corpus paralelo especializado elaborado a partir de fuentes oficiales y abiertas de los dominios jurídico-administrativo, biomédico y patrimonial. Incluye alineaciones a diferentes niveles de granularidad. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/SINAI/ALIA-parallel-translation

ALIA Heritage Parallel Translation

Idiomas: español e inglés. Pares lingüísticos: español-inglés, en dirección español → inglés. Volumen: 683.919 fragmentos paralelos o 288.955 documentos completos. Tipo de datos: textos sobre patrimonio cultural originalmente redactados en español y traducidos automáticamente al inglés mediante Qwen3-14B. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/SINAI/ALIA-heritage-parallel-translation

UV_PARALLEL_VA_ES

Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: aproximadamente 15.700 pares de textos u oraciones. Tipo de datos: textos institucionales bilingües procedentes de la Universitat de València, alineados para traducción automática. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uv_parallel_va_es

UV_PARALLEL_VA_EN

Idiomas: valenciano e inglés. Pares lingüísticos: valenciano-inglés. Volumen: aproximadamente 6.490 pares de textos u oraciones. Tipo de datos: textos institucionales bilingües procedentes de la Universitat de València. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uv_parallel_va_en

UJI_PARALLEL_VA_ES

Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: 93.079 pares o filas en la versión actual. Tipo de datos: noticias institucionales bilingües de la Universitat Jaume I, alineadas, filtradas y deduplicadas automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uji_parallel_va_es

UJI_PARALLEL_VA_EN

Idiomas: valenciano e inglés. Pares lingüísticos: valenciano-inglés. Volumen: 36.395 pares o filas. Tipo de datos: noticias institucionales bilingües de la Universitat Jaume I, alineadas, filtradas y deduplicadas automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uji_parallel_va_en

DOGV_PARALLEL

Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: aproximadamente 489.615 pares estimados Tipo de datos: documentos oficiales bilingües procedentes del Diari Oficial de la Generalitat Valenciana, alineados y filtrados automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/dogv_parallel

AMIC_PARALLEL

Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: 680.978 pares o filas. Tipo de datos: textos periodísticos bilingües publicados por medios vinculados a la Associació de Mitjans d’Informació i Comunicació, alineados y filtrados. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/amic_parallel

BOUA_PARALLEL

Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: 54.791 pares o filas. Tipo de datos: documentos institucionales bilingües procedentes del Boletín Oficial de la Universidad de Alicante. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/boua_parallel

DGT-GL

Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 320.000 pares de oraciones. Tipo de datos: corpus jurídico derivado de la memoria de traducción DGT. Los segmentos originales en portugués fueron adaptados automáticamente al gallego mediante Apertium, transliteración y localización lingüística. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/DGT-GL

SciELO-GL

Idiomas: español, inglés y gallego. Pares lingüísticos: español-gallego e inglés-gallego. Volumen: aproximadamente 300.000 oraciones alineadas. Tipo de datos: artículos científicos procedentes de SciELO. Los segmentos portugueses fueron adaptados automáticamente al gallego mediante Apertium, transliteración, localización léxica y normalización lingüística. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/SciELO-GL

ALIA Scientific Articles

Idiomas: euskera, español e inglés. Pares lingüísticos: euskera-español y euskera-inglés. Volumen: aproximadamente 9.880 registros. Tipo de datos: corpus de artículos científicos con textos originales y traducciones destinadas a crear datos paralelos para traducción especializada. Parte del recurso contiene traducciones generadas automáticamente. Licencia: CC-BY-SA. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_scientic_articles

ES-GL Museo Virtual USC Descricións Parallel

Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 1.110 pares alineados. Tipo de datos: descripciones de objetos y piezas del Museo Virtual de la Universidade de Santiago de Compostela, traducidas y alineadas en español y gallego. Licencia: CC-BY. Acceso: https://huggingface.co/datasets/proxectonos/es-gl_museo_virtual_usc_descricions_parallel

Datasets para fine tuning, instruction tuning y posedición

Finetuning-MT

Idiomas: gallego, portugués, español, catalán, euskera e inglés. Pares lingüísticos: múltiples direcciones, principalmente con gallego y portugués como lenguas pivote. Volumen: 198.922 instancias. Tipo de datos: dataset de instrucciones que combina frases y párrafos paralelos con tareas de traducción, posedición, tratamiento del género, transliteración y traducción de entidades. Parte de los materiales gallegos fue adaptada automáticamente desde el portugués. Licencia: CC BY 4.0. Uso previsto: ajuste por instrucciones de modelos lingüísticos para traducción automática y tareas relacionadas. Acceso: https://huggingface.co/datasets/proxectonos/Finetuning-MT

ACAData

Idiomas: asturiano, catalán, alemán, griego, español, inglés, euskera, francés, gallego, italiano, neerlandés y portugués. Pares lingüísticos: múltiples combinaciones entre las doce lenguas incluidas. Volumen: 739.211 pares de entrenamiento, equivalentes a 1.478.422 instrucciones bidireccionales, y 5.944 instancias de evaluación. Tipo de datos: párrafos académicos paralelos extraídos de repositorios europeos y alineados automáticamente mediante similitud semántica. Incluye un conjunto de entrenamiento y un benchmark independiente. Licencia: CC BY 4.0. Uso previsto: ajuste por instrucciones, adaptación al dominio académico y evaluación comparativa de sistemas de traducción y modelos lingüísticos. Acceso: https://huggingface.co/datasets/BSC-LT/ACAData

Erros Sistemáticos de Tradución ES-GL

Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 13.600 instancias. Tipo de datos: ejemplos de traducción organizados en torno a errores sistemáticos frecuentes entre español y gallego, con información útil para aprender a detectar o corregir dichos errores. Licencia: CC BY 4.0. Uso previsto: ajuste fino, posedición automática, corrección de errores de traducción y análisis contrastivo español-gallego. Acceso: https://huggingface.co/datasets/proxectonos/erros_sistematicos_traducion_es_gl

Recursos léxicos, terminológicos y fraseológicos

MT Wikidata Labels GL

Idiomas: gallego y múltiples lenguas disponibles en Wikidata. Pares lingüísticos: etiquetas de diferentes lenguas alineadas con sus equivalentes en gallego. Volumen: 16.117.829 etiquetas y descripción. Tipo de datos: pares léxicos y terminológicos construidos a partir de etiquetas multilingües de Wikidata y sus equivalencias en gallego. Licencia: CC BY 4.0. Uso previsto: traducción léxica, creación de diccionarios bilingües, alineamiento terminológico y adaptación de modelos de traducción al gallego. Acceso: https://huggingface.co/datasets/proxectonos/MT_wikidata-labels-gl

ES-GL Bens Culturais Parallel

Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 11.500 pares alineados. Tipo de datos: definiciones y recursos terminológicos procedentes de tesauros oficiales de patrimonio cultural, traducidos, limpiados y alineados en español y gallego. Licencia: CC BY 4.0. Uso previsto: traducción automática especializada, adaptación de dominio, extracción terminológica y creación de recursos bilingües sobre patrimonio cultural. Acceso: https://huggingface.co/datasets/proxectonos/es-gl_bensculturais_parallel

Spanish–Galician Idiom Parallel Corpus

Idiomas: español y gallego. Pares lingüísticos: español-gallego y gallego-español. Volumen: 17.198 pares direccionales: 8.399 de español a gallego y 8.799 de gallego a español. Tipo de datos: corpus especializado de expresiones idiomáticas, locuciones, coloquialismos y lenguaje figurado, alineado manualmente. Licencia: CC BY 4.0. Uso previsto: entrenamiento y evaluación de traducción de expresiones idiomáticas y análisis contrastivo de la fraseología española y gallega. Acceso: https://huggingface.co/datasets/proxectonos/corpus_paralelo_idioms

Conjuntos de evaluación y benchmarks

ES-CA Translation Test

Idiomas: español y catalán. Pares lingüísticos: español-catalán. Volumen: 1.958 ejemplos. Tipo de datos: oraciones en español procedentes de Common Voice, seleccionadas y traducidas manualmente al catalán por una persona especialista. Licencia: CC BY 4.0. Uso previsto: evaluación de sistemas de traducción español-catalán y participación en la tarea Phrases de Iberobench. Acceso: https://huggingface.co/datasets/gplsi/ES-CA_translation_test

ES-VA Translation Test

Idiomas: español y valenciano. Pares lingüísticos: español-valenciano. Volumen: 1.958 ejemplos. Tipo de datos: oraciones de Common Voice traducidas y adaptadas manualmente al valenciano por especialistas. Licencia: CC BY 4.0. Uso previsto: evaluación de sistemas de traducción español-valenciano y participación en Iberobench. Acceso: https://huggingface.co/datasets/gplsi/ES-VA_translation_test

CA-VA Alignment Test

Idiomas: catalán y valenciano. Pares lingüísticos: catalán-valenciano. Volumen: 1.958 ejemplos . Tipo de datos: versiones catalanas y valencianas traducidas y adaptadas manualmente a partir de las mismas oraciones originales en español. Licencia: CC BY 4.0. Uso previsto: evaluación de sistemas de traducción entre catalán y valenciano y análisis de diferencias dialectales, léxicas y estilísticas. Acceso: https://huggingface.co/datasets/gplsi/CA-VA_alignment_test

ES_VACA

Idiomas: español, valenciano y catalán. Pares lingüísticos: español-valenciano, español-catalán y catalán-valenciano. Volumen: 802 instancias. Tipo de datos: recurso trilingüe destinado a comparar traducciones y variantes entre español, valenciano y catalán. Licencia: CC BY 4.0. Uso previsto: evaluación de traducción automática y análisis contrastivo entre español, valenciano y catalán. Acceso: https://huggingface.co/datasets/gplsi/es_vaca

ALMO-MWE

Idiomas: español e inglés. Pares lingüísticos: español-inglés. Volumen: 235 ejemplos. Tipo de datos: benchmark de traducción de expresiones multipalabra que incluye texto de entrada, traducción de referencia, respuestas producidas por distintos sistemas y puntuaciones de evaluación. Licencia: Apache 2.0. Uso previsto: evaluación y comparación de sistemas de traducción automática en expresiones multipalabra y fenómenos no composicionales. Acceso: https://huggingface.co/datasets/gplsi/almo-mwe

ALIA Document-Level MT Evaluation

Idiomas: principalmente euskera, español e inglés. Pares lingüísticos: euskera-español y euskera-inglés. Volumen: aproximadamente 1.050 instancias. Tipo de datos: conjunto de evaluación de traducción automática a nivel documental, con documentos completos o fragmentos extensos y traducciones de referencia. Licencia: CC BY SA 4.0. Uso previsto: evaluación de coherencia, consistencia terminológica, resolución de referencias y calidad global en traducción documental. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_DocMT_Evaluation

FLORES Plus Gender

Idiomas: euskera, español e inglés. Pares lingüísticos: español-euskera e inglés-euskera. Volumen: 518 ejemplos: 363 en el subconjunto español y 155 en el subconjunto inglés. Tipo de datos: extensión de FLORES diseñada para evaluar fenómenos de género. Incluye versiones masculinas y femeninas de las oraciones fuente y traducciones de referencia al euskera. Licencia: CC BY-SA 4.0. Uso previsto: evaluación de precisión de género, sesgo y calidad de traducción hacia una lengua sin género gramatical como el euskera. Acceso: https://huggingface.co/datasets/HiTZ/flores_plus_gender

WinoMTEus

Idiomas: euskera, con evaluación de traducciones principalmente al español y al francés. Pares lingüísticos: euskera-español y euskera-francés en el proceso de evaluación. Volumen: 1.827 instancias. Tipo de datos: adaptación al euskera de WinoMT, formada por oraciones con profesiones y referentes de género destinadas a comprobar cómo se traduce desde una lengua sin género gramatical hacia lenguas que sí lo expresan. Licencia: MIT. Uso previsto: evaluación de sesgo de género y resolución de referencias en sistemas de traducción automática. Acceso: https://huggingface.co/datasets/HiTZ/winomteus

Herramientas para modelos de traducción automática

Última actualización