↔️Datos y herramientas para traducción automática
Corpus paralelos para entrenamiento
BSC_ParaMT_8
Idiomas: catalán, español, inglés, árabe, hindi, chino, japonés y coreano. Pares lingüísticos: catalán, español e inglés emparejados con árabe, hindi, chino, japonés y coreano; 15 combinaciones lingüísticas. Volumen: 717.809.877 pares de oraciones. Tipo de datos: combinación de datos paralelos auténticos procedentes de fuentes públicas y datos sintéticos. La parte española incluye traducciones desde textos ingleses y la parte catalana contiene traducciones generadas desde textos ingleses y españoles mediante SalamandraTA 7B Instruct. Licencia: ODbL 1.0. Acceso: https://huggingface.co/datasets/BSC-LT/BSC_ParaMT_8
ALIA Mixed Authentic Synthetic MT
Idiomas: inglés, español, árabe, hindi, chino, japonés y coreano. Pares lingüísticos: inglés y español emparejados con árabe, hindi, chino, japonés y coreano; diez combinaciones lingüísticas. Volumen: 453.783.349 pares de oraciones. Tipo de datos: combinación de corpus paralelos auténticos y traducciones sintéticas. Los subconjuntos español-hindi y español-chino contienen traducciones al español generadas desde textos originales en inglés mediante SalamandraTA 7B Instruct. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/BSC-LT/ALIA_mixed_authentic_synthetic_MT
ALIA Synthetic MT V2
Idiomas: euskera, español e inglés. Pares lingüísticos: euskera-español y euskera-inglés; algunos subconjuntos contienen las tres lenguas. Volumen: aproximadamente 385.000 filas. Incluye 337.650 registros de Berria en euskera y español, 193.337 registros trilingües de Berria, 27.130 registros del BOPV y 20.385 registros parlamentarios, distribuidos en diferentes configuraciones. Tipo de datos: recurso mixto con textos originales en euskera, textos oficiales bilingües euskera-español y traducciones sintéticas al español y al inglés generadas mediante Qwen3.5-27B y LatxaQ. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_syntethic_MT_V2
ALIA Synthetic MT
Idiomas: euskera, inglés y español. Pares lingüísticos: euskera-inglés y euskera-español. Volumen: 68.863 documentos originales. Tipo de datos: artículos originales de Berria en euskera acompañados de traducciones sintéticas al inglés y al español generadas mediante Qwen3-32B y LatxaQ. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_syntethic_MT
CA-GL Parallel Corpus
Idiomas: catalán y gallego. Pares lingüísticos: catalán-gallego. Volumen: 33.668.599 pares de oraciones. Tipo de datos: corpus sintético en el que los textos gallegos proceden de recursos auténticos y las versiones catalanas fueron generadas mediante traducción automática. Licencia: CC BY-NC-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/CA-GL_Parallel_Corpus
CA-EU Parallel Corpus
Idiomas: catalán y euskera. Pares lingüísticos: catalán-euskera. Volumen: 10.471.139 pares de oraciones. Tipo de datos: corpus sintético en el que los textos en euskera son originales y las versiones catalanas fueron generadas mediante traducción automática. Licencia: CC BY-NC-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/CA-EU_Parallel_Corpus
Catalan-Aranese Parallel Corpus
Idiomas: catalán y aranés. Pares lingüísticos: catalán-aranés. Volumen: 539.110 pares de oraciones. Tipo de datos: combinación de corpus paralelos auténticos y traducciones sintéticas al catalán generadas desde textos monolingües araneses mediante SalamandraTA 7B Instruct. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/BSC-LT/Catalan-Aranese_Parallel_Corpus
ES-AN Parallel Corpus
Idiomas: español y aragonés. Pares lingüísticos: español-aragonés. Volumen: 47.521 pares de oraciones. Tipo de datos: corpus predominantemente sintético generado mediante Apertium y complementado con materiales procedentes de OPUS. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/ES-AN_Parallel_Corpus
ES-OC Parallel Corpus
Idiomas: español y occitano, especialmente la variedad aranesa. Pares lingüísticos: español-occitano o español-aranés. Volumen: 419.908 pares de oraciones. Tipo de datos: corpus predominantemente sintético generado mediante Apertium y complementado con materiales procedentes de OPUS y PILAR. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/ES-OC_Parallel_Corpus
ES-AST Parallel Corpus
Idiomas: español y asturiano. Pares lingüísticos: español-asturiano. Volumen: 704.378 pares de oraciones. Tipo de datos: combinación de pares auténticos procedentes de OPUS y traducciones sintéticas al español generadas desde textos originales en asturiano. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/projecte-aina/ES-AST_Parallel_Corpus
Spanish-Valencian Catalan Parallel Corpus
Idiomas: español y valenciano. Pares lingüísticos: español-valenciano. Volumen: 2.162.451 pares de oraciones. Tipo de datos: combinación de datos paralelos auténticos procedentes de fuentes institucionales y traducciones sintéticas al español generadas desde textos originales en valenciano mediante SalamandraTA 7B Instruct. Licencia: CC BY-NC 4.0. Acceso: https://huggingface.co/datasets/BSC-LT/Spanish-Valencian_Catalan_Parallel_Corpus
MT_es-gl
Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: 16.117.630 pares de oraciones. Tipo de datos: agregación de corpus paralelos procedentes de diferentes fuentes, con materiales originales y recursos adaptados o traducidos automáticamente al gallego. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/MT_es-gl
MT_en-gl
Idiomas: inglés y gallego. Pares lingüísticos: inglés-gallego. Volumen: 16.280.672 pares de oraciones. Tipo de datos: combinación de corpus paralelos naturales y datos traducidos o poseditados automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/MT_en-gl
ALIA Multilingual Parallel Sentences
Idiomas: principalmente español y valenciano. Pares lingüísticos: español-valenciano, con una estructura preparada para incorporar diferentes combinaciones multilingües. Volumen: aproximadamente 9,86 millones de filas. Tipo de datos: agregación de corpus paralelos para tareas de traducción. Cada registro contiene oraciones alineadas y sus correspondientes códigos lingüísticos. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/alia_multilingual_parallel_sentences
Corpus paralelos institucionales y especializados por dominio
ALIA Parallel Translation
Idiomas: español e inglés. Pares lingüísticos: español-inglés. Volumen: 35.753.765 segmentos paralelos. Tipo de datos: corpus paralelo especializado elaborado a partir de fuentes oficiales y abiertas de los dominios jurídico-administrativo, biomédico y patrimonial. Incluye alineaciones a diferentes niveles de granularidad. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/SINAI/ALIA-parallel-translation
ALIA Heritage Parallel Translation
Idiomas: español e inglés. Pares lingüísticos: español-inglés, en dirección español → inglés. Volumen: 683.919 fragmentos paralelos o 288.955 documentos completos. Tipo de datos: textos sobre patrimonio cultural originalmente redactados en español y traducidos automáticamente al inglés mediante Qwen3-14B. Licencia: CC BY-SA 4.0. Acceso: https://huggingface.co/datasets/SINAI/ALIA-heritage-parallel-translation
UV_PARALLEL_VA_ES
Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: aproximadamente 15.700 pares de textos u oraciones. Tipo de datos: textos institucionales bilingües procedentes de la Universitat de València, alineados para traducción automática. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uv_parallel_va_es
UV_PARALLEL_VA_EN
Idiomas: valenciano e inglés. Pares lingüísticos: valenciano-inglés. Volumen: aproximadamente 6.490 pares de textos u oraciones. Tipo de datos: textos institucionales bilingües procedentes de la Universitat de València. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uv_parallel_va_en
UJI_PARALLEL_VA_ES
Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: 93.079 pares o filas en la versión actual. Tipo de datos: noticias institucionales bilingües de la Universitat Jaume I, alineadas, filtradas y deduplicadas automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uji_parallel_va_es
UJI_PARALLEL_VA_EN
Idiomas: valenciano e inglés. Pares lingüísticos: valenciano-inglés. Volumen: 36.395 pares o filas. Tipo de datos: noticias institucionales bilingües de la Universitat Jaume I, alineadas, filtradas y deduplicadas automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/uji_parallel_va_en
DOGV_PARALLEL
Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: aproximadamente 489.615 pares estimados Tipo de datos: documentos oficiales bilingües procedentes del Diari Oficial de la Generalitat Valenciana, alineados y filtrados automáticamente. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/dogv_parallel
AMIC_PARALLEL
Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: 680.978 pares o filas. Tipo de datos: textos periodísticos bilingües publicados por medios vinculados a la Associació de Mitjans d’Informació i Comunicació, alineados y filtrados. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/amic_parallel
BOUA_PARALLEL
Idiomas: valenciano y español. Pares lingüísticos: valenciano-español. Volumen: 54.791 pares o filas. Tipo de datos: documentos institucionales bilingües procedentes del Boletín Oficial de la Universidad de Alicante. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/gplsi/boua_parallel
DGT-GL
Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 320.000 pares de oraciones. Tipo de datos: corpus jurídico derivado de la memoria de traducción DGT. Los segmentos originales en portugués fueron adaptados automáticamente al gallego mediante Apertium, transliteración y localización lingüística. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/DGT-GL
SciELO-GL
Idiomas: español, inglés y gallego. Pares lingüísticos: español-gallego e inglés-gallego. Volumen: aproximadamente 300.000 oraciones alineadas. Tipo de datos: artículos científicos procedentes de SciELO. Los segmentos portugueses fueron adaptados automáticamente al gallego mediante Apertium, transliteración, localización léxica y normalización lingüística. Licencia: CC BY 4.0. Acceso: https://huggingface.co/datasets/proxectonos/SciELO-GL
ALIA Scientific Articles
Idiomas: euskera, español e inglés. Pares lingüísticos: euskera-español y euskera-inglés. Volumen: aproximadamente 9.880 registros. Tipo de datos: corpus de artículos científicos con textos originales y traducciones destinadas a crear datos paralelos para traducción especializada. Parte del recurso contiene traducciones generadas automáticamente. Licencia: CC-BY-SA. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_scientic_articles
ES-GL Museo Virtual USC Descricións Parallel
Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 1.110 pares alineados. Tipo de datos: descripciones de objetos y piezas del Museo Virtual de la Universidade de Santiago de Compostela, traducidas y alineadas en español y gallego. Licencia: CC-BY. Acceso: https://huggingface.co/datasets/proxectonos/es-gl_museo_virtual_usc_descricions_parallel
Datasets para fine tuning, instruction tuning y posedición
Finetuning-MT
Idiomas: gallego, portugués, español, catalán, euskera e inglés. Pares lingüísticos: múltiples direcciones, principalmente con gallego y portugués como lenguas pivote. Volumen: 198.922 instancias. Tipo de datos: dataset de instrucciones que combina frases y párrafos paralelos con tareas de traducción, posedición, tratamiento del género, transliteración y traducción de entidades. Parte de los materiales gallegos fue adaptada automáticamente desde el portugués. Licencia: CC BY 4.0. Uso previsto: ajuste por instrucciones de modelos lingüísticos para traducción automática y tareas relacionadas. Acceso: https://huggingface.co/datasets/proxectonos/Finetuning-MT
ACAData
Idiomas: asturiano, catalán, alemán, griego, español, inglés, euskera, francés, gallego, italiano, neerlandés y portugués. Pares lingüísticos: múltiples combinaciones entre las doce lenguas incluidas. Volumen: 739.211 pares de entrenamiento, equivalentes a 1.478.422 instrucciones bidireccionales, y 5.944 instancias de evaluación. Tipo de datos: párrafos académicos paralelos extraídos de repositorios europeos y alineados automáticamente mediante similitud semántica. Incluye un conjunto de entrenamiento y un benchmark independiente. Licencia: CC BY 4.0. Uso previsto: ajuste por instrucciones, adaptación al dominio académico y evaluación comparativa de sistemas de traducción y modelos lingüísticos. Acceso: https://huggingface.co/datasets/BSC-LT/ACAData
Erros Sistemáticos de Tradución ES-GL
Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 13.600 instancias. Tipo de datos: ejemplos de traducción organizados en torno a errores sistemáticos frecuentes entre español y gallego, con información útil para aprender a detectar o corregir dichos errores. Licencia: CC BY 4.0. Uso previsto: ajuste fino, posedición automática, corrección de errores de traducción y análisis contrastivo español-gallego. Acceso: https://huggingface.co/datasets/proxectonos/erros_sistematicos_traducion_es_gl
Recursos léxicos, terminológicos y fraseológicos
MT Wikidata Labels GL
Idiomas: gallego y múltiples lenguas disponibles en Wikidata. Pares lingüísticos: etiquetas de diferentes lenguas alineadas con sus equivalentes en gallego. Volumen: 16.117.829 etiquetas y descripción. Tipo de datos: pares léxicos y terminológicos construidos a partir de etiquetas multilingües de Wikidata y sus equivalencias en gallego. Licencia: CC BY 4.0. Uso previsto: traducción léxica, creación de diccionarios bilingües, alineamiento terminológico y adaptación de modelos de traducción al gallego. Acceso: https://huggingface.co/datasets/proxectonos/MT_wikidata-labels-gl
ES-GL Bens Culturais Parallel
Idiomas: español y gallego. Pares lingüísticos: español-gallego. Volumen: aproximadamente 11.500 pares alineados. Tipo de datos: definiciones y recursos terminológicos procedentes de tesauros oficiales de patrimonio cultural, traducidos, limpiados y alineados en español y gallego. Licencia: CC BY 4.0. Uso previsto: traducción automática especializada, adaptación de dominio, extracción terminológica y creación de recursos bilingües sobre patrimonio cultural. Acceso: https://huggingface.co/datasets/proxectonos/es-gl_bensculturais_parallel
Spanish–Galician Idiom Parallel Corpus
Idiomas: español y gallego. Pares lingüísticos: español-gallego y gallego-español. Volumen: 17.198 pares direccionales: 8.399 de español a gallego y 8.799 de gallego a español. Tipo de datos: corpus especializado de expresiones idiomáticas, locuciones, coloquialismos y lenguaje figurado, alineado manualmente. Licencia: CC BY 4.0. Uso previsto: entrenamiento y evaluación de traducción de expresiones idiomáticas y análisis contrastivo de la fraseología española y gallega. Acceso: https://huggingface.co/datasets/proxectonos/corpus_paralelo_idioms
Conjuntos de evaluación y benchmarks
ES-CA Translation Test
Idiomas: español y catalán. Pares lingüísticos: español-catalán. Volumen: 1.958 ejemplos. Tipo de datos: oraciones en español procedentes de Common Voice, seleccionadas y traducidas manualmente al catalán por una persona especialista. Licencia: CC BY 4.0. Uso previsto: evaluación de sistemas de traducción español-catalán y participación en la tarea Phrases de Iberobench. Acceso: https://huggingface.co/datasets/gplsi/ES-CA_translation_test
ES-VA Translation Test
Idiomas: español y valenciano. Pares lingüísticos: español-valenciano. Volumen: 1.958 ejemplos. Tipo de datos: oraciones de Common Voice traducidas y adaptadas manualmente al valenciano por especialistas. Licencia: CC BY 4.0. Uso previsto: evaluación de sistemas de traducción español-valenciano y participación en Iberobench. Acceso: https://huggingface.co/datasets/gplsi/ES-VA_translation_test
CA-VA Alignment Test
Idiomas: catalán y valenciano. Pares lingüísticos: catalán-valenciano. Volumen: 1.958 ejemplos . Tipo de datos: versiones catalanas y valencianas traducidas y adaptadas manualmente a partir de las mismas oraciones originales en español. Licencia: CC BY 4.0. Uso previsto: evaluación de sistemas de traducción entre catalán y valenciano y análisis de diferencias dialectales, léxicas y estilísticas. Acceso: https://huggingface.co/datasets/gplsi/CA-VA_alignment_test
ES_VACA
Idiomas: español, valenciano y catalán. Pares lingüísticos: español-valenciano, español-catalán y catalán-valenciano. Volumen: 802 instancias. Tipo de datos: recurso trilingüe destinado a comparar traducciones y variantes entre español, valenciano y catalán. Licencia: CC BY 4.0. Uso previsto: evaluación de traducción automática y análisis contrastivo entre español, valenciano y catalán. Acceso: https://huggingface.co/datasets/gplsi/es_vaca
ALMO-MWE
Idiomas: español e inglés. Pares lingüísticos: español-inglés. Volumen: 235 ejemplos. Tipo de datos: benchmark de traducción de expresiones multipalabra que incluye texto de entrada, traducción de referencia, respuestas producidas por distintos sistemas y puntuaciones de evaluación. Licencia: Apache 2.0. Uso previsto: evaluación y comparación de sistemas de traducción automática en expresiones multipalabra y fenómenos no composicionales. Acceso: https://huggingface.co/datasets/gplsi/almo-mwe
ALIA Document-Level MT Evaluation
Idiomas: principalmente euskera, español e inglés. Pares lingüísticos: euskera-español y euskera-inglés. Volumen: aproximadamente 1.050 instancias. Tipo de datos: conjunto de evaluación de traducción automática a nivel documental, con documentos completos o fragmentos extensos y traducciones de referencia. Licencia: CC BY SA 4.0. Uso previsto: evaluación de coherencia, consistencia terminológica, resolución de referencias y calidad global en traducción documental. Acceso: https://huggingface.co/datasets/HiTZ/ALIA_DocMT_Evaluation
FLORES Plus Gender
Idiomas: euskera, español e inglés. Pares lingüísticos: español-euskera e inglés-euskera. Volumen: 518 ejemplos: 363 en el subconjunto español y 155 en el subconjunto inglés. Tipo de datos: extensión de FLORES diseñada para evaluar fenómenos de género. Incluye versiones masculinas y femeninas de las oraciones fuente y traducciones de referencia al euskera. Licencia: CC BY-SA 4.0. Uso previsto: evaluación de precisión de género, sesgo y calidad de traducción hacia una lengua sin género gramatical como el euskera. Acceso: https://huggingface.co/datasets/HiTZ/flores_plus_gender
WinoMTEus
Idiomas: euskera, con evaluación de traducciones principalmente al español y al francés. Pares lingüísticos: euskera-español y euskera-francés en el proceso de evaluación. Volumen: 1.827 instancias. Tipo de datos: adaptación al euskera de WinoMT, formada por oraciones con profesiones y referentes de género destinadas a comprobar cómo se traduce desde una lengua sin género gramatical hacia lenguas que sí lo expresan. Licencia: MIT. Uso previsto: evaluación de sesgo de género y resolución de referencias en sistemas de traducción automática. Acceso: https://huggingface.co/datasets/HiTZ/winomteus
Herramientas para modelos de traducción automática
Herramienta optimizada para el alineamiento de oraciones, párrafos y documentos: https://github.com/gplsi/translation-alignment
Última actualización
