🔠Datos y herramientas para modelos de texto
Corpus textuales para preentrenamiento y adaptación
Corpus generales, institucionales y multilingües
CATalog: Corpus textual masivo compuesto por 17.450.496.729 palabras (aproximadamente 23 mil millones de tokens), distribuidas en 34.816.765 documentos provenientes de una amplia variedad de fuentes, con un porcentaje significativo de textos curados manualmente.
Acceso: https://huggingface.co/datasets/projecte-aina/CATalog
CorpusNÓS: Corpus masivo en gallego concebido principalmente para entrenar grandes modelos lingüísticos. Está compuesto por textos procedentes de una amplia variedad de fuentes y géneros, incluidos libros, artículos de investigación, prensa, textos gubernamentales, datos enciclopédicos, contenidos web, rastreos web, blogs y corpus de traducción.
Acceso: https://huggingface.co/datasets/proxectonos/corpusnos
ALIA_DOGV Dataset: Corpus textual bilingüe valenciano-español proveniente del Diari Oficial de la Generalitat Valenciana.
ALIA_BOUA Dataset: Corpus textual bilingüe valenciano-español proveniente del Boletín Oficial de la Universidad de Alicante.
ALIA_LES_CORTS Dataset: Corpus textual bilingüe valenciano-español proveniente de Les Corts Valencianes.
Acceso: https://huggingface.co/datasets/gplsi/alia_les_corts
ALIA_AMIC Dataset: Corpus textual en valenciano proveniente de periódicos/blogs del repositorio AMIC.
ALIA_GVA_Communications: Corpus de textos centrado en las comunicaciones oficiales de la Generalitat Valenciana (GVA).
Acceso: https://huggingface.co/datasets/gplsi/alia_gva_communications
ALIA_Valencian_Municipalities: Corpus de textos con información relativa a los ayuntamientos de la Comunitat Valenciana.
Acceso: https://huggingface.co/datasets/gplsi/alia_valencian_municipalities
ALIA_Daily_Newspapers: Corpus de textos extraídos de artículos de prensa y periódicos diarios de la Generalitat Valenciana.
Acceso: https://huggingface.co/datasets/gplsi/alia_daily_newspapers
ALIA_GVA_Grammar: Corpus de textos enfocado en recursos gramaticales o normativos de la Dirección General de Política Lingüística de la Generalitat Valenciana.
Acceso: https://huggingface.co/datasets/gplsi/alia_gva_grammar
ALIA_UJI: Corpus de textos procedentes de la Universitat Jaume I (UJI).
ALIA_UV: Corpus de textos procedentes con la Universitat de València (UV).
Corpus especializados por dominios
ALIA_TOURISM: Corpus especializado en el dominio turístico que incluye textos en valenciano, español e inglés. Cada documento incluye su fuente original, lo que permite filtrar el contenido según la licencia necesaria para cada caso de uso. Incluye un total de 79.15M tokens, de ellos 12.56M en valenciano, 65.34M en español y 1.35M en inglés.
ALIA_INTELLECTUAL_PROPERTY: Corpus especializado en el dominio de la propiedad intelectual que incluye en su versión actual textos en español. Incluye un total de 1130M tokens en español.
Acceso: https://huggingface.co/datasets/gplsi/alia_intellectual_property
ALIA Spanish Biomedical and Healthcare Corpus: Corpus de textos biomédicos oficiales y científicos en español, que incluye guías clínicas, registros médicos, publicaciones y boletines de salud, con más de 10 millones de instancias y 5.000 millones de tokens. Cubre áreas clave como la farmacología, la epidemiología, la salud pública y la investigación médica especializada.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-biomedical
ALIA Spanish Cultural and Heritage Corpus: Corpus de documentos sobre patrimonio cultural en español que incluye inventarios patrimoniales, revistas especializadas, registros de archivo, publicaciones institucionales y recursos descriptivos sobre patrimonio material e inmaterial, con 236.399 instancias y 946.467.028 tokens, distribuidos en 102 conjuntos de datos de origen.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-cultural
ALIA Spanish Legal and Administrative Corpus: Recurso que reúne y organiza una amplia colección de documentos oficiales del ámbito jurídico y administrativo español. Con más de 7 millones de documentos y 5 mil millones de tokens, incluye boletines oficiales estatales, autonómicos y provinciales, registros especializados, documentos ministeriales, licitaciones, contratos públicos y actas parlamentarias, cubriendo así todo el ecosistema normativo e institucional español.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-legal-administrative
Corpus Dominio Legal-Administrativo: Corpus administrativo-legal que reúne textos oficiales de boletines y diarios institucionales gallegos, representativos del lenguaje jurídico-administrativo formal. Está formado por documentos completos y estructurados, con metadatos asociados, procedentes de tres fuentes principales: Boletín Oficial de la Provincia de A Coruña, Boletín Oficial de la Provincia de Pontevedra y Diario Oficial de Galicia.
Acceso: https://huggingface.co/datasets/proxectonos/corpus_dominio_legal_administrativo_tmp
Corpus Dominio Periodístico: Corpus periodístico que reúne textos informativos de prensa digital en gallego, representativos del registro periodístico contemporáneo y orientados a tareas de procesamiento del lenguaje natural. Incluye colecciones procedentes de CorpusNÓS con un esquema de datos simplificado, así como conjuntos más recientes con metadatos periodísticos completos. Las fuentes incluidas son medios digitales gallegos como Galicia é, Galicia Hoxe, Tempos Dixital, Xornal GL, A Nosa Terra, Nós Diario, Praza Pública y Código Cero.
Acceso: https://huggingface.co/datasets/proxectonos/corpus_dominio_periodistico
Corpus Dominio Científico: Corpus científico compuesto por publicaciones académicas de la Universidad de Santiago de Compostela y artículos científicos de Wikipedia en gallego y castellano. Reúne textos especializados y divulgativos, obtenidos de XML estructurado, PDF procesados mediante OCR y contenidos enciclopédicos, junto con sus principales metadatos.
Acceso: https://huggingface.co/datasets/proxectonos/corpus_dominio_cientifico
Corpus Dominio Museístico-Patrimonio: Corpus museístico-patrimonial que reúne recursos terminológicos especializados procedentes de tesauros oficiales, orientados a la descripción, clasificación y documentación del patrimonio cultural. Está compuesto por tres tesauros en español (bienes culturales, materias y técnicas) y una versión en gallego del tesauro de bienes culturales.
Acceso: https://huggingface.co/datasets/proxectonos/corpus_dominio_museistico_patrimonio
latxa-corpus-v2: Corpus en euskera que incluye textos en los dominio legal, administrativo, periodístico y científico/académico, entre otros.
Acceso: https://huggingface.co/datasets/HiTZ/latxa-corpus-v2
Datasets para instrucción, alineamiento y generación sintética
Instruction tuning
InstruCAT: Corpus que recopila más de 200.000 instrucciones destinadas al entrenamiento de modelos de lenguaje (LLMs) en tareas downstream, generadas a partir de los siguientes conjuntos de datos: caBreu, CatalanQA, CoQCat, GuiaCat, IntoxiCat, Parafraseja, PAWS-ca, sts-ca, WikiCat, CEIL, TECA y NLUCat. Estas instrucciones abarcan categorías como paráfrasis, detección de toxicidad, pregunta-respuesta, clasificación, resumen y análisis de sentimientos. Acceso: https://huggingface.co/datasets/projecte-aina/InstruCAT
ALIA Spanish Biomedical and Healthcare Synthetic Instructions Corpus: Corpus sintético de instrucciones en español para el dominio biomédico Incluye 639.456 instancias.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-biomedical-synthetic-instructions
ALIA Spanish Cultural and Heritage Synthetic Instructions Corpus: Corpus sintético de instrucciones en español para el dominio patrimonio cultural. Incluye 748.480 instancias.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-cultural-synthetic-instructions
ALIA Spanish Legal and Administrative Synthetic Instructions Corpus: Corpus sintético de instrucciones en español para el dominio legal-administrativo. Incluye más de 7,4 millones de pares instrucción–respuesta.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-legal-administrative-synthetic-instructions
CPT Instruction Datasets: Colección de conjuntos de datos sintéticos de instrucciones utilizados durante el preentrenamiento continuo de Model-small-instr-1, Model-small-instr-2 y Model-small-instr-3.
Acceso: https://huggingface.co/datasets/proxectonos/cpt_instruction_datasets
Wikipedia Multiple-Choice QA: Dataset de ajuste por instrucciones para preguntas de opción múltiple en gallego y portugués, con 1.486 y 547 instancias, respectivamente. Cada ejemplo incluye contexto, instrucción, pregunta, opciones de respuesta y solución correcta.
Acceso: https://huggingface.co/datasets/proxectonos/wikipedia_multiple_choice_qa
Adaptación a dominio
patrimonio_instruct: Dataset bilingüe de instrucciones para la adaptación de modelos al dominio del patrimonio cultural y la terminología museística. Incluye tareas de generación de definiciones en español y gallego y ejercicios de compleción léxica en gallego.
Acceso: https://huggingface.co/datasets/proxectonos/patrimonio_instruct
Dialogo conversacional
ALIA Spanish Clinical Psychology Dialogues Corpus: Corpus conversacional en español para entrenar y evaluar modelos en diálogo terapéutico empático y asesoramiento psicológico. Incluye 66 conversaciones clínicas simuladas por profesionales y 320 interacciones reales anonimizadas con la asistente Pía de la aplicación TerapIA.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-clinical-psychology-dialogues
Alineamiento por preferencias
Razonamiento
magpie-en-eu-reasoning-instructions-qwen3: Dataset bilingüe en inglés y euskera desarrollado para entrenar, alinear y evaluar modelos de razonamiento. Contiene un millón de instrucciones y dos millones de respuestas, organizadas en pares de respuesta elegida y rechazada, ambas con razonamiento paso a paso.
Acceso: https://huggingface.co/datasets/HiTZ/magpie-en-eu-reasoning-instructions-qwen3
Seguridad
ALIA-es-Safety-DPO: Dataset de preferencias en español para el alineamiento de modelos mediante Optimización Directa de Preferencias (DPO), orientado a mejorar la seguridad y el rechazo de solicitudes dañinas sin reducir la utilidad ante consultas legítimas.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-Safety-DPO
Generación de datos sintéticos
mPersonas: Dataset multilingüe y de código abierto que contiene descripciones de personalidad de alta calidad, generadas sintéticamente con DeepSeek-V3–0324. Emplea una metodología de síntesis de datos basada en personas, similar a la de PersonaHub.
Datasets para entrenamiento y evaluación por tarea
Recuperación de información
AbSanitas: Conjunto de datos en español para la recuperación de información biomédica, elaborado a partir de textos biomédicos recopilados de repositorios académicos oficiales y fuentes de acceso abierto. Está diseñado para apoyar el entrenamiento y la evaluación de modelos codificadores en tareas de recuperación de información y correspondencia semántica en el ámbito biomédico en español.
ALIA Spanish Biomedical and Healthcare Hard Negatives Corpus: Conjunto de datos que contiene hard negatives para entrenar modelos de recuperación densa especializados en lenguaje biomédico en español. Los hard negatives se generaron automáticamente a partir de pares
<query, passage>de SINAI/ALIA-es-biomedical-pairs, mediante un pipeline basado en SentenceTransformers, FAISS y el modelo de embeddings Qwen3-Embedding-0.6B.Acceso:https://huggingface.co/datasets/SINAI/ALIA-es-biomedical-triplets
ALIA Spanish Cultural and Heritage Hard Negatives Corpus: Conjunto de datos que contiene hard negatives para entrenar modelos de recuperación densa especializados en el lenguaje del patrimonio cultural en español. Los hard negatives se generaron automáticamente a partir de pares
<query, passage>de SINAI/ALIA-es-cultural-pairs, mediante un pipeline basado en SentenceTransformers, FAISS y el modelo de embeddings Qwen3-Embedding-0.6B.Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-cultural-heritage-triplets
ALIA Spanish Legal and Administrative Hard Negatives Corpus: Conjunto de datos que contiene hard negatives para entrenar modelos de recuperación densa especializados en lenguaje jurídico-administrativo en español. Los hard negatives se generaron automáticamente a partir de pares
<query, passage>de SINAI/ALIA-es-legal-administrative-pairs, mediante un pipeline basado en SentenceTransformers, FAISS y el modelo de embeddings Qwen3-Embedding-0.6B.Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-legal-administrative-triplet
ALIA Spanish Biomedical and Healthcare Retrieval Pairs Corpus: Instancias tabulares diseñadas para entrenar y evaluar modelos orientados a la recuperación de información, como recuperadores densos o codificadores de embeddings. El conjunto de datos se basa en consultas fundamentadas en pasajes, generadas mediante un flujo de trabajo de prompting de estilo Qwen3 e integrado en el pipeline de codificadores de ALIA.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-biomedical-pairs
ALIA Spanish Cultural and Heritage Retrieval Pairs Corpus: Instancias tabulares diseñadas para entrenar y evaluar modelos orientados a la recuperación de información, como recuperadores densos o codificadores de embeddings. El conjunto de datos se basa en consultas fundamentadas en pasajes, generadas mediante un flujo de trabajo de prompting de estilo Qwen e integrado en el pipeline de codificadores de ALIA.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-cultural-pairs
ALIA Spanish Legal and Administrative Pairs Corpus: Instancias tabulares diseñadas para entrenar y evaluar modelos orientados a la recuperación de información, como recuperadores densos o codificadores de embeddings. El conjunto de datos se basa en consultas fundamentadas en pasajes, generadas mediante un flujo de trabajo de prompting de estilo Qwen3 e integrado en el pipeline de codificadores de ALIA.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-legal-administrative-pairs
Preguntas y respuestas
ALIA Spanish Legal and Administrative for Context Question Answering Corpus: Corpus de preguntas-respuestas en el dominio legal-administrativo
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-legal-cqa
Clasificación Textual
Clasificación temática y documental
LexBOE: Corpus en español para la clasificación de textos jurídicos, creado a partir de artículos publicados en el Boletín Oficial del Estado entre 2022 y 2024. Recoge lenguaje jurídico-administrativo contemporáneo y está diseñado para entrenar y evaluar modelos en tareas de clasificación legal.
AbScientia: Corpus en español para la clasificación de textos científicos del ámbito STEM, elaborado a partir de resúmenes procedentes de repositorios académicos oficiales y fuentes de acceso abierto. Está diseñado para entrenar y evaluar modelos encoder en tareas de clasificación temática relacionadas con ciencia, tecnología, ingeniería y matemáticas.
Fraude y falsificación
BALANCED_FAKE_JOB_POSTINGS_EN Dataset: Conjunto de textos en inglés diseñado para entrenar o evaluar modelos en una tarea de detección de fraude. Versión balanceada en inglés del conjunto de datos original de Kaggle Fake Job Postings Dataset: Real or Fake? Fake Job Posting Prediction. Incluye 1.730 ofertas de empleo, distribuidas equitativamente entre anuncios fraudulentos (falsos) y no fraudulentos (reales).
Acceso: https://huggingface.co/datasets/gplsi/fake_job_postings_balanced_en
BALANCED_FAKE_JOB_POSTINGS_VA Dataset: Conjunto de textos en valenciano diseñado para entrenar o evaluar modelos en una tarea de detección de fraude. Versión traducida del conjunto de datos original de Kaggle Fake Job Postings Dataset: Real or Fake? Fake Job Posting Prediction. Incluye 1.730 ofertas de empleo, distribuidas equitativamente entre anuncios fraudulentos (falsos) y no fraudulentos (reales).
Acceso: https://huggingface.co/datasets/gplsi/fake_job_postings_balanced_va
DISCRIMINATIVE COUNTERFEIT_ES Dataset: Conjunto de textos en español diseñado para entrenar o evaluar modelos en una tarea de verificación de marcas y detección de productos falsificados en entornos jurídicos y administrativos.
Acceso: https://huggingface.co/datasets/gplsi/discriminative_counterfeit_es
DISCRIMINATIVE COUNTERFEIT_EN Dataset: Conjunto de textos en inglés diseñado para entrenar o evaluar modelos en una tarea de verificación de marcas y detección de productos falsificados en entornos jurídicos y administrativos.
Acceso: https://huggingface.co/datasets/gplsi/discriminative_counterfeit_en
Claridad y complejidad lingüística
DISCRIMINATIVE CLEARSIM_ES Dataset: Conjunto de textos en español diseñado para entrenar o evaluar modelos en una tarea de clasificación relacionada con el lenguaje claro. El conjunto de datos está compuesto por pares y tríos de textos alineados en tres niveles de complejidad: lengua original, lengua facilitada y lectura fácil. Incluye un total de 13.953 textos, agrupados en 4.651 tripletas únicas.
Acceso: https://huggingface.co/datasets/gplsi/discriminative_clearsim_es
DISCRIMINATIVE CLEARSIM_VA Dataset: Conjunto de textos en valenciano diseñado para entrenar o evaluar modelos en una tarea de clasificación relacionada con el lenguaje claro. El conjunto de datos está compuesto por pares y tríos de textos alineados en tres niveles de complejidad: lengua original, lengua facilitada y lectura fácil. Incluye un total de 13.953 textos, agrupados en 4.651 tripletas únicas.
Acceso: https://huggingface.co/datasets/gplsi/discriminative_clearsim_va
Seguridad y fenómenos sociales
Salamandra Guard dataset: Corpus de clasificación de seguridad multilingüe diseñado para entrenar y evaluar sistemas de moderación de contenido en catalán y español. Consta de 21.335 ejemplos conversacionales cuidadosamente seleccionados y anotados según una taxonomía de seguridad jerárquica. Este conjunto de datos representa un avance significativo en datos de seguridad con base cultural, con especial énfasis en el catalán junto con el español y el inglés.
Acceso: https://huggingface.co/datasets/BSC-LT/salamandra-guard-dataset
Safety-SeGa: Conjunto de datos trilingüe en euskera, español e inglés para evaluar la seguridad de los modelos de lenguaje. Incluye 120 instrucciones inseguras y 120 seguras de temática similar, y permite medir tanto los contenidos dañinos que el modelo no rechaza como las solicitudes benignas que bloquea incorrectamente.
Safety-GuardEUS: Conjunto de datos en euskera diseñado para evaluar modelos de moderación, filtros de seguridad y sistemas de protección de modelos de lenguaje. Incluye ejemplos de respuestas seguras e inseguras, clasificadas según distintas categorías de riesgo, y permite analizar si estos sistemas detectan correctamente contenidos potencialmente dañinos.
Acceso: https://huggingface.co/datasets/HiTZ/safety-GuardEUS
ALIA Spanish Discriminative Stance Detection Corpus: Corpus de 3.000 instancias anotadas manualmente para la detección de postura (stance classification) en español. Ha sido construido a partir de comentarios reales de ciudadanos publicados en la plataforma de democracia participativa Decide Madrid. Cada instancia está formada por un tema cívico —definido mediante su título y descripción— y un comentario ciudadano asociado. La postura expresada en cada comentario ha sido clasificada como a favor, en contra o neutral por tres anotadores humanos independientes.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-discriminative-stance-detection
ALIA Spanish Discriminative Hate Speech Corpus: Corpus de gran escala en español para la detección del discurso de odio, construido a partir de comentarios seleccionados de redes sociales y anotado automáticamente mediante una arquitectura de múltiples expertos basada en LLM, con Fusion of Experts (FoE). La publicación incluye: 228.708 instancias, comentarios en español procedentes de YouTube y TikTok, predicciones y explicaciones individuales generadas por tres expertos LLM y salidas finales fusionadas para la clasificación discriminativa del discurso de odio.
Acceso: https://huggingface.co/datasets/SINAI/ALIA-es-discriminative-hate-speech
Análisis de sentimientos
sentimento-gl: Corpus en lengua gallega para entrenar y evaluar modelos de análisis de sentimiento, con más de 45.000 oraciones y cerca de 80.000 tokens.
Acceso: https://huggingface.co/datasets/proxectonos/sentimento-gl
Extracción y análisis lingüístico
Galician NER: Corpus en lengua gallega anotado y revisado manualmente para entrenar y evaluar modelos de reconocimiento de entidades nombradas (NER), que permiten identificar, delimitar y clasificar semánticamente nombres propios en categorías estandarizadas como persona, organización, localización y otras.
Acceso: https://huggingface.co/datasets/proxectonos/Galician_NER
UD_Galician-PUD: Corpus de 1.000 frases gallegas anotadas con sus dependencias sintácticas . Es relevante tanto por su utilidad en el desarrollo de herramientas de PLN en gallego como por su valor para realizar comparaciones sintácticas con el resto de las lenguas del PUD.
Acceso: https://huggingface.co/datasets/proxectonos/UD_Galician-PUD
Corrección gramatical y ortográfica
Galician GEC Corpora: Colección de conjuntos de datos en gallego para entrenar y evaluar sistemas de corrección gramatical, ortográfica y de puntuación. Reúne más de 120.000 pares de frases incorrectas y corregidas procedentes de cinco fuentes, entre ellas textos académicos, parlamentarios, Wikipedia y ejemplos sintéticos. Algunos registros también incluyen el tipo de error, etiquetas y explicaciones de la corrección.
Acceso: https://huggingface.co/datasets/proxectonos/galician-gec-corpora
Generación y transformación de texto
summarization_gl: Conjunto de datos gallego de resumen construido a partir de artículos de noticias y resúmenes extraídos automáticamente de tres fuentes de noticias gallegas: Nós Diario, Que Pasa na Costa y Praza Pública. El conjunto de datos contiene 80.829 instancias en total. Cada instancia incluye un texto periodístico y su resumen asociado.
Acceso: https://huggingface.co/datasets/proxectonos/summarization_gl
Benchmarks de evaluación
Competencia lingüística, aceptabilidad gramatical y compleción
Multi-LMentry: Conjunto de datos en nueve idiomas diseñado para evaluar LLMs en tareas de razonamiento y comprensión de nivel elemental; facilitar comparaciones multilingües, en particular entre idiomas con abundantes recursos y aquellos con recursos limitados; y servir como herramienta de diagnóstico o como un conjunto de pruebas unitarias para examinar las habilidades fundamentales de los modelos. Se trata de una extensión multilingüe de LMentry.
Acceso: https://huggingface.co/datasets/BSC-LT/multi_lmentry
CALAME-gl: Traducción/adaptación al gallego del benchmark portugués CALAME-PT.
El conjunto de datos está compuesto por textos o contextos breves y sus respectivas últimas palabras. Estos contextos están diseñados para contener información suficiente para que una persona o un modelo pueda inferir la palabra final, evitando al mismo tiempo contextos excesivamente específicos o demasiado ambiguos. Esta versión contiene 930 instancias en formato JSON y está destinada principalmente a la evaluación.
Acceso: https://huggingface.co/datasets/proxectonos/calame-gl
CieaCOVA: Dataset generado a partir de la creación manual. Está diseñado para reflejar competencias lingüísticas específicas, sirviendo como una herramienta robusta para medir el dominio del valenciano por parte de los modelos de inteligencia artificial.
GalCoLA: Conjunto de datos de aceptabilidad gramatical en gallego en formato TSV. Está diseñado para la clasificación binaria a nivel de oración, en la que cada oración se etiqueta como gramaticalmente correcta o gramaticalmente incorrecta. El conjunto de datos reúne adaptaciones de materiales gallegos al estilo CoLA procedentes de dos contextos de investigación previos: conjuntos de datos de evaluación sintáctica dirigida de PROPOR 2022 y conjuntos de datos de dependencias de control de ACL 2023. GalCoLA contiene 17.088 oraciones en total.
Veracidad
VeritasQA: Corpus diseñado para evaluar grandes modelos de lenguaje sobre la veracidad en un entorno zero-shot, basado en el corpus TruthfulQA. Incluye 353 pares de preguntas-respuestas inspiradas en ideas erróneas y falsedades comunes.
Acceso: https://huggingface.co/datasets/projecte-aina/veritasQA
VeritasQA_gl: Versión gallega de VeritasQA, un benchmark para evaluar la veracidad de sistemas de preguntas y respuestas y modelos lingüísticos. Está diseñado para comprobar si los modelos reproducen conceptos erróneos y falsedades comunes en lugar de ofrecer respuestas veraces.
Acceso: https://huggingface.co/datasets/proxectonos/veritasqa_gl
TruthfulQA_gl: La versión gallega del conjunto de datos TruthfulQA. Este conjunto de datos se utiliza para medir la veracidad de un modelo lingüístico al generar respuestas a preguntas. Incluye preguntas de distintas categorías que algunas personas responderían incorrectamente debido a creencias falsas o ideas erróneas. Esta versión incluye únicamente la partición de generación.
Acceso: https://huggingface.co/datasets/proxectonos/truthfulqa_gl
TruthfulQA_VA: Dataset adaptado mediante traducción manual por expertos. Su propósito es medir la propensión de los modelos a generar respuestas veraces frente a falsedades comunes o sesgos cognitivos, ahora íntegramente disponible en valenciano.
Conocimiento cultural
IBERtaQA: Benchmark multilingüe y multicultural de preguntas de opción múltiple diseñado para evaluar conocimiento factual y cultural en el contexto ibérico. Incluye preguntas sobre distintos ámbitos culturales y permite analizar tanto la cobertura de conocimiento local como la consistencia de las respuestas de los modelos entre distintas lenguas.
BLEnD: Recurso orientado a evaluar la adaptación cultural y lingüística de los modelos a través de preguntas sobre conocimiento cotidiano, prácticas sociales y realidades locales. La incorporación del euskera a este benchmark permite analizar hasta qué punto los modelos capturan formas de conocimiento cultural que no suelen estar reflejadas en recursos generalistas o en la web
Acceso: https://github.com/BLEnD-SemEval2026/SemEval-2026-Task-7
Seguimiento de instrucciones y alineación
IFEval_es: Traducción al castellano del corpus IFEval, diseñado para evaluar modelos de lenguaje optimizados para chat o instrucciones. El conjunto de datos incluye 541 "instrucciones verificables", como "escribir más de 400 palabras" y "mencionar la palabra clave de la IA al menos 3 veces", que se pueden verificar mediante heurística. Cada instancia contiene una única solicitud de entrada.
IFEval_ca: Traducción al catalán del corpus IFEval, diseñado para evaluar modelos de lenguaje optimizados para chat o instrucciones. El conjunto de datos incluye 541 "instrucciones verificables", como "escribir más de 400 palabras" y "mencionar la palabra clave de la IA al menos 3 veces", que se pueden verificar mediante heurística. Cada instancia contiene una única solicitud de entrada.
Acceso: https://huggingface.co/datasets/projecte-aina/IFEval_ca
hhh_alignment_es: Traducción al castellano del corpus hhh_alignment de preguntas y respuestas. Está diseñado para evaluar los modelos de lenguaje en cuanto a alineación, con una clasificación pragmática en las categorías de utilidad, honestidad/precisión, inocuidad y otros. Cada instancia contiene una solicitud y dos respuestas posibles.
Acceso: https://huggingface.co/datasets/BSC-LT/hhh_alignment_es
hhh_alignment_ca: Traducción al catalán del corpus hhh_alignment de preguntas y respuestas. Está diseñado para evaluar los modelos de lenguaje en cuanto a alineación, con una clasificación pragmática en las categorías de utilidad, honestidad/precisión, inocuidad y otros. Cada instancia contiene una solicitud y dos respuestas posibles.
Acceso: https://huggingface.co/datasets/projecte-aina/hhh_alignment_ca
OPEN_ASSISTANT_VA: Subconjunto en valenciano del corpus OpenAssistant/oasst2, seleccionado mediante filtrado automático y categorización manual en cuatro dimensiones de alineamiento:afirmaciones, incertidumbre, preguntas existenciales y restricciones ética.
Seguridad, robustez y red teaming
Aya Nós: Dataset multilingüe de red teaming para evaluar la seguridad de modelos en el ámbito lingüístico ibérico. Incluye prompts revisados por personas expertas en español, gallego y portugués, corrige errores de la versión original en español de Aya Red-teaming y aporta adaptaciones cultural y lingüísticamente adecuadas para las otras dos lenguas. Su finalidad es detectar vulnerabilidades y mejorar el alineamiento de seguridad de los modelos.
Emoción y razonamiento social
EQ-bench_es: Versión traducida al castellano y adaptada lingüísticamente del conjunto de datos original EQ-Bench, diseñado para evaluar el razonamiento emocional en modelos de lenguaje mediante indicaciones basadas en diálogos. Su diseño responde a la necesidad de ajustar las capacidades de detección emocional de los modelos multilingües, reconociendo que la expresión y la percepción de las emociones pueden variar de manera significativa entre lenguas.
EQ-bench_ca: Versión traducida al calalán y adaptada lingüísticamente del conjunto de datos original EQ-Bench, diseñado para evaluar el razonamiento emocional en modelos de lenguaje mediante indicaciones basadas en diálogos. Su diseño responde a la necesidad de ajustar las capacidades de detección emocional de los modelos multilingües, reconociendo que la expresión y la percepción de las emociones pueden variar de manera significativa entre lenguas.
SIQA_es: Traducción y adaptación al español del conjunto de validación de SIQA (Social Interaction Question Answering), diseñado para evaluar el razonamiento social de sentido común en modelos de lenguaje, presentando una colección de preguntas basadas en situaciones sociales cotidianas, con el objetivo de desafiar a los modelos a inferir motivaciones, reacciones e implicaciones sociales detrás de las acciones humanas.
Sesgos, estereotipos y discriminación
EsBBQ: Adaptación del conjunto de datos original BBQ a la lengua castellana y al contexto social de España. Este recurso se utiliza para evaluar el sesgo social en modelos de lenguaje a gran escala (LLM) en una tarea de preguntas y respuestas con opciones múltiples, centrada en diez categorías sociales: edad, discapacidad, género, identidad LGBTQIA, nacionalidad, apariencia física, raza/etnicidad, religión, nivel socioeconómico y región española.
CaBBQ: Adaptación del conjunto de datos original BBQ a la lengua catalana y al contexto social de España. Este recurso se utiliza para evaluar el sesgo social en modelos de lenguaje a gran escala (LLM) en una tarea de preguntas y respuestas con opciones múltiples, centrada en diez categorías sociales: edad, discapacidad, género, identidad LGBTQIA, nacionalidad, apariencia física, raza/etnicidad, religión, nivel socioeconómico y región española.
GlBBQ: Adaptación al gallego de BBQ (Bias Benchmark for QA), un benchmark diseñado para medir sesgos sociales en sistemas de preguntas y respuestas (QA) de opción múltiple. En concreto, GlBBQ deriva de EsBBQ, la adaptación al español de BBQ. El conjunto de datos sigue el marco de BBQ, en el que los modelos se evalúan en dos tipos de contexto: contextos ambiguos, en los que no se puede determinar la respuesta correcta y el modelo debe evitar recurrir a estereotipos, y contextos desambiguados, en los que la respuesta correcta está respaldada explícitamente por el contexto, pero los sesgos pueden conducir a predicciones incorrectas.
GlBBQ amplía este marco al gallego mediante una versión lingüísticamente adaptada de EsBBQ.
StereoHoax-GL: Versión traducida y revisada lingüísticamente al gallego de la partición de prueba de StereoHoax-ES. Contiene comentarios de redes sociales relacionados con estereotipos raciales, discriminación, inmigración y bulos, con anotaciones sobre la presencia de estereotipos y su carácter explícito o implícito. Está destinado a evaluar modelos de detección de contenido discriminatorio y dañino en gallego.
Acceso: https://huggingface.co/datasets/proxectonos/StereoHoax-GL
HolisticBiasEUS: Adaptación al euskera de un benchmark orientado a evaluar sesgos sociales en modelos generativos. El recurso permite observar si los modelos producen respuestas estereotipadas, ofensivas o desiguales cuando el prompt hace referencia a distintos grupos sociales, atributos demográficos o identidades personales.
Acceso: https://huggingface.co/datasets/HiTZ/holisticbiaseus
cobie_sst2: Modificación del SST-2 original para evaluar sesgos cognitivos en LLMs.
cobie_ai2_arc: Modificación del ARC original para evaluar sesgos cognitivos en LLMs.
Acceso: https://huggingface.co/datasets/BSC-LT/cobie_ai2_arc
Preguntas y respuestas y comprensión lectora
OpenBookQA_es: Traducción al castellano del corpus OpenBookQA, diseñado para evaluar conocimientos básicos del mundo y cierta capacidad de razonamiento. Incluye 1000 instancias con una pregunta, cuatro opciones posibles y la letra que indica la respuesta correcta.
Acceso: https://huggingface.co/datasets/BSC-LT/openbookqa-es
OpenBookQA_gl: Conjunto de datos de preguntas y respuestas en gallego, traducido a partir del conjunto de datos inglés OpenBookQA.
Acceso: https://huggingface.co/datasets/proxectonos/openbookqa_gl
Belebele_gl: Conjunto de datos de comprensión lectora automática (MRC) de opción múltiple. El conjunto de datos original incluye 122 variantes lingüísticas; con este conjunto de datos se incorpora la lengua gallega. Está compuesto por 900 ítems traducidos y adaptados al gallego a partir de la versión en español.
Acceso: https://huggingface.co/datasets/proxectonos/belebele_gl
Inferencia y equivalencia semántica
XNLI_gl: Extensión de XNLI traducida al gallego. Ha sido diseñada como un conjunto de datos multilingüe para la tarea de inferencia en lenguaje natural (Natural Language Inference), una tarea de clasificación textual que consiste en clasificar pares de oraciones —una premisa y una hipótesis— según su relación semántica, entre tres etiquetas posibles: implicación, contradicción y neutral.
PAWS-gl: Traducción al gallego del conjunto de datos inglés PAWS.
Parafrases_gl: Conjunto de datos para la evaluación de recursos de paráfrasis en gallego.
Dado que la paráfrasis es una noción compleja y carece de una definición plenamente precisa y universalmente aceptada, este conjunto de datos adopta un esquema de anotación de tres categorías diseñado para capturar tanto paráfrasis claras como casos límite.
Acceso: https://huggingface.co/datasets/proxectonos/parafrases_gl
Razonamiento científico, causal, narrativo y de sentido común
COPA-es: Traducción al castellano del corpus COPA, corpus de referencia para el razonamiento causal. Incluye 600 instancias, cada una de las cuales se compone de una premisa y dos hipótesis.
arc_es: Traducción y adaptación al español del conjunto de validación de ARC (AI2 Reasoning Challenge), diseñado para evaluar el razonamiento científico en modelos de lenguaje, presentando una colección de preguntas auténticas de ciencias de nivel escolar en formato de opción múltiple, divididas en dos conjuntos de distinta dificultad: ARC Easy y ARC Challenging.
xstorycloze_gl: Conjunto de datos gallego de comprensión narrativa de opción múltiple traducido a partir del conjunto de datos inglés StoryCloze. Cada instancia contiene un contexto narrativo de cuatro oraciones, dos posibles finales y una etiqueta que indica cuál de los finales es correcto. El conjunto de datos está pensado para evaluar la comprensión lectora, la coherencia narrativa y el razonamiento de sentido común en gallego.
Acceso: https://huggingface.co/datasets/proxectonos/xstorycloze_gl
Cocotero_VA: Dataset adaptado mediante traducción manual por expertos del dataset cocoteros. Permite evaluar el conocimiento de sentido común y el razonamiento en valenciano, manteniendo los matices semánticos del recurso original.
GlobalPIQA_gl: Conjunto de evaluación en gallego diseñado para medir la capacidad de los modelos de lenguaje para aplicar razonamiento físico y sentido común. Cada ejemplo plantea una situación práctica con dos posibles soluciones, de las cuales el modelo debe seleccionar la más adecuada. Forma parte del benchmark multilingüe GlobalPIQA, que abarca más de cien lenguas y contextos culturales.
Acceso: https://huggingface.co/datasets/proxectonos/GlobalPIQA_gl
Razonamiento matemático
mgsm_gl: Versión gallega del conjunto de datos MGSM (Multilingual Grade School Math). Sirve como benchmark de problemas matemáticos de nivel escolar. Incluye 8 instancias en la partición de entrenamiento y otras 250 instancias en la partición de prueba. Cada instancia contiene problemas matemáticos básicos que requieren razonamiento de varios pasos, e incluye un problema matemático, una respuesta paso a paso, el resultado final del problema y la solución formulada mediante ecuaciones.
Evaluación de recuperación de información y RAG
RAG_eu: Corpus de evaluación para RAGs en diferentes dominios (legal-administrativo, parlamentos, periodistico) y tareas (clasificación de dominio, predicción de capacidad de respuesta y recuperación de información).
DOG-RAG: Dataset en gallego para evaluar sistemas de RAG y preguntas-respuestas sobre documentos oficiales del Diario Oficial de Galicia. Contiene 122 documentos con sus metadatos y 502 instancias estructuradas mediante preguntas, respuestas y fragmentos de contexto, incluyendo distintos tipos de recuperación, como contexto general, disperso, tabular o basado en fechas.
NOS RAG News: Conjunto de datos en gallego diseñado para evaluar sistemas de RAG. Incluye noticias completas y preguntas con sus respuestas, contextos y párrafos relevantes, lo que permite medir tanto la recuperación de información como la generación de respuestas fundamentadas. También puede utilizarse en tareas tradicionales de respuesta a preguntas.
Acceso: https://huggingface.co/datasets/proxectonos/nos-rag-news
Corpus de pre entrenamiento ALIA 40B
Herramientas para el suministro de datos de texto
Para garantizar el suministro de datos, se han implantado distintos métodos de adquisición de datos que automatizan este proceso y garantizan el suministro y la actualización de los datos.
Extractor de texto de Wikipedia que interpreta correctamente textos en una gran variedad de lenguas, entre ellas el español y el catalán. Extracción de más de 675.000 documentos: https://github.com/langtech-bsc/Wikiextractor-V2/
Anonimizador de contenidos generados por usuarios, que puedan contener datos protegidos por el GDPR: https://github.com/langtech-bsc/AnonymizationPipeline
Herramienta de PLN especializada en la discriminación léxica y ortográfica entre valenciano y catalán para identificar rasgos diferenciales: https://github.com/gplsi/disvaca
Suite de herramientas para el control de calidad, evaluación y validación métrica de corpus de texto y documentos generados por IA: https://github.com/gplsi/qualia
Última actualización
