> For the complete documentation index, see [llms.txt](https://langtech-bsc.gitbook.io/alia-kit/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://langtech-bsc.gitbook.io/alia-kit/datasets/datos-y-herramientas-para-traduccion-automatica.md).

# Datos y herramientas para traducción automática

## Corpus paralelos para entrenamiento

#### BSC\_ParaMT\_8

**Idiomas:** catalán, español, inglés, árabe, hindi, chino, japonés y coreano.\
**Pares lingüísticos:** catalán, español e inglés emparejados con árabe, hindi, chino, japonés y coreano; 15 combinaciones lingüísticas.\
**Volumen:** 717.809.877 pares de oraciones.\
**Tipo de datos:** combinación de datos paralelos auténticos procedentes de fuentes públicas y datos sintéticos. La parte española incluye traducciones desde textos ingleses y la parte catalana contiene traducciones generadas desde textos ingleses y españoles mediante SalamandraTA 7B Instruct.\
**Licencia:** ODbL 1.0.\
**Acceso:** <https://huggingface.co/datasets/BSC-LT/BSC_ParaMT_8>

#### ALIA Mixed Authentic Synthetic MT

**Idiomas:** inglés, español, árabe, hindi, chino, japonés y coreano.\
**Pares lingüísticos:** inglés y español emparejados con árabe, hindi, chino, japonés y coreano; diez combinaciones lingüísticas.\
**Volumen:** 453.783.349 pares de oraciones.\
**Tipo de datos:** combinación de corpus paralelos auténticos y traducciones sintéticas. Los subconjuntos español-hindi y español-chino contienen traducciones al español generadas desde textos originales en inglés mediante SalamandraTA 7B Instruct.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/BSC-LT/ALIA_mixed_authentic_synthetic_MT>

#### ALIA Synthetic MT V2

**Idiomas:** euskera, español e inglés.\
**Pares lingüísticos:** euskera-español y euskera-inglés; algunos subconjuntos contienen las tres lenguas.\
**Volumen:** aproximadamente 385.000 filas. Incluye 337.650 registros de Berria en euskera y español, 193.337 registros trilingües de Berria, 27.130 registros del BOPV y 20.385 registros parlamentarios, distribuidos en diferentes configuraciones.\
**Tipo de datos:** recurso mixto con textos originales en euskera, textos oficiales bilingües euskera-español y traducciones sintéticas al español y al inglés generadas mediante Qwen3.5-27B y LatxaQ.\
**Licencia:** CC BY-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/HiTZ/ALIA_syntethic_MT_V2>

#### ALIA Synthetic MT

**Idiomas:** euskera, inglés y español.\
**Pares lingüísticos:** euskera-inglés y euskera-español.\
**Volumen:** 68.863 documentos originales.\
**Tipo de datos:** artículos originales de Berria en euskera acompañados de traducciones sintéticas al inglés y al español generadas mediante Qwen3-32B y LatxaQ.\
**Licencia:** CC BY-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/HiTZ/ALIA_syntethic_MT>

#### CA-GL Parallel Corpus

**Idiomas:** catalán y gallego.\
**Pares lingüísticos:** catalán-gallego.\
**Volumen:** 33.668.599 pares de oraciones.\
**Tipo de datos:** corpus sintético en el que los textos gallegos proceden de recursos auténticos y las versiones catalanas fueron generadas mediante traducción automática.\
**Licencia:** CC BY-NC-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/projecte-aina/CA-GL_Parallel_Corpus>

#### CA-EU Parallel Corpus

**Idiomas:** catalán y euskera.\
**Pares lingüísticos:** catalán-euskera.\
**Volumen:** 10.471.139 pares de oraciones.\
**Tipo de datos:** corpus sintético en el que los textos en euskera son originales y las versiones catalanas fueron generadas mediante traducción automática.\
**Licencia:** CC BY-NC-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/projecte-aina/CA-EU_Parallel_Corpus>

#### Catalan-Aranese Parallel Corpus

**Idiomas:** catalán y aranés.\
**Pares lingüísticos:** catalán-aranés.\
**Volumen:** 539.110 pares de oraciones.\
**Tipo de datos:** combinación de corpus paralelos auténticos y traducciones sintéticas al catalán generadas desde textos monolingües araneses mediante SalamandraTA 7B Instruct.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/BSC-LT/Catalan-Aranese_Parallel_Corpus>

#### ES-AN Parallel Corpus

**Idiomas:** español y aragonés.\
**Pares lingüísticos:** español-aragonés.\
**Volumen:** 47.521 pares de oraciones.\
**Tipo de datos:** corpus predominantemente sintético generado mediante Apertium y complementado con materiales procedentes de OPUS.\
**Licencia:** CC BY-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/projecte-aina/ES-AN_Parallel_Corpus>

#### ES-OC Parallel Corpus

**Idiomas:** español y occitano, especialmente la variedad aranesa.\
**Pares lingüísticos:** español-occitano o español-aranés.\
**Volumen:** 419.908 pares de oraciones.\
**Tipo de datos:** corpus predominantemente sintético generado mediante Apertium y complementado con materiales procedentes de OPUS y PILAR.\
**Licencia:** CC BY-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/projecte-aina/ES-OC_Parallel_Corpus>

#### ES-AST Parallel Corpus

**Idiomas:** español y asturiano.\
**Pares lingüísticos:** español-asturiano.\
**Volumen:** 704.378 pares de oraciones.\
**Tipo de datos:** combinación de pares auténticos procedentes de OPUS y traducciones sintéticas al español generadas desde textos originales en asturiano.\
**Licencia:** CC BY-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/projecte-aina/ES-AST_Parallel_Corpus>

#### Spanish-Valencian Catalan Parallel Corpus

**Idiomas:** español y valenciano.\
**Pares lingüísticos:** español-valenciano.\
**Volumen:** 2.162.451 pares de oraciones.\
**Tipo de datos:** combinación de datos paralelos auténticos procedentes de fuentes institucionales y traducciones sintéticas al español generadas desde textos originales en valenciano mediante SalamandraTA 7B Instruct.\
**Licencia:** CC BY-NC 4.0.\
**Acceso:** <https://huggingface.co/datasets/BSC-LT/Spanish-Valencian_Catalan_Parallel_Corpus>

#### MT\_es-gl

**Idiomas:** español y gallego.\
**Pares lingüísticos:** español-gallego.\
**Volumen:** 16.117.630 pares de oraciones.\
**Tipo de datos:** agregación de corpus paralelos procedentes de diferentes fuentes, con materiales originales y recursos adaptados o traducidos automáticamente al gallego.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/MT_es-gl>

#### MT\_en-gl

**Idiomas:** inglés y gallego.\
**Pares lingüísticos:** inglés-gallego.\
**Volumen:** 16.280.672 pares de oraciones.\
**Tipo de datos:** combinación de corpus paralelos naturales y datos traducidos o poseditados automáticamente. \
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/MT_en-gl>

#### ALIA Multilingual Parallel Sentences

**Idiomas:** principalmente español y valenciano.\
**Pares lingüísticos:** español-valenciano, con una estructura preparada para incorporar diferentes combinaciones multilingües.\
**Volumen:** aproximadamente 9,86 millones de filas. \
**Tipo de datos:** agregación de corpus paralelos para tareas de traducción. Cada registro contiene oraciones alineadas y sus correspondientes códigos lingüísticos.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/alia_multilingual_parallel_sentences>

### Corpus paralelos institucionales y especializados por dominio

#### ALIA Parallel Translation

**Idiomas:** español e inglés.\
**Pares lingüísticos:** español-inglés.\
**Volumen:** 35.753.765 segmentos paralelos.\
**Tipo de datos:** corpus paralelo especializado elaborado a partir de fuentes oficiales y abiertas de los dominios jurídico-administrativo, biomédico y patrimonial. Incluye alineaciones a diferentes niveles de granularidad.\
**Licencia:** CC BY-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/SINAI/ALIA-parallel-translation>

#### ALIA Heritage Parallel Translation

**Idiomas:** español e inglés.\
**Pares lingüísticos:** español-inglés, en dirección español → inglés.\
**Volumen:** 683.919 fragmentos paralelos o 288.955 documentos completos.\
**Tipo de datos:** textos sobre patrimonio cultural originalmente redactados en español y traducidos automáticamente al inglés mediante Qwen3-14B. \
**Licencia:** CC BY-SA 4.0.\
**Acceso:** <https://huggingface.co/datasets/SINAI/ALIA-heritage-parallel-translation>

#### UV\_PARALLEL\_VA\_ES

**Idiomas:** valenciano y español.\
**Pares lingüísticos:** valenciano-español.\
**Volumen:** aproximadamente 15.700 pares de textos u oraciones.\
**Tipo de datos:** textos institucionales bilingües procedentes de la Universitat de València, alineados para traducción automática. \
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/uv_parallel_va_es>

#### UV\_PARALLEL\_VA\_EN

**Idiomas:** valenciano e inglés.\
**Pares lingüísticos:** valenciano-inglés.\
**Volumen:** aproximadamente 6.490 pares de textos u oraciones.\
**Tipo de datos:** textos institucionales bilingües procedentes de la Universitat de València. \
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/uv_parallel_va_en>

#### UJI\_PARALLEL\_VA\_ES

**Idiomas:** valenciano y español.\
**Pares lingüísticos:** valenciano-español.\
**Volumen:** 93.079 pares o filas en la versión actual.\
**Tipo de datos:** noticias institucionales bilingües de la Universitat Jaume I, alineadas, filtradas y deduplicadas automáticamente. \
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/uji_parallel_va_es>

#### UJI\_PARALLEL\_VA\_EN

**Idiomas:** valenciano e inglés.\
**Pares lingüísticos:** valenciano-inglés.\
**Volumen:** 36.395 pares o filas.\
**Tipo de datos:** noticias institucionales bilingües de la Universitat Jaume I, alineadas, filtradas y deduplicadas automáticamente.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/uji_parallel_va_en>

#### DOGV\_PARALLEL

**Idiomas:** valenciano y español.\
**Pares lingüísticos:** valenciano-español.\
**Volumen:** aproximadamente 489.615 pares estimados\
**Tipo de datos:** documentos oficiales bilingües procedentes del Diari Oficial de la Generalitat Valenciana, alineados y filtrados automáticamente.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/dogv_parallel>

#### AMIC\_PARALLEL

**Idiomas:** valenciano y español.\
**Pares lingüísticos:** valenciano-español.\
**Volumen:** 680.978 pares o filas.\
**Tipo de datos:** textos periodísticos bilingües publicados por medios vinculados a la Associació de Mitjans d’Informació i Comunicació, alineados y filtrados.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/amic_parallel>

#### BOUA\_PARALLEL

**Idiomas:** valenciano y español.\
**Pares lingüísticos:** valenciano-español.\
**Volumen:** 54.791 pares o filas.\
**Tipo de datos:** documentos institucionales bilingües procedentes del Boletín Oficial de la Universidad de Alicante.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/gplsi/boua_parallel>

#### DGT-GL

**Idiomas:** español y gallego.\
**Pares lingüísticos:** español-gallego.\
**Volumen:** aproximadamente 320.000 pares de oraciones. \
**Tipo de datos:** corpus jurídico derivado de la memoria de traducción DGT. Los segmentos originales en portugués fueron adaptados automáticamente al gallego mediante Apertium, transliteración y localización lingüística.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/DGT-GL>

#### SciELO-GL

**Idiomas:** español, inglés y gallego.\
**Pares lingüísticos:** español-gallego e inglés-gallego.\
**Volumen:** aproximadamente 300.000 oraciones alineadas.\
**Tipo de datos:** artículos científicos procedentes de SciELO. Los segmentos portugueses fueron adaptados automáticamente al gallego mediante Apertium, transliteración, localización léxica y normalización lingüística.\
**Licencia:** CC BY 4.0.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/SciELO-GL>

#### ALIA Scientific Articles

**Idiomas:** euskera, español e inglés.\
**Pares lingüísticos:** euskera-español y euskera-inglés.\
**Volumen:** aproximadamente 9.880 registros.\
**Tipo de datos:** corpus de artículos científicos con textos originales y traducciones destinadas a crear datos paralelos para traducción especializada. Parte del recurso contiene traducciones generadas automáticamente.\
**Licencia:** CC-BY-SA.\
**Acceso:** <https://huggingface.co/datasets/HiTZ/ALIA_scientic_articles>

#### ES-GL Museo Virtual USC Descricións Parallel

**Idiomas:** español y gallego.\
**Pares lingüísticos:** español-gallego.\
**Volumen:** aproximadamente 1.110 pares alineados.\
**Tipo de datos:** descripciones de objetos y piezas del Museo Virtual de la Universidade de Santiago de Compostela, traducidas y alineadas en español y gallego.\
**Licencia:** CC-BY.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/es-gl_museo_virtual_usc_descricions_parallel>

## Datasets para *fine tuning, instruction tuning* y posedición

#### Finetuning-MT

**Idiomas:** gallego, portugués, español, catalán, euskera e inglés.\
**Pares lingüísticos:** múltiples direcciones, principalmente con gallego y portugués como lenguas pivote.\
**Volumen:** 198.922 instancias.\
**Tipo de datos:** dataset de instrucciones que combina frases y párrafos paralelos con tareas de traducción, posedición, tratamiento del género, transliteración y traducción de entidades. Parte de los materiales gallegos fue adaptada automáticamente desde el portugués.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** ajuste por instrucciones de modelos lingüísticos para traducción automática y tareas relacionadas.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/Finetuning-MT>

#### ACAData

**Idiomas:** asturiano, catalán, alemán, griego, español, inglés, euskera, francés, gallego, italiano, neerlandés y portugués.\
**Pares lingüísticos:** múltiples combinaciones entre las doce lenguas incluidas.\
**Volumen:** 739.211 pares de entrenamiento, equivalentes a 1.478.422 instrucciones bidireccionales, y 5.944 instancias de evaluación.\
**Tipo de datos:** párrafos académicos paralelos extraídos de repositorios europeos y alineados automáticamente mediante similitud semántica. Incluye un conjunto de entrenamiento y un benchmark independiente.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** ajuste por instrucciones, adaptación al dominio académico y evaluación comparativa de sistemas de traducción y modelos lingüísticos.\
**Acceso:** <https://huggingface.co/datasets/BSC-LT/ACAData>

#### Erros Sistemáticos de Tradución ES-GL

**Idiomas:** español y gallego.\
**Pares lingüísticos:** español-gallego.\
**Volumen:** aproximadamente 13.600 instancias.\
**Tipo de datos:** ejemplos de traducción organizados en torno a errores sistemáticos frecuentes entre español y gallego, con información útil para aprender a detectar o corregir dichos errores.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** ajuste fino, posedición automática, corrección de errores de traducción y análisis contrastivo español-gallego.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/erros_sistematicos_traducion_es_gl>

## Recursos léxicos, terminológicos y fraseológicos

#### MT Wikidata Labels GL

**Idiomas:** gallego y múltiples lenguas disponibles en Wikidata.\
**Pares lingüísticos:** etiquetas de diferentes lenguas alineadas con sus equivalentes en gallego.\
**Volumen:** 16.117.829 etiquetas y descripción.\
**Tipo de datos:** pares léxicos y terminológicos construidos a partir de etiquetas multilingües de Wikidata y sus equivalencias en gallego.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** traducción léxica, creación de diccionarios bilingües, alineamiento terminológico y adaptación de modelos de traducción al gallego.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/MT_wikidata-labels-gl>

#### ES-GL Bens Culturais Parallel

**Idiomas:** español y gallego.\
**Pares lingüísticos:** español-gallego.\
**Volumen:** aproximadamente 11.500 pares alineados.\
**Tipo de datos:** definiciones y recursos terminológicos procedentes de tesauros oficiales de patrimonio cultural, traducidos, limpiados y alineados en español y gallego.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** traducción automática especializada, adaptación de dominio, extracción terminológica y creación de recursos bilingües sobre patrimonio cultural.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/es-gl_bensculturais_parallel>

#### Spanish–Galician Idiom Parallel Corpus

**Idiomas:** español y gallego.\
**Pares lingüísticos:** español-gallego y gallego-español.\
**Volumen:** 17.198 pares direccionales: 8.399 de español a gallego y 8.799 de gallego a español. \
**Tipo de datos:** corpus especializado de expresiones idiomáticas, locuciones, coloquialismos y lenguaje figurado, alineado manualmente.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** entrenamiento y evaluación de traducción de expresiones idiomáticas y análisis contrastivo de la fraseología española y gallega.\
**Acceso:** <https://huggingface.co/datasets/proxectonos/corpus_paralelo_idioms>

## Conjuntos de evaluación y benchmarks

#### ES-CA Translation Test

**Idiomas:** español y catalán.\
**Pares lingüísticos:** español-catalán.\
**Volumen:** 1.958 ejemplos.\
**Tipo de datos:** oraciones en español procedentes de Common Voice, seleccionadas y traducidas manualmente al catalán por una persona especialista.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** evaluación de sistemas de traducción español-catalán y participación en la tarea Phrases de Iberobench.\
**Acceso:** <https://huggingface.co/datasets/gplsi/ES-CA_translation_test>

#### ES-VA Translation Test

**Idiomas:** español y valenciano.\
**Pares lingüísticos:** español-valenciano.\
**Volumen:** 1.958 ejemplos.\
**Tipo de datos:** oraciones de Common Voice traducidas y adaptadas manualmente al valenciano por especialistas.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** evaluación de sistemas de traducción español-valenciano y participación en Iberobench.\
**Acceso:** <https://huggingface.co/datasets/gplsi/ES-VA_translation_test>

#### CA-VA Alignment Test

**Idiomas:** catalán y valenciano.\
**Pares lingüísticos:** catalán-valenciano.\
**Volumen:** 1.958 ejemplos .\
**Tipo de datos:** versiones catalanas y valencianas traducidas y adaptadas manualmente a partir de las mismas oraciones originales en español.\
**Licencia:** CC BY 4.0.\
**Uso previsto:** evaluación de sistemas de traducción entre catalán y valenciano y análisis de diferencias dialectales, léxicas y estilísticas.\
**Acceso:** <https://huggingface.co/datasets/gplsi/CA-VA_alignment_test>

#### ES\_VACA

**Idiomas:** español, valenciano y catalán.\
**Pares lingüísticos:** español-valenciano, español-catalán y catalán-valenciano.\
**Volumen:** 802 instancias.\
**Tipo de datos:** recurso trilingüe destinado a comparar traducciones y variantes entre español, valenciano y catalán. \
**Licencia:** CC BY 4.0.\
**Uso previsto:** evaluación de traducción automática y análisis contrastivo entre español, valenciano y catalán.\
**Acceso:** <https://huggingface.co/datasets/gplsi/es_vaca>

#### ALMO-MWE

**Idiomas:** español e inglés.\
**Pares lingüísticos:** español-inglés.\
**Volumen:** 235 ejemplos.\
**Tipo de datos:** benchmark de traducción de expresiones multipalabra que incluye texto de entrada, traducción de referencia, respuestas producidas por distintos sistemas y puntuaciones de evaluación.\
**Licencia:** Apache 2.0.\
**Uso previsto:** evaluación y comparación de sistemas de traducción automática en expresiones multipalabra y fenómenos no composicionales.\
**Acceso:** <https://huggingface.co/datasets/gplsi/almo-mwe>

#### ALIA Document-Level MT Evaluation

**Idiomas:** principalmente euskera, español e inglés.\
**Pares lingüísticos:** euskera-español y euskera-inglés.\
**Volumen:** aproximadamente 1.050 instancias.\
**Tipo de datos:** conjunto de evaluación de traducción automática a nivel documental, con documentos completos o fragmentos extensos y traducciones de referencia.\
**Licencia:** CC BY SA 4.0.\
**Uso previsto:** evaluación de coherencia, consistencia terminológica, resolución de referencias y calidad global en traducción documental.\
**Acceso:** <https://huggingface.co/datasets/HiTZ/ALIA_DocMT_Evaluation>

#### FLORES Plus Gender

**Idiomas:** euskera, español e inglés.\
**Pares lingüísticos:** español-euskera e inglés-euskera.\
**Volumen:** 518 ejemplos: 363 en el subconjunto español y 155 en el subconjunto inglés.\
**Tipo de datos:** extensión de FLORES diseñada para evaluar fenómenos de género. Incluye versiones masculinas y femeninas de las oraciones fuente y traducciones de referencia al euskera.\
**Licencia:** CC BY-SA 4.0.\
**Uso previsto:** evaluación de precisión de género, sesgo y calidad de traducción hacia una lengua sin género gramatical como el euskera.\
**Acceso:** <https://huggingface.co/datasets/HiTZ/flores_plus_gender>

#### WinoMTEus

**Idiomas:** euskera, con evaluación de traducciones principalmente al español y al francés.\
**Pares lingüísticos:** euskera-español y euskera-francés en el proceso de evaluación.\
**Volumen:** 1.827 instancias.\
**Tipo de datos:** adaptación al euskera de WinoMT, formada por oraciones con profesiones y referentes de género destinadas a comprobar cómo se traduce desde una lengua sin género gramatical hacia lenguas que sí lo expresan.\
**Licencia:** MIT.\
**Uso previsto:** evaluación de sesgo de género y resolución de referencias en sistemas de traducción automática.\
**Acceso:** <https://huggingface.co/datasets/HiTZ/winomteus>

## Herramientas para modelos de traducción automática

* Herramienta optimizada para el alineamiento de oraciones, párrafos y documentos: <https://github.com/gplsi/translation-alignment>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://langtech-bsc.gitbook.io/alia-kit/datasets/datos-y-herramientas-para-traduccion-automatica.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
