For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌐Modelos multimodales

Descripción / Función

LLM especializado en imágenes y videos

Nombre modelo

Salamandra-VL-7B-2512

Comentario

Versión más reciente de la familia de modelos multimodales Salamandra. Combina el codificador visual SigLIP 2 Giant con Salamandra 7B ajustado para seguir instrucciones, con especial atención a las lenguas europeas, y mejora la comprensión visual detallada y el conteo mediante datos PixMo.

Descripción / Función

LLM especializado en imágenes y videos

Nombre modelo

salamandra-7b-vision

Comentario

Modelo salamandra-7b adaptado para el procesamiento de imágenes y videos.

Descripción / Función

Traducción de voz a texto

Nombre modelo

SalamandraTAV-7b

Comentario

Modelo de lenguaje multimodal especializado en voz y traducción, afinado a partir de salamandraTA-7b-instruct, Admite seis lenguas ibéricas además del inglés y puede realizar reconocimiento automático del habla, traducción de texto, traducción de voz a texto e identificación de la lengua hablada.

Descripción / Función

Modelo multimodal (voz y texto)

Nombre modelo

speech-salamandra-es-en

Comentario

Modelo multimodal de voz y texto en español e inglés, basado en Salamandra-7B-Instruct e integrado con el codificador de voz de SeamlessM4T v2. Puede recibir instrucciones de texto y audio para realizar reconocimiento automático del habla y responder preguntas sobre contenidos hablados.

Descripción / Función

Modelo multimodal y muiltilingüe instruido

Nombre modelo

Latxa-Qwen3.5-2B

Comentario

Modelo multimodal y multilingüe instruido, basado en Qwen3-VL-2B-Instruct, capaz de comprender y generar texto, procesar imágenes y seguir instrucciones. Ha sido adaptado para mejorar su rendimiento en euskera y, en su variante multilingüe, también en gallego y catalán.

Descripción / Función

Modelo multimodal y muiltilingüe instruido

Nombre modelo

Latxa-Qwen3.5-4B

Comentario

Modelo multimodal y multilingüe instruido, basado en Qwen3.5-4B, capaz de comprender y generar texto, procesar imágenes y seguir instrucciones. Ha sido adaptado para mejorar su rendimiento en euskera, gallego y catalán.

Descripción / Función

Modelo multimodal y muiltilingüe instruido

Nombre modelo

Latxa Qwen-3 VL 2B

Comentario

Modelo multimodal y multilingüe instruido, basado en Qwen3-VL-2B-Instruct, capaz de comprender y generar texto, procesar imágenes y seguir instrucciones. Ha sido adaptado para mejorar su rendimiento en euskera y, en su variante multilingüe, también en gallego y catalán.

Descripción / Función

Modelo multimodal y muiltilingüe instruido

Nombre modelo

Latxa Qwen-3 VL 4B

Comentario

Modelo multimodal y multilingüe instruido, basado en Qwen3-VL-4B-Instruct, capaz de comprender y generar texto, procesar imágenes y seguir instrucciones. Ha sido adaptado para mejorar su rendimiento en euskera y, en su variante multilingüe, también en gallego y catalán.

Descripción / Función

Modelo multimodal y muiltilingüe instruido

Nombre modelo

Latxa-Qwen3-VL-8B-Instruct

Comentario

Modelo multimodal y multilingüe instruido, basado en Qwen3-VL-8B-Instruct, capaz de comprender y generar texto, procesar imágenes y seguir instrucciones. Ha sido adaptado para mejorar su rendimiento en euskera y, en su variante multilingüe, también en gallego y catalán.

Descripción / Función

Modelo multimodal y muiltilingüe instruido

Nombre modelo

Latxa-Qwen3-VL-32B-Instruct

Comentario

Modelo multimodal y multilingüe instruido, basado en Qwen3-VL-32B-Instruct, capaz de comprender y generar texto, procesar imágenes y seguir instrucciones. Ha sido adaptado para mejorar su rendimiento en euskera y, en su variante multilingüe, también en gallego y catalán.

Última actualización