Alibaba Cloud presenta modelos de lenguaje de visión de código abierto para integrar imágenes y texto

Alibaba Cloud

Alibaba Cloud ha dado a conocer el lanzamiento de dos modelos de lenguaje de visión de código abierto que combinan la interpretación de imágenes y texto, marcando un avance significativo en la inteligencia artificial multimodal.

Los dos modelos, denominados Qwen-VL y Qwen-VL-Chat, forman parte de esta iniciativa y están disponibles para descarga en ModelScope, la comunidad de modelos de IA de Alibaba Cloud, y en la plataforma colaborativa de IA Hugging Face.

Estos modelos, entrenados en inglés y chino, tienen la capacidad de comprender tanto imágenes como texto. Entre las tareas que pueden realizar se encuentran la respuesta a preguntas abiertas basadas en imágenes, la generación de pies de foto, y, en el caso de Qwen-VL-Chat, tareas más complejas como cálculos matemáticos y creación de historias a partir de múltiples imágenes.

https://hosting56220us-96570.webempresa.site/negocios/2023/08/09/las-perdidas-netas-del-grupo-softbank-se-reducen-en-abril-junio-mientras-las-acciones-se-recuperan/

Ambos modelos han sido entrenados a partir de la versión de 7.000 millones de parámetros del modelo lingüístico Qwen-7B de Alibaba Cloud, cuyo código fuente fue lanzado a principios del mes. En comparación con otros modelos de lenguaje de visión de código abierto de gran envergadura, Alibaba Cloud sostiene que Qwen-VL puede comprender imágenes de mayor resolución, resultando en un rendimiento mejorado en el reconocimiento y comprensión de imágenes.

Esta iniciativa refleja los esfuerzos de Alibaba Cloud por desarrollar capacidades avanzadas en sus grandes modelos lingüísticos, permitiéndoles procesar tipos de datos que engloban imágenes y audio, además de texto. La integración de otras entradas sensoriales en estos modelos brinda nuevas oportunidades de aplicaciones tanto para investigadores como para organizaciones comerciales.

+ posts