DeepSeek lanza una IA con visión que aspira a competir con Claude Opus 4.8
DeepSeek ha presentado DeepSeek-V4-Flash-Vision-Exp, una versión experimental de su modelo V4 Flash capaz de interpretar imágenes, capturas de pantalla y texto en una misma solicitud. La compañía china asegura que su rendimiento en tareas visuales y de agente se aproxima al de Claude Opus 4.8, el modelo más avanzado de Anthropic.
El nuevo sistema ya está disponible a través de la API de DeepSeek y puede probarse sin coste adicional respecto a la tarifa aplicada a la versión de texto de V4 Flash. La propuesta refuerza la competencia en el mercado de la inteligencia artificial multimodal, en el que también participan Claude y ChatGPT.
Una evolución de DeepSeek-V4 Flash
DeepSeek-V4-Flash-Vision-Exp parte de la misma base que el modelo V4 Flash presentado anteriormente. La principal novedad es la incorporación de capacidades visuales, una función que hasta ahora estaba asociada principalmente a la familia DeepSeek-VL.
Esto permite que el modelo analice documentos, interfaces, gráficos, fotografías o capturas de pantalla y combine esa información con instrucciones escritas. En términos prácticos, el usuario puede enviar una imagen junto a una pregunta y recibir una respuesta que tenga en cuenta tanto el contenido visual como el contexto proporcionado mediante texto.
Según la compañía, la versión experimental mantiene el nivel de razonamiento y los conocimientos generales de V4 Flash en tareas basadas únicamente en texto. También conserva sus capacidades de agente, es decir, la posibilidad de interpretar una instrucción, dividirla en pasos y ejecutar acciones con una supervisión humana limitada.
Visión multimodal y funciones de agente
La inteligencia artificial multimodal es aquella que puede trabajar con varios tipos de información, como texto, imágenes, audio o vídeo. En este caso, DeepSeek-V4-Flash-Vision-Exp combina texto e imágenes dentro de una misma petición para generar una respuesta razonada.
Las funciones de agente amplían ese uso. En lugar de limitarse a describir una imagen, el sistema puede emplearla como punto de partida para resolver una tarea: analizar una pantalla, extraer información de un documento, identificar elementos de una interfaz o proponer los pasos necesarios para completar un proceso.
DeepSeek sostiene que esta combinación es la que permite acercar el rendimiento de Vision-Exp al de Claude Opus 4.8. Se trata, no obstante, de una afirmación de la propia compañía y el modelo se encuentra todavía en fase experimental, por lo que sus resultados pueden variar en función del tipo de imagen y de la complejidad de la petición.
La visión no encarece el precio del modelo
Uno de los principales atractivos del lanzamiento es su coste. DeepSeek mantiene para esta variante el mismo esquema de precios de V4 Flash en su modalidad de texto. Por tanto, añadir imágenes a las solicitudes no implica un incremento específico en la tarifa anunciada para el modelo.
Las imágenes se convierten en tokens para calcular el consumo. Los tokens son pequeñas unidades de información que los modelos de lenguaje procesan para interpretar una entrada y generar una respuesta. En el caso de Vision-Exp, cada archivo puede representar un máximo de 384 tokens a efectos de facturación.
La plataforma también incorpora una API de archivos. Esta opción permite subir una imagen una sola vez y reutilizarla en distintas solicitudes mediante un identificador, sin necesidad de volver a transferir el archivo. El servicio es gratuito y es compatible con los principales frameworks orientados al desarrollo de agentes de IA.
Requisitos y límites técnicos
El acceso requiere registrarse en la plataforma de DeepSeek y obtener una clave de API. Después, los desarrolladores deben indicar el modelo deepseek-v4-flash-vision-exp en sus peticiones. Las imágenes pueden enviarse mediante una URL externa, codificadas en base64 o utilizando la API de archivos.
- Formatos compatibles: JPEG, PNG, GIF y WebP.
- Dimensión máxima: 8.192 píxeles por lado.
- Tamaño máximo de 32 MiB mediante base64 o URL externa.
- Tamaño máximo de 64 MiB mediante la API de archivos.
- Hasta 600 imágenes en una misma petición.
El sistema redimensiona automáticamente las imágenes antes de procesarlas. Las que miden 384 por 384 píxeles o menos se amplían manteniendo su proporción. Las de mayor tamaño se reducen para que el volumen de información visual sea similar al de una imagen de 800 por 800 píxeles.
Un nuevo frente para los modelos comerciales
El lanzamiento llega en un momento de fuerte presión competitiva para los grandes desarrolladores de IA. La llegada de modelos con visión avanzada y precios reducidos puede facilitar que empresas y desarrolladores incorporen análisis visual en sus aplicaciones sin asumir el coste de las alternativas comerciales más sofisticadas.
DeepSeek-V4-Flash-Vision-Exp no sustituye todavía a los modelos consolidados y sus límites técnicos pueden ser relevantes en proyectos exigentes. Sin embargo, la combinación de visión, razonamiento, funciones de agente y acceso económico convierte a esta versión experimental en una alternativa que los desarrolladores deberán tener en cuenta.



