DeepSeek V4 Flash Vision llega a la API: qué puede hacer y qué conviene revisar
Autor: Miguel Barraza
Publicado:
Desde su lanzamiento, DeepSeek V4 Flash se destacó por combinar razonamiento, velocidad y una ventana de contexto enorme, pero tenía una limitación fácil de notar: podía analizar grandes cantidades de texto y código, aunque no podía mirar una imagen. Una captura de pantalla, una fotografía o un gráfico tenían que pasar primero por otro modelo capaz de describirlos. Esa separación complicaba las integraciones y dejaba a DeepSeek un paso atrás de otros sistemas que ya reúnen texto y visión.
Esa limitación podría estar empezando a cambiar. El 21 de agosto de 2026 comenzó a estar disponible en la API de DeepSeek DeepSeek-V4-Flash-Vision-Exp, una versión experimental que suma comprensión de imágenes a las capacidades de texto y razonamiento de V4 Flash. El modelo puede recibir una imagen junto con una consulta, describir fotografías, reconocer texto, interpretar gráficos, comparar capturas y analizar interfaces. Por primera vez dentro de esta familia, ambas tareas pueden resolverse sin recurrir necesariamente a un segundo modelo visual.
La versión acepta JPEG, PNG, GIF y WebP. Las imágenes pueden enviarse en Base64, desde una dirección pública o mediante la API de archivos. Una solicitud admite hasta 48 MiB; una imagen obtenida por URL, hasta 32 MiB; y una subida con la API de archivos, hasta 64 MiB. El procesamiento se limita a un máximo informado de 384 tokens visuales por imagen, mientras que el modo de detalle bajo reduce el archivo a 512 por 512 píxeles. Si una solicitud contiene 15 imágenes o más, la dimensión máxima por imagen baja de 8192 a 4096 píxeles.
Por ahora se trata de una opción para desarrolladores y no de una función confirmada para el chat o la aplicación móvil. Tampoco hay una ficha independiente en el Centro de Transparencia de DeepSeek ni información oficial suficientemente consolidada sobre precios y estabilidad. El nombre termina en Exp precisamente porque es experimental: sus capacidades, condiciones y disponibilidad pueden cambiar. En términos prácticos, la noticia es que DeepSeek ya prueba visión dentro de su API oficial, pero todavía no presentó un producto definitivo.
Qué cambia al sumar visión a V4 Flash
DeepSeek lanzó la familia V4 el 24 de abril de 2026 con dos integrantes: V4 Pro y V4 Flash. Ambos fueron diseñados para trabajar con contextos de hasta un millón de tokens, una cantidad que permite procesar documentos extensos, grandes bases de código o conversaciones muy largas. Un token es una pequeña unidad de texto que el modelo utiliza para hacer sus cálculos. V4 Flash tiene 284.000 millones de parámetros en total, pero activa alrededor de 13.000 millones para cada fragmento que procesa. Esta arquitectura, conocida como mezcla de expertos, intenta ofrecer un buen equilibrio entre capacidad, velocidad y costo.
Sin embargo, V4 Flash tenía una ausencia evidente frente a varios competidores: no entendía imágenes. La propia documentación de DeepSeek para integrarlo con GitHub Copilot explicaba que las capturas debían enviarse primero a un modelo visual externo. Ese modelo generaba una descripción y recién entonces DeepSeek recibía el texto. El resultado podía ser útil, pero agregaba otro servicio al proceso, más demora y un nuevo punto en el que se podía perder información.
A comienzos de agosto aparecieron proyectos independientes que intentaron resolver esa limitación agregando una llamada “torre de visión” a los pesos abiertos de V4 Flash. En términos sencillos, se trata de un componente que transforma una imagen en información que el modelo de lenguaje puede comprender. Fueron experimentos valiosos de la comunidad, pero no formaban parte de la API oficial y su ejecución requería equipos con una enorme capacidad de procesamiento. El nuevo deepseek-v4-flash-vision-exp es diferente porque permite enviar la imagen directamente al servicio de DeepSeek junto con la pregunta escrita. De ese modo, el mismo modelo puede relacionar ambas fuentes de información y responder sobre ellas.
Eso es lo que se conoce como un modelo multimodal: un sistema capaz de trabajar con más de un tipo de contenido. En la práctica, se le puede pedir que describa una fotografía, recupere el texto de una página escaneada mediante reconocimiento óptico de caracteres u OCR, explique un gráfico, compare dos capturas o identifique los elementos de una interfaz. También puede ser útil para los agentes que operan sitios web, ya que estos necesitan comprender botones, formularios, mensajes de error y otros cambios que muchas veces aparecen solamente en pantalla.
La posibilidad resulta atractiva, pero no debe confundirse con una garantía de precisión. Los modelos visuales todavía pueden inventar palabras, confundir objetos pequeños, interpretar mal una tabla o pasar por alto información importante. Una respuesta convincente no siempre es una respuesta correcta. Si se analiza un documento legal, médico, financiero o relacionado con seguridad, hay que verificar el resultado contra el original y nunca utilizarlo como única base para tomar una decisión.
Cómo procesa las imágenes y cuáles son sus límites
La información difundida para esta versión experimental indica que acepta archivos JPEG, PNG, GIF y WebP. El servicio comprueba el contenido real de la imagen y no se limita a confiar en la extensión del nombre. El archivo puede incluirse dentro de la solicitud como datos codificados en Base64, enviarse mediante una dirección web pública o subirse previamente con la API de archivos para obtener un identificador reutilizable.
Cada alternativa tiene consecuencias prácticas. Base64 facilita una prueba rápida, pero el archivo pasa a formar parte de una solicitud que no puede superar los 48 MiB. Una imagen alojada en una dirección pública puede ocupar hasta 32 MiB y debe descargarse dentro del tiempo que establece el servicio. La API de archivos admite imágenes de hasta 64 MiB y evita volver a subirlas cada vez que se las quiere consultar, algo útil si varias preguntas se refieren al mismo documento. En todos los casos, las imágenes deben aparecer en un mensaje de la persona usuaria; no se admiten dentro de las instrucciones del sistema ni como si hubieran sido enviadas por el asistente.
También hay límites relacionados con la resolución. Cuando una solicitud contiene 15 imágenes o más, la dimensión máxima aceptada para cada una baja de 8192 a 4096 píxeles. Además, DeepSeek redimensiona internamente las imágenes grandes y, según las especificaciones difundidas, limita su procesamiento a un máximo de 384 tokens visuales por imagen. Esto ayuda a mantener previsible el consumo, pero puede eliminar detalles. Una captura de una página completa o una hoja con letra pequeña podría dar mejores resultados si se divide en varias regiones legibles y se conserva claramente el orden de las partes.
El parámetro de detalle bajo reduce la imagen a 512 por 512 píxeles. Puede ser suficiente para reconocer un objeto grande o hacer una clasificación sencilla, además de ahorrar tiempo y consumo, pero no es una buena elección para leer texto pequeño, inspeccionar una interfaz compleja o extraer valores de un gráfico. En esos casos conviene conservar más detalle y comprobar manualmente los datos obtenidos.
Todavía no hay información oficial suficientemente consolidada para calcular cuánto costará cada flujo real de trabajo. El número de tokens visuales es solo una parte del consumo: también cuentan la pregunta, el contexto enviado y la respuesta generada. Como se trata de un modelo experimental, sus precios y límites pueden cambiar con rapidez. Antes de incorporarlo a una aplicación o presupuestar un uso intensivo, será necesario consultar la documentación vigente y realizar pruebas con imágenes representativas del caso real.
Las imágenes también amplían el riesgo de privacidad
La capacidad de analizar imágenes abre usos interesantes, pero también incorpora una clase de información que puede ser mucho más sensible que una consulta escrita. Una captura puede mostrar nombres, correos electrónicos, conversaciones privadas, datos médicos, números de cuenta, ubicación o contraseñas. Incluso una fotografía aparentemente inofensiva puede revelar una dirección, una patente o información presente en el fondo que la persona no pretendía compartir.
Cuando se utiliza una API en la nube, el archivo sale del dispositivo y se procesa en la infraestructura del proveedor. Por eso, antes de enviarlo conviene recortar la zona necesaria, ocultar datos personales y evitar documentos sensibles si no existe una autorización clara y una política de tratamiento adecuada. Crear una dirección pública solo para que DeepSeek pueda descargar una imagen privada tampoco es una buena solución, porque aumenta innecesariamente su exposición.
Quienes incorporen el modelo a una aplicación deberían informar qué proveedor recibe los archivos, durante cuánto tiempo se conservan y cómo puede solicitarse su eliminación. También conviene revisar si las imágenes se utilizan para mejorar el servicio y qué condiciones ofrece DeepSeek para cuentas empresariales o proyectos que manejan información confidencial. La facilidad para adjuntar una captura no debería hacer olvidar que su contenido puede ser equivalente al de un documento completo.
Qué conviene observar a partir de ahora
DeepSeek V4 Flash Vision cubre una ausencia importante y puede simplificar herramientas de lectura de documentos, análisis de imágenes y operación de interfaces. Su aporte más interesante no es solamente que el modelo ahora pueda “ver”, sino que esa capacidad se integre con el razonamiento de V4 Flash sin depender de un segundo proveedor. Para desarrolladores, eso podría reducir la complejidad y abrir nuevas posibilidades de automatización.
Sin embargo, todavía faltan evaluaciones independientes sobre precisión, velocidad, costo real, desempeño con documentos complejos y calidad de las respuestas en español. También habrá que comprobar si las aplicaciones oficiales de DeepSeek incorporan esta función o si seguirá siendo una opción exclusiva para desarrolladores.
Hay además una razón para mantener cierta cautela con el anuncio. Al cierre de este artículo, la página oficial de novedades y el Centro de Transparencia de DeepSeek todavía mostraban la familia V4 original, pero no una ficha independiente para deepseek-v4-flash-vision-exp. La disponibilidad en la API y sus límites específicos fueron reportados el 21 de agosto por integrantes de la comunidad a partir de la nueva documentación del servicio. Por lo tanto, se trata de información preliminar que conviene volver a comprobar cuando DeepSeek publique un anuncio estable o incorpore el modelo a su registro oficial.
La llegada de esta versión experimental es una noticia prometedora para quienes necesitan combinar análisis visual y razonamiento en un mismo flujo de trabajo. Su verdadero valor, sin embargo, no se medirá por la cantidad de imágenes que acepte ni por una tabla de resultados, sino por la confianza que pueda construir en tareas reales. Ver una imagen es apenas el comienzo; interpretarla con precisión y reconocer la incertidumbre será la prueba más importante.
Fuentes consultadas el 21 de agosto de 2026
- DeepSeek — presentación oficial de DeepSeek V4
- DeepSeek — ficha y reporte técnico de V4 Flash en Hugging Face
- DeepSeek — Centro de Transparencia
- DeepSeek API — integración con GitHub Copilot y situación previa de la visión
- DeepSeek Harness — documentación técnica sobre archivos adjuntos de imagen
- Resumen técnico de DeepSeek-V4-Flash-Vision-Exp publicado en la comunidad de DeepSeek
- Reporte comunitario sobre el acceso al modelo experimental mediante la API