HANGZHOU, 31 de julio de 2026. DeepSeek liberó en beta pública, solo por API, una nueva build de su modelo más liviano: DeepSeek-V4-Flash-0731. La compañía no cambió la arquitectura respecto de la versión de abril; el salto de rendimiento, según su propio anuncio, viene enteramente del post-entrenamiento, con aprendizaje por refuerzo y ajuste por destilación sobre los mismos pesos base.
El evaluador independiente Artificial Analysis midió el resultado: 50 puntos en su Índice de Inteligencia, 10 puntos más que el V4 Flash de abril (40) y 6 puntos por encima del modelo más grande de la misma familia, V4 Pro (44). El precio no cambió respecto de abril. Según la firma, eso ubica al modelo en un salto casi vertical de la frontera de Pareto entre inteligencia y costo: el mismo puntaje queda apenas un punto por debajo de GPT-5.6 Luna en su modo de máximo esfuerzo (51), el modelo cuyo precio OpenAI recortó 80% un día antes.
Un modelo trece veces más chico que su hermano mayor
DeepSeek V4 Flash tiene 284.000 millones de parámetros totales, de los cuales activa 13.000 millones por token. V4 Pro, el modelo insignia de la misma familia, tiene 1,6 billones de parámetros totales y activa 49.000 millones. Ambos son sistemas de mezcla de expertos (MoE): en cada consulta, el modelo despierta solo una fracción de sus parámetros, la especializada en esa tarea, en lugar de usarlos todos. Comparten arquitectura, una ventana de contexto de un millón de tokens y el mismo preentrenamiento, sobre más de 32 billones de tokens, según el reporte técnico que DeepSeek-AI publicó en abril.
Comprimir la memoria para sostener el contexto largo
Ese reporte explica de dónde sale la eficiencia en contexto largo: una atención híbrida que combina dos mecanismos. La Atención Dispersa Comprimida (CSA) agrupa bloques de tokens cercanos en una sola entrada comprimida y aplica selección dispersa, solo sobre las entradas más relevantes, más una ventana deslizante para el detalle inmediato. La Atención Fuertemente Comprimida (HCA) aplica una compresión todavía más agresiva sobre los tramos más antiguos del contexto. Con un millón de tokens de contexto, V4 Flash necesita apenas 10% de las operaciones de punto flotante por token y 7% del tamaño de caché que requería la generación anterior, V3.2.
V4 Flash necesita apenas 10% de las operaciones de punto flotante por token y 7% del tamaño de caché que requería la generación anterior.
Lo que dice la propia empresa, y lo que falta confirmar
En los benchmarks que reporta DeepSeek para esta build:
| Benchmark | V4 Flash 0731 |
|---|---|
| Terminal Bench 2.1 | 82,7 |
| Cybergym | 76,7 |
| Toolathlon verified | 70,3 |
| DSBench-FullStack | 68,7 |
| DSBench-Hard | 59,6 |
| DeepSWE | 54,4 |
| NL2Repo | 54,2 |
| Agent Last Exam | 25,2 |
| Automation Bench (público) | 25,1 |
La compañía sostiene que en varios de estos benchmarks de agentes, el modelo chico supera al más grande de su propia familia, V4-Pro-Preview. Son cifras que reporta la propia DeepSeek, sin verificación independiente; el único dato de un tercero es el índice de Artificial Analysis.
Precio y licencia
V4 Flash cuesta 0,14 dólares por millón de tokens de entrada (0,0028 dólares si el pedido repite contexto ya cacheado) y 0,28 dólares por millón de salida, con un límite de 384.000 tokens de salida y un tope de 2.500 solicitudes simultáneas en esta beta.
La familia V4 se distribuye bajo licencia MIT, pero DeepSeek todavía no liberó los pesos completos de la build 0731: según Artificial Analysis, se esperan "en las próximas semanas". Los pesos del V4 Flash de abril, la versión anterior, ya están disponibles en Hugging Face.
Lo que sigue
DeepSeek no detalló qué proporción del salto de diez puntos viene del aprendizaje por refuerzo y cuánto de la destilación, ni contra qué línea de base midió sus propios benchmarks de agentes. Tampoco fijó fecha exacta para liberar los pesos de la nueva build.

