Ir al contenido

DeepSeek V4.1 Flash: la nueva revolución china en relación potencia-precio de la IA

Escrito por Gab

Índice

DeepSeek V4.1 Flash es presentado por @kimmonismus como una evolución especialmente rápida, seis semanas después de la actualización V4-Flash de julio. Su mensaje recoge las cifras clave: una arquitectura Causal Encoder Decoder, 552.000 millones de parámetros MoE, de los cuales 8.000 millones están activos durante la entrada y 16.000 millones durante la generación, así como una caché KV reducida a una cuarta parte de la HBM y a una octava parte del almacenamiento SSD de la generación anterior. Añade que DeepSeek superaría ahora a DeepSeek V4 Pro en capacidad, coste y velocidad, y que el tráfico de V4 Pro deberá redirigirse temporalmente a V4.1 Flash a partir del 14 de septiembre.

Esta interpretación es, en general, fiel al anuncio, pero hace especial hincapié en el ritmo de los lanzamientos y el salto de producto. El hilo oficial ofrece una visión más completa: las mejoras no se atribuyen únicamente a la arquitectura, sino también a nuevos métodos de preentrenamiento y a un posentrenamiento mediante RL llevado a cabo a mayor escala. Sobre todo, detrás del discurso sobre un modelo Flash «más inteligente, más rápido y más eficiente», el cambio más operativo afecta a la memoria necesaria para la inferencia de larga duración, una cuestión decisiva para los agentes de IA.

El gráfico compartido por @kimmonismus muestra, de hecho, una realidad menos uniforme que el relato de marketing: DeepSeek V4.1 Flash es competitivo en varias evaluaciones, pero no domina sistemáticamente a los modelos de vanguardia en Terminal-Bench.

Gráfico que compara DeepSeek V4.1 Flash con Kimi-K3, GLM-5.3, Opus5 y GPT5.6-Sol en cuatro benchmarks, entre ellos Terminal-Bench

La publicación de @kimmonismus, publicada el 10 de septiembre, se basa explícitamente en el hilo de la cuenta oficial de DeepSeek. Este punto es importante: las cifras, la migración de los endpoints y las promesas de rendimiento proceden, ante todo, del desarrollador del modelo y no del analista que las sintetizó.

Esta es la publicación original, publicada por DeepSeek unas horas antes:

El hilo oficial: una nueva familia, no una simple actualización Flash

En su primer mensaje, @deepseek_ai presenta V4.1 Flash como «el modelo más pequeño de nuestra nueva familia de arquitecturas», con comprensión visual nativa. El posicionamiento es claro: Flash ya no es solo una variante ligera, sino el primer modelo de una familia diseñada para la velocidad, el rendimiento y la escalabilidad.

La segunda parte del hilo detalla la arquitectura. DeepSeek V4.1 Flash se basa en un MoE de 552.000 millones de parámetros, pero no utiliza la totalidad de la red en cada etapa. Según DeepSeek, solo 8.000 millones de parámetros están activos durante el procesamiento de la entrada y, posteriormente, 16.000 millones durante la generación.

Esta asimetría constituye el núcleo de la arquitectura Causal Encoder Decoder. El procesamiento del contexto y la producción de nuevos tokens ya no tienen el mismo coste ni utilizan exactamente los mismos recursos. Para los casos de uso que requieren leer un contexto extenso antes de generar una respuesta relativamente corta, esta separación puede mejorar la relación entre coste y rendimiento.

La tabla oficial compara V4.1 Flash con V4 Pro 0813, V4 Flash 0731 y varios competidores. Indica, en particular, 30,0 en Terminal-Bench 3.0, 31,2 en Terminal-Bench 4.0 y 74,2 en DeepSWE v1.1 para V4.1 Flash.

Tabla de benchmarks que compara DeepSeek V4.1 Flash, DeepSeek V4 Pro, GLM 5.3, Kimi K3, GPT 5.6-Sol y Claude Opus 5

Benchmarks clave de DeepSeek V4.1 Flash

BenchmarkPuntuación anunciada para V4.1 FlashInterpretación
Terminal-Bench 3.030,0V4.1 Flash supera a GLM 5.3 en la tabla oficial.
Terminal-Bench 4.031,2El modelo se mantiene por detrás de GLM 5.3, que figura con 37,9.
DeepSWE v1.174,2Resultado destacado por DeepSeek para las tareas de ingeniería de software.

DeepSeek afirma que sus nuevos métodos de preentrenamiento, combinados con un posentrenamiento mediante RL más ambicioso, sitúan al modelo por delante de sistemas destacados, incluido DeepSeek V4 Pro. Esta precisión es importante en comparación con el resumen de @kimmonismus: la arquitectura es fundamental, pero no explica por sí sola las puntuaciones reivindicadas.

La fórmula oficial es deliberadamente sencilla:

"Caché KV más pequeña. Mayor ahorro." @deepseek_ai

Por tanto, la promesa más concreta de V4.1 Flash no es necesariamente una puntuación bruta superior, sino un coste de memoria notablemente menor para cargas prolongadas y repetitivas.

La caché KV de DeepSeek, la verdadera palanca para los agentes

La caché KV almacena las representaciones necesarias para evitar recalcular la totalidad del contexto con cada token generado. Esta memoria es esencial para las conversaciones largas, los agentes que llaman a herramientas, los flujos de trabajo de código, las búsquedas iterativas y los sistemas que conservan un historial extenso.

DeepSeek anuncia que la caché de V4.1 Flash ahora solo requiere:

  • Una cuarta parte de la HBM requerida por la generación anterior.
  • Una octava parte del almacenamiento SSD necesario anteriormente.
  • Aproximadamente 890 bytes por token de caché global, frente a los 3 514 bytes de V4 Flash, según el gráfico publicado por la empresa.

El gráfico oficial muestra una reducción espectacular desde DeepSeek-V1: 389 120 bytes por token para V1, 48 068 para V3.2, 3 514 para V4 Flash y, finalmente, 890 para V4.1 Flash.

Gráfico que muestra la reducción de la caché KV global por token de 389 120 bytes en DeepSeek V1 a 890 bytes en DeepSeek V4.1 Flash

Para un operador de agentes, esta mejora puede ser más determinante que una diferencia marginal en un benchmark. Los cache hits suelen representar una parte importante de la factura cuando un agente reutiliza con frecuencia un contexto voluminoso. Comprimir esta caché reduce tanto la presión sobre la memoria de la GPU como la capacidad de almacenamiento necesaria a gran escala.

Esto es precisamente lo que señala @datachad en las respuestas a la publicación de @kimmonismus:

"la reducción de la caché KV a una cuarta parte de la HBM es lo que importa para la inferencia local" @datachad

La observación es acertada, pero debe matizarse. Una caché KV de DeepSeek más compacta hace que el autoalojamiento de IA sea más accesible para infraestructuras que ya están equipadas. Sin embargo, no convierte un modelo MoE de 552 mil millones de parámetros en un software fácil de ejecutar en un ordenador personal.

DeepSeek lo reconoce indirectamente cuando menciona despliegues de una escala completamente distinta:

"¿Está planificando un despliegue a gran escala con más de 2 000 GPU y un clúster de almacenamiento? Hablemos." @deepseek_ai

La mejora de la caché optimiza considerablemente la economía del servicio, pero no elimina la barrera de hardware asociada al tamaño del modelo.

El modelo y su informe técnico están disponibles en la página de Hugging Face de DeepSeek-V4.1-Flash y en el informe técnico de DeepSeek V4.1. Sin embargo, el material disponible en el hilo no permite confirmar los detalles mencionados por @UnslothAI en una respuesta sobre «196B engram». Por tanto, este dato no debe considerarse una especificación verificada sin consultar directamente el informe técnico.

Una transición de API que convierte a Flash en el producto predeterminado

El anuncio no se limita a promocionar un nuevo modelo. También reorganiza la gama de DeepSeek.

El hilo oficial indica que:

  1. V4 Flash y V4 Flash Vision Exp se retiran.
  2. Los antiguos identificadores deepseek-v4-flash y deepseek-v4-flash-vision-exp se redirigen temporalmente a V4.1 Flash para preservar la compatibilidad.
  3. A partir del 14 de septiembre de 2026 a las 04:00 UTC, las solicitudes destinadas a DeepSeek V4 Pro también se dirigirán a V4.1 Flash.
  4. Esta situación se mantendrá hasta el lanzamiento de V4.1 Pro.
  5. Las solicitudes migradas desde V4 Pro se facturarán según las tarifas de V4.1 Flash.

Esta decisión va mucho más allá de una comparación publicitaria. DeepSeek convierte a V4.1 Flash en su producto de referencia para la API incluso antes de la llegada de V4.1 Pro. Para los equipos que ya utilizan la API, la migración reduce el riesgo de una interrupción inmediata. Sin embargo, no elimina la necesidad de volver a validar las salidas, la latencia, las llamadas a herramientas, la visión nativa y el comportamiento del modelo en producción.

@bygregorr resume el problema desde el punto de vista de los desarrolladores de aplicaciones:

"Seis semanas entre familias de arquitecturas es un margen muy corto para quienes desarrollan con la API." @bygregorr

DeepSeek responde mediante una compatibilidad transitoria y el enrutamiento de los antiguos identificadores. Se trata de una respuesta pragmática en términos de continuidad del servicio, pero no de una garantía de equivalencia funcional perfecta. Aun así, será necesario volver a probar cualquier aplicación agéntica sensible a los formatos de salida, las llamadas a herramientas o las políticas de razonamiento.

La tabla de tarifas de DeepSeek muestra precios distintos según el horario, por millón de tokens. Fuera de las horas punta, indica 0,003 dólares para la entrada con caché, 0,15 dólares para la entrada sin caché y 0,6 dólares para la salida. En las horas punta, estos importes pasan respectivamente a 0,006, 0,3 y 1,2 dólares.

Tabla de tarifas de la API de DeepSeek V4.1 Flash con precios en horas valle y horas punta

DeepSeek precisa que las tarifas en horas valle representan el 50 % de las tarifas en horas punta. Este esquema refuerza el atractivo económico de las cargas flexibles, en particular los procesamientos por lotes, las evaluaciones automatizadas o las tareas agénticas asíncronas.

Una publicación de terceros de @ns123abc, mencionada en el debate más amplio, habla de una ejecución aproximadamente 86 veces más barata por millón de tokens y de un rendimiento de 420 a 507 tokens por segundo. Estas cifras pueden contribuir al debate, pero no aparecen en el hilo oficial proporcionado. Por tanto, deben considerarse afirmaciones de terceros, dependientes del hardware, la longitud del contexto, el nivel de cuantización y la carga probada, y no datos confirmados por DeepSeek.

Terminal-Bench: un dominio anunciado, pero no un veredicto universal

DeepSeek afirma que «pruebas realizadas por múltiples partes» sitúan a V4.1 Flash por delante de V4 Pro en rendimiento, coste, velocidad y tiempo total de ejecución. Esta afirmación puede respaldar su posicionamiento comparativo, pero el hilo no documenta suficientemente los protocolos, los proveedores, los ajustes de inferencia ni la composición exacta de estas pruebas.

El principal punto de fricción se refiere a Terminal-Bench, un benchmark especialmente seguido para evaluar las capacidades agénticas en el uso de ordenadores y en programación.

@Greg_GL_87 señala una aparente incoherencia entre dos versiones de la evaluación:

"la tabla muestra que pierde frente a GLM 5.3 en Terminal-Bench 4.0, 31,2 frente a 37,9, pero gana en la versión 3.0. una diferencia extraña para dos versiones de la misma evaluación" @Greg_GL_87

Esta crítica no recibió respuesta en el hilo. Es precisa e importante. La tabla oficial muestra efectivamente 31,2 para V4.1 Flash en Terminal-Bench 4.0, mientras que @Greg_GL_87 compara esta puntuación con los 37,9 de GLM 5.3. Al mismo tiempo, V4.1 Flash obtiene 30,0 en Terminal-Bench 3.0 y supera allí a GLM 5.3.

Un modelo puede superar a V4 Pro en varios indicadores sin ser la mejor opción para todas las tareas de programación agéntica. Sin un protocolo detallado, sigue siendo imposible determinar si la diferencia entre Terminal-Bench 3.0 y 4.0 se debe a las tareas, los entornos, los parámetros de prueba o algún otro factor metodológico.

@kryptosopus plantea una objeción más amplia al comparar V4.1 Flash con Claude Opus 5:

"Visión nativa integrada en el modelo más pequeño, pero aun así pierde frente a Opus5 en Terminal-Bench por 13 puntos. Flash es claramente la apuesta «barata y rápida», no la de vanguardia. La línea de escalado de la parte inferior es la verdadera pista" @kryptosopus

Esta interpretación no contradice por completo la de DeepSeek. V4.1 Flash puede ser mejor que DeepSeek V4 Pro según varias métricas seleccionadas por la empresa y, al mismo tiempo, quedar por detrás de Opus 5 en un benchmark agéntico concreto. El problema surge cuando una mejora relativa dentro de una gama se transforma en una afirmación de supremacía global.

Reacciones: entusiasmo por el código abierto, cautela sobre el producto y preguntas acerca de la futura versión Pro

Las respuestas al hilo oficial muestran un gran entusiasmo por la apertura del modelo y su rápida integración. @MrAhmadAwais indica, por ejemplo, que V4.1 Flash ya está disponible en su oferta CommandCodeAI. @Presidentlin elogia sobre todo la contribución de DeepSeek al ecosistema de código abierto:

"Gracias de nuevo por impulsar el código abierto" "Como siempre, era de esperar" "¡¡¿Hasta dónde llegará vuestro techo?!!" @Presidentlin

La respuesta iba acompañada de una página de manga que plasma esa mezcla de fascinación y desafío ante el ritmo de DeepSeek.

Página de manga en blanco y negro publicada por Presidentlin con la pregunta How high frente a unas siluetas amenazantes

@ParthM1001, por su parte, resume el ambiente con una metáfora culinaria:

"La ballena ha vuelto a cocinar algo maravilloso." @ParthM1001

Ballena azul antropomorfa con gorro de chef sosteniendo un cuchillo en una cocina, imagen publicada por ParthM1001

Las respuestas a la publicación de @kimmonismus se centran más en el posicionamiento de la gama. @elshayib_ considera que la antigua versión Pro pierde su razón de ser:

"V4 pro ya es un poco irrelevante" @elshayib_

@kimmonismus le responde:

"sí, solo estamos esperando otro lanzamiento de la versión pro" @kimmonismus

Esta respuesta es coherente con el anuncio oficial: V4 Pro se encuentra efectivamente en fase de retirada temporal, pero DeepSeek anuncia explícitamente una futura V4.1 Pro. Concluir que toda la gama Pro ha quedado definitivamente obsoleta va, por tanto, más allá de los hechos establecidos.

La misma pregunta aparece en la respuesta de @RimasXYZ:

«Si Flash supera ahora a V4 Pro en capacidades, coste y velocidad, ¿en qué le queda por ganar a V4.1 Pro?» @RimasXYZ

El hilo no responde a esta pregunta. Deja abierta la definición del futuro producto Pro: mayor calidad en las tareas difíciles, capacidades de razonamiento reforzadas, contexto más largo, fiabilidad agéntica u otro equilibrio de rendimiento.

Arquitectura Causal Encoder Decoder: qué cambia técnicamente

La reacción de @austinyuhao, «bienvenido de nuevo, encoder-decoder», es breve pero pertinente. DeepSeek no propone únicamente una compresión de la caché, sino que reintroduce una separación arquitectónica entre la ruta de codificación causal y el decodificador.

«bienvenido de nuevo, encoder-decoder» @austinyuhao

El diagrama compartido en la respuesta muestra un Causal Encoder y un Decoder de veinte capas cada uno, para una red con un total de cuarenta capas. También incluye los componentes MoE, CSA2, SWA, Vision Encoder, Text Embedding, Engram, DSpark y Candidate Pool.

Diagrama de la arquitectura DeepSeek V4.1 Flash con codificador causal, decodificador, bloques MoE y componentes multimodales

Esta organización explica por qué los temas de la inferencia multimodal y la caché KV están relacionados. DeepSeek busca ofrecer compatibilidad nativa con la visión y, al mismo tiempo, mantener un coste razonable en secuencias largas. La propuesta resulta especialmente atractiva para los agentes que deben leer documentos, analizar interfaces, manipular código y conservar una memoria de trabajo persistente.

Preguntas frecuentes sobre DeepSeek V4.1 Flash

¿Cuántos parámetros están activos en DeepSeek V4.1 Flash?

DeepSeek anuncia un modelo MoE de 552 mil millones de parámetros. Solo 8 mil millones de parámetros estarían activos durante el procesamiento de la entrada y, posteriormente, 16 mil millones durante la generación.

¿Por qué es importante la caché KV de DeepSeek para los agentes de IA?

La caché KV permite conservar las representaciones del contexto ya procesado. Una caché más compacta reduce los requisitos de memoria GPU y almacenamiento, lo que puede disminuir el coste de las conversaciones largas, de los agentes con llamadas a herramientas y de los flujos de trabajo que reutilizan con frecuencia el mismo contexto.

¿Qué ocurrirá con los usuarios de DeepSeek V4 Pro?

A partir del 14 de septiembre de 2026 a las 04:00 UTC, las solicitudes destinadas a DeepSeek V4 Pro deberán dirigirse temporalmente a V4.1 Flash, hasta el lanzamiento de V4.1 Pro. Los equipos afectados deberán volver a validar sus casos de uso en producción, aunque se mantenga la compatibilidad de la API durante la transición.

Lo que hay que recordar

DeepSeek V4.1 Flash no es simplemente otra actualización rápida. El anuncio combina una nueva arquitectura asimétrica, una activación MoE diferenciada entre la entrada y la generación, una fuerte compresión de la caché KV, precios de API agresivos y una migración concreta del tráfico desde V4 Pro.

Para los profesionales, las implicaciones están claras:

  • La reducción de la caché KV puede mejorar considerablemente el coste de los agentes con contextos largos.
  • El autoalojamiento de IA se vuelve más viable para los operadores que ya disponen de una infraestructura considerable.
  • La redirección de V4 Pro a Flash exige una fase de validación de las aplicaciones.
  • El rendimiento declarado frente a V4 Pro no basta para demostrar un dominio en todos los benchmarks agénticos.
  • Terminal-Bench sigue siendo un aspecto que debe vigilarse, especialmente por la divergencia entre las versiones 3.0 y 4.0 señalada por @Greg_GL_87.

Por tanto, el hilo deja varias preguntas abiertas: ¿qué protocolos justifican las «pruebas realizadas por múltiples partes»?, ¿por qué difieren los resultados según la versión de Terminal-Bench?, ¿cuál será el papel distintivo de V4.1 Pro? y ¿qué configuración de hardware hará que el autoalojamiento resulte realmente práctico?

La conclusión más razonable es también la más útil: V4.1 Flash parece representar un gran avance en términos de eficiencia y despliegue, pero todavía no demuestra que un modelo Flash haya eliminado las concesiones propias de los modelos de frontera.

Leer en otro idioma