---
title: "DeepSeek-V4.1-Flash: arquitetura assimétrica, visão nativa e cache menor"
description: "Anúncio do DeepSeek-V4.1-Flash, o menor modelo da nova família de arquitetura da DeepSeek, com visão nativa, MoE de 552B parâmetros, cache KV muito menor e custo por token reduzido."
canonical: "https://ronanrodrigo.dev/notes/deepseek-v4-1-flash"
markdown: "https://ronanrodrigo.dev/notes/deepseek-v4-1-flash.md"
last-updated: "2026-09-10"
---
## DeepSeek-V4.1-Flash: o menor modelo da nova família de arquitetura

O DeepSeek-V4.1-Flash é apresentado como o menor modelo de uma nova família de arquitetura, com compreensão visual nativa e foco em mais capacidade, inferência mais rápida, maior throughput e escalabilidade para modelos maiores da série. A arquitetura assimétrica combina um MoE de 552 bilhões de parâmetros com um novo desenho Causal Encoder–Decoder, ativando apenas 8 bilhões de parâmetros na entrada e 16 bilhões na saída. Segundo a DeepSeek, novos métodos de pré-treinamento e pós-treinamento com RL em maior escala colocam os resultados à frente de seus modelos principais, incluindo o DeepSeek-V4-Pro. O cache KV cai para cerca de um quarto da HBM e um oitavo do armazenamento em SSD da geração anterior, o que reduz o custo de cargas de agentes, nas quais os acertos de cache costumam pesar bastante. O modelo já está na API como `deepseek-flash`: V4-Flash e V4-Flash-Vision-Exp foram aposentados e os nomes antigos passam a rotear para o V4.1-Flash, e as requisições ao V4-Pro passam a ser redirecionadas a partir de 14 de setembro de 2026, até a chegada do V4.1-Pro.

[Acesse a fonte original](https://x.com/deepseek_ai/status/2097930608790167907)

## Pesos e documentação técnica no Hugging Face

Modelo publicado com pesos abertos sob licença MIT, acompanhado de relatório técnico com arquitetura, avaliação e tabelas de benchmarks que incluem comparações com V4-Flash, V4-Pro e modelos de referência.

[Acesse o modelo no Hugging Face](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)

[Acesse o relatório técnico](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf)

## Changelog oficial da API DeepSeek

Registro de mudanças da plataforma com as notas de lançamento do V4.1-Flash, o nome de modelo a usar (`deepseek-flash`) e a agenda de novos preços e de roteamento a partir de setembro de 2026.

[Acesse a fonte original](https://api-docs.deepseek.com/updates/)

## Cobertura: custo, aposentadoria do V4-Pro e contexto de mercado

Cobertura jornalística do lançamento que resume a proposta de inferência mais rápida e barata, a redução de memória e armazenamento do cache KV e o plano de aposentar o V4-Pro, além de situar o movimento no contexto de captação e preparação de IPO da DeepSeek.

[Acesse a fonte original](https://enterpriseai.economictimes.indiatimes.com/news/industry/deepseek-rolls-out-v4-1-flash-as-it-targets-faster-lower-cost-ai/134006885)

## Análise técnica: preços, benchmarks e impacto econômico

Análise detalhada do lançamento com as mudanças práticas de API, os novos preços peak/off-peak, a linha do tempo de roteamento do V4-Pro e os números de benchmarks do modelo em relação a rivais como Opus 5, GPT-5.6 Sol e Kimi K3.

[Acesse a fonte original](https://www.intelligentliving.co/deepseek-v41-flash-pricing-release/)
