O que é o Qwen 3.8
O Qwen 3.8 e o mais recente integrante da família Qwen de modelos de linguagem, desenvolvida pela Alibaba Cloud. Com 3.8 bilhoes de parâmetros, ele ocupa um nicho interessante: e compacto o suficiente para rodar em hardware modesto, mas capaz o suficiente para tarefas reais de programação, resumo e análise de texto.
A família Qwen (pronuncia-se "chuen") foi criada pela equipe de IA da Alibaba e e licenciada como open-source sob a licença Apache 2.0. Isso significa que você pode usar, modificar e distribuir o modelo sem restrições comerciais. Para devs brasileiros que querem montar pipelines de IA próprios, isso faz bastante diferença.
O lançamento do Qwen 3.8 gerou bastante discussão na comunidade tech internacional, especialmente pela combinação de tamanho reduzido com desempenho competitivo em benchmarks de raciocínio e código. Modelos compactos assim democratizam o acesso a IA generativa sem exigir GPUs caras.
Como funciona
O Qwen 3.8 e um modelo transformer decoder-only, o mesmo tipo de arquitetura por trás do GPT e do LLaMA. O que muda e o processo de treinamento e os dados: a Alibaba treinou o Qwen com um corpus multilingual massivo, incluindo chinês, inglês, português e dezenas de outros idiomas.
Um dos diferenciais da família Qwen 3 e o modo thinking. Quando ativado, o modelo usa raciocínio encadeado (chain-of-thought) antes de responder, o que melhora significativamente a qualidade em problemas de matemática, lógica e código. Você pode ativar ou desativar esse modo dependendo da tarefa.
Com 3.8 bilhoes de parâmetros em precisão de 4 bits (quantização Q4), o modelo ocupa cerca de 2-3 GB de VRAM ou RAM. Isso significa que roda em uma GPU de entrada como RTX 3060, ou até em CPU com velocidade aceitável para uso pessoal.
Para rodar o Qwen 3.8 em CPU, use o formato GGUF com quantização Q4_K_M. A performance em CPU e mais lenta, mas viável para testes e desenvolvimento local.
Principais recursos
O Qwen 3.8 chega com um conjunto de recursos que o destacam entre os modelos compactos disponíveis hoje:
- Suporte multilingue nativo: o modelo entende e gera texto em português com qualidade superior a maioria dos modelos compactos focados em inglês.
- Modo thinking (raciocínio): ative o modo de raciocínio encadeado para tarefas complexas de código e lógica.
- Contexto de 32K tokens: janela de contexto generosa para processar documentos longos e conversas extensas.
- Instrução e chat: o modelo já vem ajustado para seguir instruções e manter conversas, sem precisar de fine-tuning adicional para uso geral.
- Código em múltiplas linguagens: Python, JavaScript, SQL, Rust e outras linguagens populares com desempenho solido.
- Compatibilidade ampla: funciona com Ollama, llama.cpp, LM Studio e outras ferramentas de inferência local.
Use o Qwen 3.8 com o modo thinking desativado para tarefas simples de geração de texto (mais rápido) e ative apenas para problemas que exigem raciocínio passo a passo.
Como começar: instalação e acesso
A forma mais fácil de testar o Qwen 3.8 localmente e via Ollama, que cuida do download e da infraestrutura de inferência automaticamente. Se você ainda não tem o Ollama instalado, baixe em ollama.com e instale normalmente.
Com o Ollama instalado, um único comando já baixa e roda o modelo:
ollama run qwen3:8bSe quiser a versão mais compacta (3.8B), use:
# Listar versões disponíveis
ollama list
# Rodar a versão menor
ollama run qwen3:latestPara usar via API (compatível com a API da OpenAI):
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3:8b",
"messages": [{"role": "user", "content": "Explique o que é um LLM em 3 frases"}]
}'O download do modelo pode levar vários minutos dependendo da sua conexão. O arquivo tem alguns gigabytes. Deixe rodar sem interromper.
Exemplo prático
Suponha que você queira usar o Qwen 3.8 para revisar código Python e sugerir melhorias. Aqui vai um exemplo de chamada via Python usando a biblioteca openai apontando para o Ollama local:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # valor não importa, mas e obrigatório
)
código = """
def buscar_usuario(id):
resultado = db.execute(f"SELECT * FROM users WHERE id={id}")
return resultado
"""
resposta = client.chat.completions.create(
model="qwen3:8b",
messages=[
{"role": "system", "content": "Você e um revisor de código. Identifique problemas e sugira melhorias."},
{"role": "user", "content": f"Revise este código:\n{código}"}
]
)
print(resposta.choices[0].message.content)O modelo vai identificar a vulnerabilidade de SQL injection, sugerir o uso de parâmetros preparados e talvez comentar sobre tratamento de erro. Tudo isso rodando 100% local, sem custo de API e sem enviar código para nenhum servidor externo.
Comparação com alternativas
O mercado de LLMs compactos open-source esta aquecido. As principais alternativas ao Qwen 3.8 são:
- Llama 3.2 (Meta): ótimo para inglês, mas suporte a português mais limitado. Bem documentado e com ecossistema maduro.
- Gemma 3 (Google): modelos leves, excelente custo-beneficio para tarefas de chat. Disponível em versões de 1B a 27B.
- Phi-4 Mini (Microsoft): focado em raciocínio e matemática. Muito compacto (3.8B), mas com menos diversidade de idiomas.
- Mistral 7B: ainda popular, especialmente para uso em inglês. Tamanho levemente maior que o Qwen 3.8.
O Qwen 3.8 se destaca pelo suporte a português mais solido entre os modelos compactos, o que é relevante para devs brasileiros. Também é um dos poucos nesse tamanho com modo thinking integrado de serie.
Pontos positivos e limitações
Nos pontos positivos: totalmente gratuito e open-source, roda localmente sem nenhuma dependência de nuvem, licença Apache 2.0 permite uso comercial, qualidade em português acima da media para modelos compactos, e modo thinking e um diferencial real para tarefas complexas.
Nas limitações: a qualidade geral ainda e inferior a modelos maiores como GPT-4o ou Claude 3.5 Sonnet em tarefas que exigem raciocínio profundo. Em português coloquial ou regionalismos, o modelo pode errar mais do que em inglês. A velocidade em CPU e baixa, o que pode frustrar quem não tem GPU dedicada.
Não use o Qwen 3.8 para tarefas que exigem informações em tempo real ou dados pos-treinamento. Como todo LLM, ele pode alucinar fatos. Sempre valide outputs críticos.
Casos de uso reais
O Qwen 3.8 se encaixa bem em vários cenários práticos para devs:
- Dev solo ou freelancer: usar como assistente de código local sem custo de API, especialmente útil em projetos que envolvem código proprietário que não deve sair da máquina.
- Empresas com dados sensíveis: processar documentos internos, contratos ou dados de clientes sem enviar nada para terceiros. O modelo roda 100% on-premise.
- Automação de texto em PT-BR: gerar emails, resumos, categorização de textos em português com qualidade aceitável para prototipagem.
- Pipelines de RAG locais: combinar com ferramentas como LangChain ou LlamaIndex para criar buscas semânticas em bases de documentos próprias.
Dicas e boas práticas
Para código em português, inclua no system prompt: "Responda sempre em português brasileiro com acentos corretos." O modelo respeita bem essa instrução.
Use temperatura baixa (0.1 a 0.3) para tarefas de código e extração de dados, e temperatura mais alta (0.7 a 0.9) para criação de texto e brainstorming.
Para ativar o modo thinking via API, adicione ao system prompt: "Think step by step before answering." Ou use a tag específica se estiver rodando com o template de chat nativo do Qwen.
O modo thinking aumenta bastante o número de tokens gerados (e o tempo de resposta). Para produção com muitas requisições, calcule o impacto na latência antes de ativar por padrão.
Vale a pena?
Sim, especialmente se você quer um LLM local de qualidade sem custo de API. Para devs brasileiros, o suporte a português e o modo thinking são diferenciais reais que poucos modelos compactos oferecem.
Se você usa APIs pagas de IA para tarefas que poderiam rodar localmente (revisão de código, geração de texto, classificação), o Qwen 3.8 pode reduzir seus custos significativamente. O ponto de entrada e baixo: só precisar ter o Ollama instalado e rodar um comando.
Para quem não vale: se você precisa da melhor qualidade possível para tarefas críticas em produção, modelos maiores (70B+) ou APIs comerciais ainda entregam resultados superiores. O Qwen 3.8 e uma ferramenta de prototipagem e uso pessoal, não um substituto completo para modelos de ponta.