Como rodar IA em notebook fraco sem placa de vídeo dedicada: guia 2026
Dá para rodar IA em notebook fraco sem placa de vídeo dedicada — mas o laptop impõe três desafios que o desktop não tem: throttling térmico (a CPU desacelera para não fritar), RAM reduzida pela iGPU integrada e queda de performance na bateria. Com os modelos certos e as configurações adequadas, é possível usar IA local no seu notebook sem travamentos nem superaquecimento. Veja neste guia o que é específico do laptop — para a visão geral de PC fraco sem GPU dedicada, consulte o guia completo de IA local sem GPU.
Neste guia
- Por que notebook é mais limitante que desktop para IA local
- iGPU integrada vs sem iGPU: o que muda para a IA
- Quanta RAM o seu notebook realmente tem disponível
- Thermal throttling: por que a IA fica lenta depois de alguns minutos
- Como ativar o modo performance no Windows
- Modelos de IA que funcionam bem em notebook fraco
- Bateria vs tomada: o impacto real
- Passo a passo para instalar e usar IA no notebook
- Perguntas frequentes
Por que notebook é mais limitante que desktop para rodar IA local
Notebooks têm três restrições que o desktop não enfrenta ao rodar IA local:
- Throttling térmico: o sistema de refrigeração de um laptop é compacto. Quando a CPU mantém carga alta por vários minutos — como durante inferência de IA — a temperatura sobe rapidamente. Para se proteger, o processador reduz automaticamente sua frequência. O resultado: a IA começa rápida e vai ficando progressivamente mais lenta ao longo da sessão.
- RAM compartilhada com a iGPU: notebooks com gráficos integrados (Intel Iris Xe, AMD Radeon Graphics) reservam parte da RAM do sistema para o subsistema gráfico. Num notebook anunciado com 8 GB, podem restar apenas 6–7 GB para o sistema operacional e a IA.
- Limite de energia na bateria: no modo bateria, o Windows e o firmware do fabricante limitam o TDP da CPU para economizar carga. O resultado é um processador operando a frequência significativamente menor, e a IA gerando tokens mais devagar.
Um desktop com o mesmo processador e a mesma quantidade de RAM não sofre nenhuma dessas três restrições: tem refrigeração maior, toda a RAM disponível para o sistema e opera sempre em potência máxima. Por isso, o desempenho da IA local em notebook tende a ser menor do que no desktop equivalente — e as escolhas de modelo e configuração precisam compensar essas limitações.
iGPU integrada vs sem iGPU: o que muda na prática para a IA
A iGPU (GPU integrada) presente na maioria dos notebooks não acelera modelos de linguagem — ela serve para renderizar a tela, não para inferência de LLMs via Ollama ou LM Studio. O impacto dela para a IA local é outro: ela consome parte da RAM do sistema para funcionar, reduzindo o que sobra para carregar o modelo.
| Tipo de iGPU | RAM reservada (estimativa padrão) | O que muda para a IA |
|---|---|---|
| Intel UHD / Iris Xe | 128 MB – 2 GB (dinâmico) | Reduz RAM disponível; ajustável na BIOS |
| AMD Radeon Integrated (RDNA 2/3) | 512 MB – 2 GB (dinâmico) | Similar ao Intel; valor configurável na BIOS |
| Sem iGPU (CPU pura) | 0 MB | Toda a RAM fica disponível para a IA |
| Apple Silicon (M1/M2/M3/M4) | Memória unificada — sem divisão fixa | GPU e CPU compartilham o mesmo pool; a GPU integrada contribui para a inferência via Ollama |
Um ponto importante: notebooks com Apple Silicon são exceção à regra. A arquitetura de memória unificada permite que a GPU do Mac acelere modelos via Ollama sem overhead de cópia de memória, o que torna o desempenho em notebooks M1/M2/M3/M4 muito superior ao de notebooks Windows/Linux com CPU Intel ou AMD na mesma faixa de preço.
Para notebooks Intel ou AMD, se quiser maximizar a RAM disponível para a IA: acesse a BIOS/UEFI do fabricante (tecla Del, F2 ou F12 no boot, dependendo do modelo) e procure a opção de VRAM da iGPU. Muitos modelos permitem reduzir a alocação para 128 MB ou desativar a alocação dinâmica.
Quanta RAM o seu notebook realmente tem disponível para a IA
Antes de escolher o modelo de IA, subtraia a RAM da iGPU e a memória usada pelo Windows. O sistema operacional em repouso consome tipicamente 2–3 GB de RAM. A tabela abaixo mostra a RAM efetivamente disponível para carregar um modelo em um notebook com Windows:
| RAM total do notebook | RAM disponível (iGPU ~1 GB + Windows ~2,5 GB) | Modelos que cabem |
|---|---|---|
| 8 GB | ~4,5 GB | TinyLlama 1.1B, Phi-3 Mini 3.8B Q4, Gemma 2B |
| 12 GB | ~8,5 GB | Phi-3 Mini, Gemma 2B, Mistral 7B Q4 com folga |
| 16 GB | ~12,5 GB | Mistral 7B Q5/Q6, Llama 3 8B Q4 confortável |
| 32 GB | ~28 GB | Llama 3 13B quantizado; maioria dos 7B com conforto |
A RAM disponível real varia conforme outros programas abertos. Para otimizar: feche o navegador, o Spotify e qualquer aplicativo pesado antes de iniciar o modelo. O Gerenciador de Tarefas (Windows) mostra em tempo real quanto está “Em uso” e quanto está “Disponível” na aba Desempenho → Memória.
Thermal throttling: por que a IA em notebook fraco fica mais lenta com o tempo
Throttling térmico é a redução automática da frequência da CPU para evitar danos por superaquecimento. No desktop, o cooler tem espaço e vazão de ar para manter a CPU a temperaturas estáveis mesmo sob carga contínua. No notebook, o espaço interno é reduzido e o calor acumula rapidamente.
Na inferência de IA, a CPU opera em carga alta de forma sustentada — diferente de uma tarefa que dura 1–2 segundos. Após alguns minutos, o processador pode atingir o limite térmico e reduzir a frequência para proteger o hardware. O sinal mais claro: a IA começa rápida e vai desacelerando progressivamente enquanto você conversa.
Como monitorar e reduzir o throttling no notebook
- Superfície rígida obrigatória: use o notebook sobre mesa ou suporte elevado. Cama, sofá e tapete bloqueiam as entradas de ar da base e agravam o superaquecimento consideravelmente.
- Ative o perfil de performance do fabricante: softwares como Lenovo Vantage, ASUS Armory Crate e HP Omen Hub permitem selecionar “Performance” ou “Turbo”, que ajusta o cooler para velocidade mais alta e reduz a temperatura base.
- Suporte com cooler externo USB: para notebooks mais antigos com dissipação degradada, um suporte com ventilador (disponível por R$ 50–100) pode fazer diferença perceptível.
- Escolha modelos menores: Phi-3 Mini e Gemma 2B geram muito menos calor por resposta do que Mistral 7B ou Llama 3 8B. Para sessões longas, prefira os modelos leves.
- Monitoramento: o HWInfo64 (gratuito para Windows) mostra temperatura e frequência da CPU em tempo real. Se a frequência cair abaixo do clock-base durante a inferência, é throttling confirmado.
Como ativar o modo performance no Windows para usar IA no notebook
O modo de energia do Windows controla diretamente o quanto a CPU pode trabalhar. No modo “Balanceado” ou “Economia de energia”, especialmente na bateria, o sistema impõe limites ao TDP do processador — o que reduz significativamente a velocidade da IA local. Para usar IA no notebook com performance adequada:
- Plugue o notebook na tomada — é pré-requisito para performance completa.
- No Windows 11: clique no ícone de bateria na barra de tarefas → arraste o controle deslizante para “Melhor desempenho”.
- Via Configurações: Configurações → Sistema → Energia e bateria → Modo de energia → “Melhor desempenho”.
- Software do fabricante (recomendado quando disponível): Lenovo Vantage, ASUS Armory Crate, HP Omen Hub, MSI Center — esses programas liberam limites de TDP adicionais além do que o Windows controla e ajustam o cooler para velocidade máxima.
A diferença é prática: no modo “Economia de energia” com bateria, CPUs modernas podem operar bem abaixo do turbo clock máximo. Em modo performance na tomada, o processador acessa o TDP completo e a IA gera tokens consideravelmente mais rápido.
Modelos de IA que funcionam bem em notebook fraco sem GPU dedicada
A escolha do modelo é o fator mais importante para uso sustentado em notebook fraco. Modelos menores e quantizados (Q4) consomem menos RAM, geram menos calor e produzem respostas em velocidade mais aceitável mesmo na CPU. A tabela abaixo resume as opções disponíveis via biblioteca do Ollama:
| Modelo | Tamanho | RAM mínima | Adequado para notebook fraco? |
|---|---|---|---|
| TinyLlama 1.1B | 1.1B | ~2 GB | ✅ Ultraleve; ideal para 8 GB com iGPU ativa |
| Gemma 2B (Google) | 2B | ~2,5 GB | ✅ Leve e capaz para resumos e perguntas simples |
| Phi-3 Mini 3.8B Q4 (Microsoft) | 3.8B | ~3 GB | ✅ Melhor relação qualidade/peso para notebooks |
| Mistral 7B Q4 | 7B | ~4,5 GB | ⚠️ Funciona com ≥12 GB; mais calor e lentidão em 8 GB |
| Llama 3 8B Q4 (Meta) | 8B | ~5 GB | ⚠️ Requer ≥12 GB e tomada; throttling em sessões longas |
Para notebooks com 8 GB de RAM, o Phi-3 Mini é a escolha de referência: equilibra capacidade de raciocínio com leveza suficiente para não superaquecer o hardware. O Gemma 2B é a melhor opção para quem quer velocidade máxima em troca de um pouco menos de qualidade de resposta. O TinyLlama serve para casos extremos de pouca RAM ou notebooks muito lentos. Mistral 7B e Llama 3 8B ficam para quem tem ≥12 GB e tolera sessões mais curtas entre pausas para resfriamento.
Para instalar via Ollama: ollama run phi3, ollama run gemma:2b, ollama run tinyllama ou ollama run mistral. O Ollama detecta automaticamente que não há GPU dedicada e usa a CPU.
Bateria vs tomada: o impacto real na velocidade da IA no notebook
Usar IA local no notebook na bateria é possível, mas a performance cai de forma perceptível. O motivo: o Windows e o firmware do notebook limitam o TDP da CPU quando desplugado para economizar energia. Isso faz o processador operar a frequência menor, gerando menos tokens por segundo.
Para perguntas pontuais e tarefas rápidas, a bateria serve razoavelmente bem com modelos leves (Phi-3 Mini, Gemma 2B). Para sessões longas — gerar textos extensos, múltiplas interações, resumos de documentos — plugue o notebook e ative o modo performance. A diferença é mais perceptível em modelos maiores (7B) do que nos leves (2–3B), que respondem com aceitável velocidade mesmo com CPU limitada.
Passo a passo: como instalar e usar IA local no notebook fraco
O processo de instalação é o mesmo do desktop, com cuidados extras específicos do laptop:
- Plugue na tomada e coloque o notebook em modo performance antes de começar (Configurações → Energia → Melhor desempenho).
- Posicione o notebook sobre superfície rígida para garantir ventilação adequada pela base.
- Feche programas pesados (navegador com muitas abas, Spotify, apps de edição) para liberar RAM e reduzir temperatura base da CPU.
- Verifique a RAM disponível no Gerenciador de Tarefas (Desempenho → Memória). Se restar menos de 4 GB livres, opte por Gemma 2B ou TinyLlama.
- Instale o Ollama — disponível para Windows, macOS e Linux. Ao detectar ausência de GPU dedicada, ele usa a CPU automaticamente.
- Baixe o modelo escolhido. Para 8 GB de RAM:
ollama run phi3. Para mais leveza:ollama run gemma:2b. Para quem tem ≥12 GB e quer mais capacidade:ollama run mistral. - Nas primeiras sessões, monitore a temperatura pelo Gerenciador de Tarefas (aba CPU → frequência em tempo real) para conhecer o comportamento do seu hardware.
Para a visão mais ampla de requisitos de hardware, ferramentas e comparação de modelos sem GPU, consulte: como rodar IA local sem GPU em PC fraco.
Perguntas frequentes sobre IA em notebook fraco
Notebook com 8 GB de RAM consegue rodar IA local?
Sim, mas com atenção ao que a iGPU consome: em notebooks de 8 GB com Intel Iris Xe, restam tipicamente 6–7 GB para o sistema. Após descontar o Windows (~2,5 GB), ficam cerca de 4–5 GB para o modelo. Phi-3 Mini 3.8B Q4 e Gemma 2B cabem confortavelmente nesse cenário.
O que é throttling térmico e por que atrapalha a IA no notebook?
Throttling térmico é a redução automática da frequência da CPU quando ela atinge o limite de temperatura. Em notebooks, a refrigeração compacta faz esse limite ser atingido mais rápido durante inferência de IA (carga sustentada). O sintoma: a IA começa rápida e vai desacelerando progressivamente. Modelos menores e boa ventilação minimizam o problema.
A iGPU integrada (Intel Iris Xe, AMD Radeon) ajuda a rodar IA no notebook?
Para LLMs via Ollama/LM Studio em notebooks Intel ou AMD convencionais, a iGPU quase não contribui: a inferência roda na CPU e na RAM. A iGPU integrada não possui VRAM dedicada suficiente para carregar modelos de forma eficaz — e seu impacto direto é negativo, pois reserva parte da RAM do sistema. A exceção são notebooks com Apple Silicon (M1/M2/M3/M4), onde a memória unificada permite que a GPU ajude na inferência com desempenho real.
Qual o melhor modelo de IA para notebook de 8 GB sem GPU dedicada?
Phi-3 Mini 3.8B Q4 (Microsoft) é a recomendação de referência: equilibra qualidade de resposta e peso. Para máxima leveza, Gemma 2B é a melhor opção. TinyLlama 1.1B para casos de RAM muito limitada ou hardware muito antigo.
É melhor usar IA no notebook na bateria ou na tomada?
Prefira sempre a tomada com modo “Melhor desempenho” ativado. Na bateria, o sistema limita o TDP da CPU e a IA fica consideravelmente mais lenta. Para consultas rápidas a bateria serve; para sessões longas de trabalho a tomada é essencial.
Posso usar IA local em notebook antigo com 5 anos ou mais?
Depende da RAM disponível. Notebooks mais antigos com 8 GB ou mais conseguem rodar modelos leves (Phi-3 Mini, Gemma 2B). Processadores Intel Core i5 de 6ª–8ª geração são mais lentos na inferência, mas funcionam. O maior risco em notebooks antigos é a pasta térmica degradada, que piora o throttling — considere a limpeza e reposição da pasta se o notebook superaquecer muito nas primeiras sessões.
Última atualização: julho de 2026. Informações baseadas na documentação oficial do Ollama, nas especificações técnicas dos fabricantes Intel e AMD sobre alocação de memória de iGPU, e na documentação da Microsoft sobre modos de energia do Windows. Conteúdo produzido pela equipe editorial Neurônios Artificiais com base em fontes primárias verificadas.
