Ollama no Mac: como instalar e usar IA local em 2026 (guia completo)

MacBook Pro com terminal mostrando modelo de IA rodando localmente via Ollama

O Ollama no Mac funciona de forma nativa, gratuita e sem configuração complicada — você baixa o aplicativo no site oficial (ollama.com), arrasta para a pasta Aplicativos e, em poucos minutos, já tem uma IA respondendo localmente no seu computador. Compatível com Apple Silicon (M1 ao M5) e Macs Intel, o Ollama no Mac aproveita a arquitetura de memória unificada para rodar modelos como Llama, Gemma, Qwen e Mistral sem GPU dedicada, sem assinatura e sem conexão com a internet.

O que você vai aprender neste guia

O que é o Ollama?

O Ollama é uma ferramenta gratuita e open-source que permite rodar modelos de linguagem (LLMs) diretamente no seu computador, sem depender de nuvem, API paga ou conexão com a internet. Ele funciona como um servidor local que gerencia o download, a instalação e a execução dos modelos — você não precisa lidar com arquivos de centenas de gigabytes nem configurar drivers de GPU manualmente.

Lançado em 2023 e disponível em ollama.com, o projeto acumula mais de 90.000 estrelas no GitHub e se tornou o padrão de fato para inferência local de LLM. Com um único comando — como ollama run llama3.2 — você inicia uma conversa com o modelo direto no Terminal, ou conecta uma interface gráfica para uma experiência mais visual.

O Ollama suporta dezenas de modelos: Llama (Meta), Gemma (Google), Mistral (Mistral AI), Qwen (Alibaba), Phi (Microsoft), DeepSeek e muitos outros. Todos gratuitos, todos rodam offline. Se quiser entender quais modelos existem e qual escolher para o seu objetivo, veja nosso guia sobre os melhores modelos de IA para rodar local.

O Ollama funciona no Mac? Quais são os requisitos?

Sim, o Ollama funciona muito bem no Mac — e o Apple Silicon é hoje uma das melhores plataformas para IA local, especialmente para quem não tem GPU dedicada. A razão é técnica: a arquitetura de memória unificada dos chips M-series significa que RAM do sistema e aceleração GPU (via framework Metal) compartilham o mesmo pool de memória, eliminando o gargalo de transferência que existe em PCs com GPU discreta.

Segundo a documentação oficial do Ollama para macOS, os requisitos são:

  • Sistema operacional: macOS 11 Big Sur ou superior (recomendado: macOS 14 Sonoma ou Sequoia)
  • RAM mínima: 8 GB (para modelos de até 7B parâmetros)
  • RAM recomendada: 16 GB ou mais (para modelos 8B–14B com qualidade real)
  • Processador: Apple Silicon (M1, M2, M3, M4, M5) ou Intel (desempenho bem menor)
  • Espaço em disco: varia por modelo — de ~2 GB para modelos leves a ~40 GB para os maiores

Nos Macs com Apple Silicon, a aceleração GPU via Metal é ativada automaticamente pelo Ollama, sem nenhuma configuração extra — nada de instalar drivers, habilitar flags ou ajustar variáveis de ambiente.

Como instalar o Ollama no Mac: passo a passo (2 métodos)

Há dois métodos para instalar o Ollama no Mac: o download direto do aplicativo (.dmg) — mais simples, ideal para iniciantes — e a instalação via Homebrew, preferida por desenvolvedores. Ambos funcionam perfeitamente; a diferença está principalmente na facilidade de atualização.

Método 1 — Download direto (.dmg): o mais fácil

Este é o método recomendado para quem não usa o Terminal com frequência:

  1. Acesse ollama.com/download/mac e clique em Download for macOS.
  2. Abra o arquivo baixado e arraste o Ollama.app para a pasta Aplicativos.
  3. Abra o Ollama pela primeira vez — ele vai aparecer como um ícone de lhama na barra de menus do macOS.
  4. Abra o Terminal (Aplicativos → Utilitários → Terminal) e execute o primeiro modelo:
    ollama run llama3.2
  5. O Ollama baixa o modelo automaticamente (alguns GB) e inicia uma sessão de chat interativa no Terminal.

Pronto. A IA está rodando localmente no seu Mac.

Método 2 — Homebrew: para desenvolvedores

Se você já tem o Homebrew instalado, basta um único comando:

brew install ollama

Para iniciar o servidor manualmente (caso não tenha o app rodando):

ollama serve

A vantagem do Homebrew é simplificar atualizações futuras (brew upgrade ollama) e permitir gerenciar o Ollama como serviço do sistema (brew services start ollama), iniciando automaticamente com o Mac.

Como usar o Ollama no Mac: primeiros comandos

Após a instalação, você controla o Ollama pelo Terminal com comandos simples — todos começam com ollama. Veja os principais:

ComandoO que faz
ollama run llama3.2Baixa (se necessário) e inicia chat com o Llama 3.2
ollama pull gemma3:9bBaixa o Gemma 3 9B sem iniciar chat
ollama listLista todos os modelos instalados no Mac
ollama rm llama3.2Remove o modelo e libera espaço em disco
ollama show llama3.2Exibe detalhes do modelo (tamanho, parâmetros, licença)
ollama psMostra quais modelos estão carregados na memória agora
ollama serveInicia o servidor local (API REST em localhost:11434)

Para sair de uma sessão de chat, pressione Ctrl + D ou digite /bye. O servidor continua rodando em segundo plano — o Ollama mantém o modelo na memória por 5 minutos antes de descarregá-lo automaticamente, para respostas mais rápidas se você voltar logo em seguida.

O Ollama também expõe uma API REST local em http://localhost:11434, compatível com a API da OpenAI — qualquer app ou script que use o ChatGPT pode ser apontado para o Ollama sem mudanças no código.

Quais modelos de IA rodam bem no Mac? (por chip e RAM)

A regra geral é simples: um modelo quantizado em 4 bits ocupa aproximadamente metade do número de bilhões de parâmetros em GB de RAM — por exemplo, um modelo 8B em Q4 ocupa ~4–5 GB. Some 2–3 GB reservados para o sistema operacional e você tem o mínimo necessário.

A tabela abaixo cruza o chip do seu Mac com os modelos recomendados e o desempenho esperado. Os dados são estimativas baseadas em benchmarks da comunidade (LLMCheck e HybridLLM, julho/2026) e podem variar conforme o modelo exato, quantização e uso simultâneo do sistema:

Chip / RAMModelos recomendadosVelocidade estimadaIdeal para
M1 / M2 — 8 GBPhi-4 Mini 3.8B, Gemma 3 4B, Llama 3.2 3B30–60 tok/sChat leve, tarefas simples
M1 / M2 — 16 GBLlama 3.1 8B, Gemma 3 9B, Mistral 7B40–80 tok/sChat geral, redação, código
M3 Pro / M2 Pro — 18–24 GBQwen3 14B, Llama 3.3 13B35–55 tok/sRaciocínio, código avançado
M3 Pro / M4 Pro — 36 GBQwen3 32B, Gemma 3 27B25–45 tok/sQualidade próxima a APIs cloud
M3 Max / M4 Max — 64–128 GBLlama 3.3 70B, Qwen3 72B20–35 tok/sPesquisa, produção local

Dica prática: se você tem um Mac com 16 GB, o Llama 3.1 8B na quantização Q4_K_M (~4,7 GB) é o ponto de equilíbrio ideal — rápido, capaz e deixa memória suficiente para o sistema funcionar sem travamentos. Para uma comparação mais ampla dos modelos e qual escolher por objetivo (chat, código, português, PC fraco), veja o guia completo sobre os melhores modelos de IA para rodar local.

Performance do Ollama no Apple Silicon: o que esperar?

O Apple Silicon é hoje o hardware mais eficiente para IA local em termos de desempenho por watt — e o Ollama aproveita isso via aceleração Metal automática e, nos modelos mais novos, via backend MLX.

Em 2026, o Ollama lançou suporte experimental ao backend MLX para Apple Silicon com 32 GB ou mais de memória unificada. Segundo testes da comunidade (DEV Community), o backend MLX pode quase dobrar a velocidade de decodificação em alguns modelos: em um M4 Max com 64 GB, o Qwen3.5-35B passou de 58 tok/s (Metal padrão) para 112 tok/s com MLX.

Para quem tem um Mac com 8 ou 16 GB — a maioria dos usuários — o backend Metal padrão já entrega velocidades muito usáveis para uso diário. A comparação com PC é favorável ao Mac em cenários sem GPU dedicada: um Mac M2 com 16 GB entrega desempenho similar a um PC com CPU moderna e 32 GB de RAM rodando modelos de 8B, com consumo de energia significativamente menor.

Para entender os limites de usar IA local em hardware sem GPU dedicada, seja no Mac ou no PC, veja nosso artigo sobre como rodar IA local sem GPU.

Ollama no Mac vs PC com Windows: qual é melhor para IA local?

Depende do hardware: o Mac Apple Silicon vence em eficiência e praticidade; o PC com GPU dedicada NVIDIA vence em velocidade bruta para modelos grandes. Veja o comparativo:

CritérioMac Apple SiliconPC Windows com GPU NVIDIA
Configuração inicial✅ Plug-and-play, Metal automático⚠️ Requer instalação de drivers CUDA
RAM disponível para IA✅ Toda a RAM do sistema (unificada)⚠️ Limitado à VRAM da GPU
Velocidade (modelos grandes 70B+)⚠️ Boa, limitada pela largura de banda✅ RTX 4090 domina em modelos 70B+
Consumo de energia✅ Muito eficiente (5–15W em uso)❌ GPU usa 150–400W
Custo por GB de “VRAM efetiva”✅ Barato (RAM unificada compartilhada)❌ VRAM dedicada é cara
Privacidade / uso offline✅ 100% local✅ 100% local
Ecossistema de apps✅ Ollama, LM Studio, Jan, Open WebUI✅ Mesmo ecossistema

Conclusão prática: se você já tem um Mac Apple Silicon, não precisa de GPU dedicada para uso pessoal — o Ollama no Mac entrega qualidade real para chat, redação, código e análise de documentos. Para uso profissional com modelos de 70B+ em produção, um servidor com GPU NVIDIA RTX 4090 ou superior tende a ser mais econômico a longo prazo.

Se quiser comparar com o Ollama rodando no Windows, temos um guia detalhado: Ollama no Windows: instale IA local grátis. Para requisitos de hardware no PC, veja qual PC para rodar IA local.

Como usar o Ollama no Mac sem abrir o Terminal (interfaces gráficas)

O Ollama expõe uma API local em localhost:11434 compatível com a OpenAI, e qualquer interface gráfica pode usá-la — você não precisa do Terminal para ter uma experiência de chat completa no Mac.

As opções mais populares e gratuitas compatíveis com Mac:

  • Enchanted — app nativo para macOS (disponível na Mac App Store), feito especificamente para o Ollama. Interface limpa, sem configuração adicional.
  • Open WebUI — interface web estilo ChatGPT, roda como app local via Docker ou Python. Suporta múltiplos modelos, histórico e upload de arquivos.
  • Jan — app desktop multiplataforma com interface de chat e gerenciador de modelos visual. Suporta Ollama como backend.
  • LM Studio — alternativa popular ao Ollama, com interface gráfica própria e suporte aos mesmos modelos GGUF.
  • Msty — app Mac com suporte a múltiplos backends, incluindo Ollama.

Fluxo mais simples sem terminal: instale o Ollama pelo .dmg, instale o Enchanted pela Mac App Store e você tem uma experiência de IA local no Mac sem digitar um único comando.

Para instalar o Open WebUI via Docker (com o Ollama já rodando no Mac):

docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

Aguarde o download (~1 GB na primeira vez) e acesse localhost:3000 no navegador. O Open WebUI suporta upload de documentos, histórico de conversas e múltiplos usuários. Documentação: docs.openwebui.com.

Dicas para otimizar o Ollama no Mac

Pequenos ajustes fazem diferença real na velocidade e na experiência de uso do Ollama no Mac. As principais dicas:

  • Feche apps que usam muita memória antes de rodar modelos grandes. O Ollama compartilha a RAM com todo o sistema — Chrome com muitas abas pode consumir 4–8 GB que fariam diferença ao rodar um modelo 14B.
  • Escolha a quantização certa. Para a maioria dos usos, Q4_K_M é o melhor equilíbrio entre velocidade e qualidade. Q8_0 é mais preciso mas ocupa o dobro de memória. Q2_K é rápido mas sacrifica qualidade visivelmente.
  • Use o modelo adequado para o seu Mac. Forçar um modelo 32B em 16 GB de RAM vai causar uso intenso de swap e velocidades de 1–3 tok/s — praticamente inutilizável. Siga a tabela de recomendações acima.
  • Habilite o backend MLX (se tiver 32 GB ou mais). O backend experimental MLX do Ollama pode quase dobrar a velocidade em modelos compatíveis nos chips M3/M4 Max e Ultra.
  • Mantenha o Ollama atualizado. Novas versões frequentemente trazem melhorias de desempenho significativas — como a atualização MLX que aumentou a velocidade em ~93% em certos modelos.
  • Use ollama ps para monitorar a memória. O comando mostra quais modelos estão carregados e quanto de VRAM/RAM estão usando, ajudando a identificar quando algo está consumindo mais do que deveria.

Para saber mais sobre como extrair o máximo de Macs e PCs sem GPU dedicada, veja nosso guia sobre como rodar IA local sem GPU e o tutorial sobre como rodar o Llama local no PC.

Perguntas frequentes sobre o Ollama no Mac

O Ollama é gratuito no Mac?

Sim. O Ollama é 100% gratuito e open-source. O download do aplicativo, os modelos disponíveis no repositório oficial e o uso são todos gratuitos — você só paga pela eletricidade do seu Mac.

O Ollama no Mac funciona sem internet?

Sim. Depois que você baixa um modelo pela primeira vez, ele fica armazenado localmente e funciona 100% offline. Nenhum dado de conversa sai do seu computador.

Qual a diferença entre o Ollama no Mac e no Windows?

No Mac Apple Silicon, o Ollama usa o framework Metal para aceleração GPU automaticamente — zero configuração. No Windows, a aceleração depende de uma GPU NVIDIA ou AMD separada com drivers CUDA ou ROCm. Para Macs com 16 GB+, o desempenho é competitivo com PCs sem GPU dedicada, com muito menos consumo de energia.

O Ollama funciona em Macs com processador Intel?

Sim, mas com desempenho inferior ao Apple Silicon. Em Macs Intel, o Ollama roda na CPU sem aceleração GPU eficiente, resultando em velocidades muito menores. Para uso intenso em Mac Intel, prefira modelos muito leves (3B ou menos).

Quanto espaço em disco o Ollama ocupa no Mac?

O aplicativo Ollama em si ocupa menos de 500 MB. O espaço real vem dos modelos: um modelo de 7B em Q4 ocupa cerca de 4–5 GB; um de 14B, cerca de 8–9 GB; um de 70B, cerca de 40–45 GB. Os modelos ficam em ~/.ollama/models/ e podem ser removidos com ollama rm nome-do-modelo.

O Ollama no Mac é seguro? Meus dados ficam protegidos?

Sim. O Ollama roda inteiramente no seu Mac — nenhum dado de prompt ou resposta é enviado para servidores externos. O servidor local fica disponível apenas em localhost:11434, não exposto à internet por padrão. O código-fonte é aberto e auditável no GitHub.

Como atualizar o Ollama no Mac?

Se instalou via .dmg, o Ollama.app notifica quando há atualizações disponíveis — basta clicar no ícone na barra de menus. Se usou Homebrew, atualize com brew upgrade ollama.

Posso usar o Ollama no Mac com Python ou scripts personalizados?

Sim. O Ollama expõe uma API REST compatível com a OpenAI em http://localhost:11434. Você pode usar a biblioteca oficial (pip install ollama), a biblioteca openai-python apontando para localhost, ou qualquer ferramenta compatível com OpenAI API — incluindo LangChain, LlamaIndex e AutoGen.


Sobre este artigo: produzido pela equipe editorial do Neurônios Artificiais com base em fontes primárias verificadas: documentação oficial do Ollama para macOS, repositório no GitHub, blog oficial (MLX backend) e benchmarks da comunidade (LLMCheck, HybridLLM, julho/2026). As estimativas de performance são baseadas nesses benchmarks e podem variar conforme versão do modelo, quantização e uso simultâneo do sistema. Atualizado em julho de 2026.

Posts Similares

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *