Guide

Modele AI locale pe un Mac mini: ce rulează pe fiecare treaptă de memorie

Ce modele open-source încap pe fiecare treaptă de memorie a unui Mac mini, cât de repede rulează și cum folosești un model local lângă unul din cloud, într-un agent AI. Actualizat pentru septembrie 2026.

Actualizat 2026-09-15

Un Mac mini poate rula singur modele de limbaj, fără cloud și fără cost pe cerere. Ce poate rula depinde aproape în întregime de un singur număr: memoria lui.

Ghidul arată ce încape pe fiecare Mac mini, la ce e bun și cum folosești un model local într-un agent AI.

De ce se descurcă un Mac mini la asta

Numele modelelor sunt verificate în septembrie 2026. Apar modele noi la câteva luni, dar regulile de memorie de mai jos rămân aceleași.

Pe majoritatea calculatoarelor, un model de limbaj trebuie să încapă în memoria plăcii video, care e mică și scumpă. Apple silicon împarte aceeași memorie între procesor și nucleele grafice. Un Mac mini cu 48 GB încarcă un model care în altă parte ar cere o placă video mare, dedicată.

Contează două numere:

  • Cantitatea de memorie decide ce modele încap și ce modele nu.
  • Lățimea de bandă a memoriei decide cât de repede răspund. E mult mai mare pe cipurile Pro decât pe cele de bază, și mai mare la fiecare generație nouă.

De câtă memorie are nevoie un model

Modelele se rulează de obicei cuantizate: numerele lor se stochează pe mai puțini biți, ceea ce taie din dimensiune cu o pierdere mică de calitate. 4-bit e alegerea obișnuită.

O regulă utilă: la 4-bit, un model cere cam 0,6 GB pe miliard de parametri, plus loc pentru conversație (contextul) și pentru macOS.

Where the memory goes, at 4-bit

  • 16 GBA 9B model, about 6 GB
  • 24 GBA 24B model, about 15 GB
  • 48 GBA 35B model, about 21 GB
  • 64 GBA 70B model, about 43 GB

The rest is macOS and the conversation. A model that fits with a short chat may not fit with a long document in it.

Modelul nu e niciodată singurul lucru din memorie.
Dimensiunea modeluluiMemorie la 4-bit, aproximativ
4B3 GB
9B6 GB
20 până la 24B13 până la 15 GB
31 până la 35B18 până la 21 GB
70B43 GB

Două lucruri schimbă socoteala:

  • Contextul lung consumă și el memorie. Un model care încape cu o conversație scurtă poate să nu mai încapă cu un document de 100 de pagini în el.
  • macOS dă nucleelor grafice o bună parte din memorie, dar nu toată. Lasă-ți marjă, mai ales pe mașinile de 16 și 24 GB.

Ce rulează pe fiecare Mac mini

MemorieModele care intră confortabilExemple (septembrie 2026)Bun pentru
8 GBPână la circa 4BGemma 4 E2B, E4BSortarea și clasificarea mesajelor, extragerea de câmpuri din text
16 GBPână la circa 9BQwen3.5 9B, Gemma 4 E4BRezumate, agenți simpli, rutarea cererilor, ciorne scurte
24 GBPână la circa 24BMistral Small 3.2 24B, gpt-oss-20bTool calling, ajutor la cod, întrebări pe documente
32 GBPână la circa 35BGemma 4 31B, Qwen3.6 35B-A3BRaționament mai bun, scris, agenți care lucrează cu imagini
48 GB35B cu context lung, sau mai multe modele deodatăGemma 4 31B, Qwen3.6 35B-A3BUn asistent local serios, lângă alte treburi
64 GBPână la circa 70BLlama 3.3 70BCele mai mari modele pe care le poate ține un Mac mini

Despre modelele „A3B”. Nume ca Qwen3.6 35B-A3B înseamnă un model mixture-of-experts: 35 de miliarde de parametri stocați, dar numai vreo 3 miliarde folosiți pentru fiecare cuvânt. Cere memoria unui model de 35B și răspunde aproape cu viteza unuia mic. Pe un Mac, ăsta e deseori cel mai bun compromis.

Ce Mac mini să alegi

Dacă vrei săAlege
Adaugi un model local mic la un agent care merge mai ales pe cloudM4, 16 GB
Rulezi modele medii, utile, pentru tool calling și documenteM4, 24 sau 32 GB
Rulezi repede modele din clasa 30B, lângă alte treburiM4 Pro sau M5 Pro, 48 GB
Rulezi modele de 70BM4 Pro sau M5 Pro, 64 GB

Pentru modele locale, mai multă memorie bate un cip mai rapid. Un M4 de 32 GB rulează modele pe care un M4 Pro de 24 GB nu le poate încărca. La aceeași memorie, cipul Pro și generația mai nouă răspund mai repede.

Cum începi

Cel mai simplu e cu Ollama. Descarcă modele, le rulează și îi dă agentului tău un API local. Pe Apple silicon poate folosi MLX, framework-ul Apple făcut pentru cipurile astea.

ssh
brew install ollama
ollama serve &
ollama run qwen3.5:9b

Tag-urile modelelor se schimbă, așa că verifică numele exact în biblioteca Ollama înainte să faci pull.

Alte variante bune:

  • LM Studio, dacă preferi o aplicație cu fereastră.
  • mlx-lm, unealta Apple, pentru cele mai rapide rezultate și pentru experimente de fine-tuning.

Cum folosești un model local într-un agent

Modelele locale rar înlocuiesc cele mai mari modele din cloud. Merg cel mai bine lângă ele.

Un tipar des întâlnit:

  1. 1Modelul local citește fiecare cerere care intră.Decide ce fel de cerere e, extrage datele și le rezolvă singur pe cele de rutină.
  2. 2Doar cererile grele ajung la un model din cloud.Rapoarte, decizii care cer judecată, raționament lung.

Într-un agent adevărat, majoritatea cererilor sunt de rutină, așa că cele mai multe nu ies niciodată din Mac. Factura de cloud scade, iar răspunsurile simple vin mai repede.

OpenClaw acceptă Ollama ca provider, iar majoritatea framework-urilor de agenți pot vorbi cu API-ul lui local de la http://127.0.0.1:11434.

Ține portul ăla privat. Implicit, Ollama ascultă doar pe Mac. Nu-l pune să asculte pe toate interfețele de rețea ale unei mașini accesibile din internet. Ajungi la el printr-un tunel SSH.

De ce un Mac mini găzduit pentru modele locale

  • Mereu pornit. Modelul e încărcat și gata la orice oră, fără laptop de trezit.
  • Fiecare treaptă de memorie, fără să cumperi. Încerci un M4 de 24 GB o zi și treci pe un M5 Pro de 64 GB când îți devine mic.
  • Datele tale rămân pe Mac-ul tău. Cererile la care răspunde un model local nu ajung niciodată la un furnizor de AI.
  • Găzduit în UE.

Mai departe