Guide

Clustere de Mac mini pe Thunderbolt 4

De la 2 la 8 Mac mini M4 sau M6 într-un rack, legate pe Thunderbolt 4, cu memorie unificată pusă la comun pentru inferență distribuită, ferme de build și randare.

Actualizat 2026-09-20

Un singur Mac mini rulează un model care îi încape în memorie. Leagă mai multe pe Thunderbolt 4 și obții ceva ce o singură mașină nu-ți dă la niciun preț: memorie unificată care se adună, pe o legătură destul de rapidă cât mașinile să se poarte ca una singură.

MacDuty le construiește ca clustere preconfigurate în rack-urile noastre din UE: de la 2 la 8 noduri, cablate, testate și predate gata de rulat.

De ce Thunderbolt și nu doar o rețea

Inferența distribuită e limitată de bandă. Fiecare token trebuie să treacă legătura dintre noduri, așa că interconectarea decide dacă un cluster e rapid sau doar mare.

Thunderbolt 4 dă fiecărei legături 40 Gb/s în ambele sensuri, de patruzeci de ori cât gigabit Ethernet, și destul cât mașinile să nu se mai aștepte una pe alta. Acesta e tot motivul pentru care cablezi un cluster în loc să pui Mac-urile pe un switch și să speri.

Al doilea motiv e memoria. Apple Silicon împarte memoria între CPU și GPU, așa că tot RAM-ul unui nod e disponibil pentru un model. Pe un cluster, se adună:

ClusterNoduriMemorie unificată la comun
Pereche2până la 64 GB
Patru4până la 128 GB
Opt8până la 256 GB

Totalurile exacte depind de configurația pe care o alegi pentru fiecare nod, între mașini M4 și M6, fiecare cu până la 32 GB.

Ce rulează lumea pe ele

Inferență LLM distribuită

Modele prea mari pentru o singură mașină, împărțite pe noduri cu MLX distributed, EXO sau llama.cpp RPC. Aici își merită banii legătura Thunderbolt, și aici altfel ai închiria GPU-uri de datacenter la oră.

Ferme de build în paralel

Patru sau opt mașini într-un rack, un singur cont, build-uri împărțite între ele. Același hardware, altă treabă.

Randare și media

Cadre sau secvențe împărțite pe noduri, cu rezultatul final adus înapoi pe aceeași legătură.

Flote de agenți

Mai mulți agenți AI care rulează nesupravegheați, fiecare cu mașina lui, pe o rețea privată comună și cu un singur punct de contact.

Ce primești

  • De la 2 la 8 noduri Mac mini M4 sau M6 în același rack
  • Cablare Thunderbolt 4 între noduri, montată și testată de noi
  • O rețea privată între mașini
  • Toolchain-ul tău preinstalat: MLX, EXO, Xcode, agenți de runner, orice cere workload-ul
  • Un cont, o factură, preț de pachet pentru cluster
  • Inginerii care au construit rack-ul îți răspund la email

Înainte să comanzi

Află de câtă memorie are nevoie modelul tău

Memoria pusă la comun e constrângerea care decide numărul de noduri. Spune-ne modelul și cuantizarea pe care vrei să le rulezi și îți spunem configurația care se potrivește, în loc să-ți vindem un nod de care n-ai nevoie.

Sharding-ul nu e gratis

Un cluster e răspunsul corect când un model nu încape pe o singură mașină. Dacă încape, o mașină mai mare bate două mai mici de fiecare dată, și o să ți-o spunem.

Topologia contează

Felul în care sunt cablate nodurile schimbă throughput-ul. Construim topologii inel pentru inferență cu sharding și aranjamente în hub pentru distribuirea joburilor, și o configurăm pentru workload-ul pe care ni-l descrii.

Scrie-ne despre un cluster

Spune-ne ce vrei să rulezi și de câtă memorie are nevoie. Noi dimensionăm cluster-ul, îl construim, îl testăm și ți-l predăm funcțional.

Întrebări

Puteți construi un cluster de Mac mini pe Thunderbolt?
Da. MacDuty construiește clustere preconfigurate de la 2 la 8 noduri Mac mini M4 sau M6 în rack-urile noastre din UE, cablate pe Thunderbolt 4 și testate înainte de predare.
Câtă memorie poate avea un cluster de Mac mini?
Memoria unificată se adună pe noduri: până la 64 GB pe o pereche, 128 GB pe patru noduri și 256 GB pe opt, cu fiecare nod M4 sau M6 ducând până la 32 GB.
Pot rula modele mari de limbaj pe mai multe Mac mini?
Da. Modelele prea mari pentru o singură mașină pot fi împărțite pe noduri cu MLX distributed, EXO sau llama.cpp RPC, peste legătura Thunderbolt.
De ce Thunderbolt în loc de Ethernet?
Inferența distribuită e limitată de bandă. Thunderbolt 4 duce 40 Gb/s pe legătură în fiecare sens, de patruzeci de ori cât gigabit Ethernet, și asta ține nodurile să nu se aștepte unul pe altul.
De câte noduri am nevoie?
Dimensionează după memoria cerută de ce rulezi, nu după numărul de noduri. Spune-ne modelul și cuantizarea și îl dimensionăm noi.
Un cluster de Mac mini e mai ieftin decât închirierea de GPU-uri?
Pentru inferență constantă, non-stop, un preț lunar fix pe mașini pe care le ții e de obicei mai ieftin decât închirierea de GPU la oră, iar memoria e pusă la comun, nu contorizată.

Mai departe