Tech si AI admin

Swiftlet — ruleaza modele Qwen de 35B si 80B pe Mac si iPhone cu doar cativa GB de RAM in 2026

Swiftlet e runtime-ul open-source care ruleaza modele Qwen MoE de 35B si 80B pe Mac si iPhone cu consum minim de RAM. Afla cum functioneaza si cum il instalezi.

Swiftlet — ruleaza modele Qwen de 35B si 80B pe Mac si iPhone cu doar cativa GB de RAM in 2026

Sa rulezi un model AI de 80 de miliarde de parametri pe un telefon suna a science fiction. Pana acum cateva saptamani, chiar era. Apoi a aparut Swiftlet — un runtime open-source scris in Swift si Metal care face exact asta: ia modelele Qwen MoE de 35B si 80B, le impacheteaza intr-un format propriu si le ruleaza pe Mac cu doar cativa GB de RAM. Si pe iPhone 17, cu 2.5 GB.

Proiectul a aparut pe GitHub in august 2026, sub licenta Apache 2.0, si a devenit rapid trending pe Hacker News. Nu e un wrapper peste llama.cpp si nu foloseste mmap. E o abordare complet diferita — una care exploateaza arhitectura Mixture-of-Experts ca sa tina in memorie doar ceea ce conteaza pentru fiecare token.

Daca ai un Mac cu Apple Silicon si vrei sa rulezi modele mari local, fara sa-ti umpli RAM-ul, articolul asta iti arata exact cum functioneaza Swiftlet si cum il instalezi pas cu pas. Iar daca vrei sa intelegi mai bine ecosistemul AI local, poti citi si ghidul nostru despre cum rulezi AI local cu Ollama sau despre Qwen 3.6 27B, cel mai bun model dense pe care il poti rula pe calculatorul tau.

Ce vei gasi in acest articol:

  • Ce este Swiftlet si cum difera de llama.cpp, Ollama sau LM Studio
  • Cum functioneaza streaming-ul de experti MoE si de ce consuma atat de putin RAM
  • Tabel comparativ cu performantele reale ale modelelor de 35B si 80B
  • Ghid complet de instalare pe Mac si iPhone, pas cu pas
  • Limitarile oneste — ce nu poate face Swiftlet si cand sa nu te bazezi pe el

Ce este Swiftlet si de ce e diferit

Swiftlet e un runtime AI scris integral in Swift si Metal, creat de leonickson1 si lansat sub licenta Apache 2.0. Ruleaza modelele din familia Qwen3-Next si Qwen3.5/3.6 — modele MoE (Mixture-of-Experts) hibride care combina atentia clasica cu atentia liniara DeltaNet.

Spre deosebire de Ollama, LM Studio sau llama.cpp, care incearca sa tina tot modelul in memorie (sau sa foloseasca mmap si sa se bazeze pe page-cache-ul SO), Swiftlet face ceva fundamental diferit: tine doar nucleul dens in memorie si expertii MoE sunt incarcati de pe SSD, la cerere, printr-un format propriu .qpack.

Ce inseamna asta in practica? Un model de 80 de miliarde de parametri care ocupa 42 GB pe disc foloseste doar ~4.3 GB RAM in timpul rularii. Nu e magie — e inginerie inteligenta care exploateaza faptul ca modelele MoE nu activeaza toti parametrii odata.

Cand sa folosesti Swiftlet vs alte unelte

Swiftlet e ideal cand vrei sa rulezi modele MoE mari pe hardware cu RAM limitat (Mac cu 8-16 GB, iPhone). Daca vrei sa rulezi modele dense mici sau medii (7B, 13B, 27B), Ollama sau LM Studio Bionic raman optiuni mai simple si mai rapide.

Cum functioneaza streaming-ul de experti

Ca sa intelegi de ce Swiftlet consuma atat de putin RAM, trebuie sa intelegi cum functioneaza modelele MoE. Spre deosebire de modelele dense (unde toti parametrii sunt activi la fiecare token), modelele MoE au mii de „experti” — sub-retele specializate — iar la fiecare token doar cativa sunt activati.

Arhitectura modelelor Qwen MoE

La fiecare strat si la fiecare token, un mecanism de rutare decide catre care experti merge tokenul:

  • Qwen3.6-35B-A3B: 256 experti per strat, 8 activati per token, plus un expert comun (shared)
  • Qwen3-Next-80B-A3B: 512 experti per strat, 10 activati per token, plus un expert comun

Astfel, desi modelul are 35 sau 80 de miliarde de parametri in total, fiecare token activeaza doar ~3 miliarde. Restul expertilor stau nemiscati pe disc.

Ce face Swiftlet diferit

Swiftlet exploateaza acest lucru la maximum:

  1. Nucleul dens ramane in memorie — atentia, proiectiile DeltaNet, rutatoarele, expertul comun si embedding-urile. Asta inseamna ~1.3 GB pentru modelul de 35B si ~2.5 GB pentru cel de 80B (la 4-bit).

  2. Expertii sunt repackati in .qpack — un format propriu in care fiecare expert e aliniat la un stride fix. Citirea unui expert = exact un pread() de pe SSD. Fara mmap, fara page-cache thrash, fara cautari.

  3. Cache de experti fierbinti — expertii des folositi raman intr-un pool in memorie, cu evictie LFU + recency. Masuratorile arata un hit rate de 43-70%, dar viteza nu scade semnificativ chiar si cu hit rate mai mic, pentru ca SSD-urile Apple absorb miss-urile rapid.

  4. Tot forward pass-ul pe Metal — shaderele sunt compilate la runtime, fara sa ai nevoie de Metal toolchain la build. Acelasi cod merge si pe macOS, si pe iOS.

  5. Atentie liniara pe 75% din straturi — Gated DeltaNet are o stare recurenta de dimensiune fixa, deci nu exista KV cache care creste cu contextul lung. Asta e un avantaj masiv fata de modelele clasice transformer.

Nu e magie — e un compromis onest

Swiftlet nu face un model de 80B sa „fie” un model de 80B in toate sensurile. Doar ~3B parametri sunt activi per token. Modelul scrie si converseaza ca un model mare, dar retine fapte ca un model mic. Nu il folosi ca enciclopedie.

Performante reale — tabel comparativ

Iata cifrele masurate pe hardware real:

ModelDimensiune pe discRAM peakViteza pe Mac M5Pe iPhone 17
Qwen3.6-35B-A3B, 4-bit18 GB2.6 GB7-11 tokeni/s~1 token/s, ~2.5 GB RAM
Qwen3-Next-80B-A3B, 4-bit42 GB4.3 GB4.5-5 tokeni/sN/A (prea mare)

Cateva observatii importante:

  • Modelul de 35B pe iPhone 17 ruleaza in ~2.5 GB RAM la ~1 token/s. E prima data cand un model de clasa asta (35B parametri totali) ruleaza nativ pe un telefon.
  • Viteza de 7-11 tokeni/s pe Mac M5 pentru 35B e comparabila cu cititul in viteza — suficient pentru conversatie reala.
  • 4.3 GB RAM pentru 80B e remarcabil. Un model echivalent ar necesita 40-80 GB RAM cu metode conventionale.
  • SSD-ul Apple e critic — viteza de incarcare a expertilor depinde de throughput-ul de stocare.

Ce iti trebuie ca sa rulezi Swiftlet

Inainte sa incepi, verifica daca ai tot ce iti trebuie:

  • Un Mac cu Apple Silicon (M1, M2, M3, M4 sau M5) — NU merge pe Mac cu Intel
  • macOS 14 sau mai nou (sau iOS 17+ pentru iPhone)
  • Cel putin 8 GB RAM recomandat (ruleaza si cu 8 GB, dar 16 GB e mai confortabil)
  • Spatiu liber pe SSD: 18 GB pentru modelul de 35B, 42 GB pentru cel de 80B
  • Xcode Command Line Tools instalate (pentru compilare)
  • Git instalat

Doar Apple Silicon

Swiftlet foloseste Metal pentru GPU si nu are suport pentru Mac cu Intel sau pentru alte platforme (Windows, Linux). Daca ai un Mac cu Intel, vezi alternativele din ghidul despre cum rulezi AI local cu Ollama.

Ghid de instalare pas cu pas

Pasul 1: Clonare si compilare

git clone https://github.com/leonickson1/Swiftlet.git && cd Swiftlet
swift build -c release

Compilarea dureaza cateva minute prima data. Dupa aceea, executabilele sunt in .build/release/.

Pasul 2: Descarcarea modelului

Pentru modelul de 35B (18 GB):

.build/release/swiftlet-repack \
  --from-hf Leonickson/Qwen3.6-35B-A3B-qpack \
  --output ~/models/qwen3.6-35b.qpack

Pentru modelul de 80B (42 GB):

.build/release/swiftlet-repack \
  --from-hf Leonickson/Qwen3-Next-80B-A3B-qpack \
  --output ~/models/qwen3-next-80b.qpack

Descarcarea e resumabila — daca se intrerupe, rulezi aceeasi comanda si continua de unde a ramas.

Pasul 3: Chat direct din terminal

.build/release/swiftlet chat ~/models/qwen3.6-35b.qpack "Ce este Mixture-of-Experts?"

Poti da mai multe intrebari in aceeasi comanda — Swiftlet mentine starea conversatiei:

.build/release/swiftlet chat ~/models/qwen3.6-35b.qpack \
  "Scrie un haiku despre programare" "Acum transforma-l intr-un sonet"

Pasul 4: Generare cu statistici

.build/release/swiftlet generate ~/models/qwen3.6-35b.qpack \
  --gpu --chat --prompt "Explica expert streaming intr-un paragraf."

Pasul 5: Server compatibil OpenAI API

.build/release/swiftlet-server --model ~/models/qwen3.6-35b.qpack --port 8080

Asta porneste un server local pe localhost:8080 care raspunde la API-ul OpenAI chat-completions. Poti conecta orice aplicatie care vorbeste cu OpenAI — Open WebUI, Continue, sau orice alt client.

Pasul 6 (iPhone): Folosirea prin aplicatia Priv AI

Pe iPhone, cea mai simpla metoda e aplicatia Priv AI, disponibila pe App Store:

  1. Descarca Priv AI din App Store
  2. Deschide Settings → Experimental Models
  3. Descarca modelul de 35B
  4. Incepe sa conversezi — totul ruleaza local, fara server

Aplicatia e open-source la leonickson1/localLLM pe GitHub. Daca vrei sa o compilezi singur, cloneaza repo-ul Swiftlet langa ea ca swiftlet, deschide proiectul Xcode si ruleaza pe iPhone.

Cum repackez propriile modele MLX?

Swiftlet poate repacka si checkpoint-uri MLX brute, nu doar pachetele qpack gata facute:

.build/release/swiftlet-repack \
  --from-hf mlx-community/nume-model \
  --output ~/models/model.qpack

Sau de pe disc local:

.build/release/swiftlet-repack \
  --source /path/to/checkpoint \
  --output ~/models/model.qpack

Procesul e acelasi: repackeaza expertii in blocuri cu stride fix, gata pentru streaming.

4 moduri de a folosi Swiftlet

Swiftlet e gandit ca o biblioteca, nu doar ca un CLI. Ai patru optiuni:

1. Pachet Swift (pentru dezvoltatori)

Adaugi SwiftletCore in proiectul tau macOS sau iOS si folosești SwiftletSession pentru chat cu streaming, cache de conversatie, sampling cu control de repetitie si gestionarea presiunii de memorie.

2. CLI (pentru utilizatori avansati)

  • swiftlet chat — conversatie interactiva cu template de chat aplicat automat
  • swiftlet generate — generare one-shot cu statistici
  • swiftlet-repack — construire containere din checkpoint-uri Hugging Face sau MLX

3. Server local (pentru integrare)

swiftlet-server vorbeste API-ul OpenAI chat-completions pe loopback. Orice aplicatie care se conecteaza la OpenAI poate folosi un model local prin Swiftlet.

4. Aplicatia Priv AI (pentru utilizatori normali)

Pe iOS, Priv AI ascunde complet terminalul. Descarci modelul si vorbesti cu el. Atat. Aplicatia e open-source.

Limitari oneste — ce nu poate face Swiftlet

Swiftlet face ceva impresionant, dar e important sa intelegi si limitarile:

Doar ~3B parametri activi per token. Asta inseamna ca modelul scrie si converseaza la nivel de model mare — rationeaza, creeaza, explica — dar retine fapte ca un model mic. Nu il folosi ca baza de cunoastere sau ca enciclopedie. Daca intrebi „care e capitala Mongoliei?”, probabil stie. Daca intrebi detalii obscure din istoria Mongoliei, s-ar putea sa nu.

Viteza pe iPhone e limitata. La ~1 token/s pe iPhone 17, e functional dar nu e rapid. Pentru conversatii lungi sau generare de cod, foloseste Mac-ul.

Nu merge pe Mac cu Intel. Swiftlet e construit pe Metal si Apple Silicon. Nu exista planuri pentru suport x86 sau Nvidia.

Formatul .qpack e proprietar. Nu poti folosi direct fisiere GGUF sau safetensors. Trebuie sa treci prin swiftlet-repack.

Spațiul pe SSD conteaza. Modelul de 80B ocupa 42 GB. Pe un iPhone cu 128 GB, asta e o bucata semnificativa.

Swiftlet vs alte unelte AI local

Daca vrei sa rulezi modele dense mici (7B-27B) cu viteza maxima, Ollama sau LM Studio raman optiuni mai potrivite. Daca vrei sa rulezi modele MoE mari cu RAM limitat, Swiftlet e singura optiune viabila pe Mac. Iar daca vrei sa compari cu alte modele mici care ruleaza pe telefon, vezi articolul despre Bonsai 27B sau despre Qwen 3.6 27B.

Intrebari frecvente

Swiftlet e gratuit?

Da. Swiftlet e sub licenta Apache 2.0 — complet gratuit si open-source. Poti sa-l folosesti, sa-l modifici si sa-l distribui. Modelele Qwen sunt de asemenea sub Apache 2.0. Nu exista abonamente, nu exista limitari de utilizare.

Merge pe Windows sau Linux?

Nu. Swiftlet e construit pe Metal (API-ul GPU de la Apple) si ruleaza doar pe Apple Silicon — Mac cu M1/M2/M3/M4/M5 sau iPhone cu A14+. Nu exista port pentru Windows, Linux sau GPU-uri Nvidia/AMD. Daca esti pe Windows sau Linux, vezi ghidul nostru despre Ollama sau LM Studio.

Cat de repede raspunde comparat cu ChatGPT?

Pe Mac M5 cu modelul de 35B: 7-11 tokeni/s. ChatGPT raspunde de obicei la 30-60 tokeni/s. Deci Swiftlet e de 3-6x mai lent decat ChatGPT, dar ruleaza 100% local, fara internet si fara sa trimita datele nicaieri. Pe iPhone, la ~1 token/s, e mai degraba un demo tehnic decat o experienta de zi cu zi.

Pot folosi Swiftlet cu alte modele in afara de Qwen?

Momentan, Swiftlet suporta doar familia Qwen3-Next si Qwen3.5/3.6 MoE. Nu poti rula modele dense (ca Llama sau Mistral) prin Swiftlet — pentru alea, foloseste Ollama sau llama.cpp. E posibil ca suportul pentru alte familii MoE sa vina in viitor.

Ce se intamaca daca raman fara spatiu pe SSD in timpul rularii?

Swiftlet citeste expertii de pe SSD la fiecare token. Daca SSD-ul e plin sau foarte fragmentat, viteza poate scadea dramatic sau rularea se poate opri. Asigura-te ca ai cel putin 18 GB liberi pentru 35B si 42 GB pentru 80B, plus spatiu pentru sistem.


Disclaimer

Acest articol e scris in scop informativ. Performantele mentionate sunt masurate de dezvoltatorul Swiftlet pe hardware specific si pot varia in functie de configuratia ta. Verifica intotdeauna documentatia oficiala pe GitHub pentru informatii actualizate. Swiftlet e un proiect tanar — asteaptă-te la imbunatatiri de viteza si la potentiale bug-uri.

Swiftlet arata directia in care merge AI-ul local: nu mai e nevoie de 80 GB RAM ca sa rulezi un model de 80B. Cu inginerie inteligenta si exploatarea arhitecturii MoE, poti face asta cu 4.3 GB. Daca ai un Mac cu Apple Silicon si vrei sa experimentezi cu modele mari, fara sa depinzi de cloud si fara sa-ti golesti portofelul, Swiftlet merita incercat.

Distribuie articolul

Articole similare