Tech si AI admin

Needle 2 — modelul AI de 14 MB care ruleaza pe orice dispozitiv, de la ESP32 la Raspberry Pi

Needle 2 de la Cactus Compute: model AI open-source de 45M parametri, 14 MB, ruleaza in 28 MB RAM. Face tool calling si extractie structurata pe Raspberry Pi, ESP32 si telefoane sub 200$.

Needle 2 — modelul AI de 14 MB care ruleaza pe orice dispozitiv, de la ESP32 la Raspberry Pi

Pe 10 august 2026, Cactus Compute a lansat Needle 2 — un model AI open-source care cantareste 14 MB si ruleaza o sesiune completa in 28 MB RAM. Nu e un typo. 14 megabytes. Cat un selfie facut cu telefonul. Si totusi, modelul asta face tool calling, extractie structurata de date si clasificare pe hardware pe care nici nu l-ai considera „capabil de AI” — Raspberry Pi 5, ESP32-S3, telefoane Samsung seria A sub 200 de dolari, chiar si casti VR ca Meta Quest 3S sau Apple Vision Pro.

Contextul e simplu: lumea AI s-a concentrat pe modele din ce in ce mai mari — sute de miliarde de parametri, zeci de GB de memorie, GPU-uri de mii de dolari. Needle 2 merge in directia opusa. Si argumentul Cactus Compute e convingator: sunt peste 21 de miliarde de dispozitive IoT in lume, fata de doar 1,5 miliarde de PC-uri. Aproape 4 din 5 dispozitive edge costa sub 200 de dolari. Daca vrei AI real pe marginea retelei — nu in cloud — ai nevoie de ceva care incape pe un cip de cativa dolari.

Hai sa vedem ce poate Needle 2, cum functioneaza si ce inseamna pentru tine.

Disclaimer

Cifrele si benchmark-urile din acest articol sunt cele publicate de Cactus Compute la data lansarii (10 august 2026). Performantele pot varia in functie de hardware si conditii de testare.

Ce vei gasi in acest articol

  • Ce este Needle 2 si cum functioneaza un model AI de 14 MB
  • Ce e tool calling si de ce un model mic e suficient pentru asta
  • Viteze reale pe dispozitive: Raspberry Pi, ESP32, telefoane, casti VR
  • Tabel comparativ: Needle 2 vs FunctionGemma 270M, LFM2.5 230M si Apple Foundation Models
  • Cum il incerci in browser (playground WebAssembly) si cum il rulezi pe hardware real
  • Ce inseamna pentru romani: case smart, automatizari si privacy local
  • FAQ cu cele mai frecvente intrebari

Ce este Needle 2 si cum incape intr-un fisier de 14 MB

Needle 2 e un model AI de 45 de milioane de parametri, comprimat la CQ2-bit prin tehnologia proprie Cactus Quants. Rezultatul: un singur fisier de 14 MB cu un motor propriu de inferenta. Nu ai nevoie de PyTorch, nu ai nevoie de CUDA, nu ai nevoie de o placa video. Ruleaza pe procesor, cu un footprint de doar 28 MB RAM pentru o sesiune completa.

Arhitectura se numeste Simple Attention Network — o arhitectura atent gandita pentru a maximiza eficienta pe hardware limitat. Gramatica la nivel de byte, compilata din schemele declarative, constrange fiecare token generat. Asta inseamna ca modelul nu poate iesi din formatul cerut — daca ii zici sa returneze JSON cu un anumit camp, nu are cum sa dea altceva. E o garantie structurala, nu una bazata pe „speram ca modelul intelege”.

Licenta e Apache 2.0 — complet open-source, cu weights publicati pe Hugging Face si codul pe GitHub la cactus-compute/needle. Poti sa-l folosesti comercial, sa-l modifici, sa-l distribui. Nu e nevoie de nicio aprobare.

Atentie

Needle 2 NU e un chatbot. Nu e facut pentru conversatii lungi, generare de texte creative sau intrebari generale. E specializat pe taskuri precise: tool calling, clasificare, extractie de date structurate. Daca vrei un model de conversatie, vezi ghidul nostru despre cum rulezi AI local cu Ollama.

Ce e tool calling si de ce un model mic e suficient

Daca nu ai mai auzit de tool calling (apeluri de functii), ideea e simpla: in loc sa-i ceri AI-ului sa-ti scrie un eseu, ii dai o lista de „unelte” disponibile — functii, API-uri, actiuni — si il lasi sa aleaga pe cea potrivita si sa completeze argumentele corecte.

De exemplu:

  • User: „Aprinde lumina din sufragerie”
  • Modelul identifica functia set_light si genereaza: set_light(room="living_room", state="on")

Nu trebuie sa fie destept ca GPT-5. Trebuie sa fie precis. Sa nu greseasca numele functiei, sa nu inventeze argumente, sa nu dea un raspuns gresit cand nu stie.

Asta e diferenta critica: un model mare ca GPT-5 sau Claude e „generalist” — stie sa faca de toate, de la poezie la programare la medicina. Un model mic ca Needle 2 e specializat — stie sa identifice ce functie sa cheme si ce argumente sa puna. Si la asta, un model de 45M parametri poate fi la fel de bun ca unul de 270M sau chiar mai mare.

E exact analogia cu surubelnita: nu ai nevoie de un briceag elvetian cu 47 de ustensile ca sa infiletezi un surub. Ai nevoie de o surubelnita buna.

Tool calling in practica

Needle 2 accepta scheme JSON declarative pentru functii. Cand primeste o cerere, modelul returneaza un apel structurat cu numele functiei si argumentele — sau un „empty call” gol daca nu stie. Asta il face ideal pentru automatizari unde nu vrei sa risti erori.

Viteze reale: cat de repede ruleaza pe fiecare dispozitiv

Unul dintre cele mai impresionante aspecte ale lui Needle 2 e viteza. Nu vorbim de „ruleaza” in sensul de „merge, dar abia”. Vorbim de viteze reale, utile, care permit interactiune in timp real.

Tabel comparativ viteze pe dispozitive

DispozitivPret estimatViteza decode (tok/s)Viteza prefill (tok/s)
Raspberry Pi 5~80$500+800+
Meta Quest 3S~300$400–1.500
Apple Vision Pro~3.500$400–1.500
Samsung seria A (telefon)~150$300–700
ESP32-S3 (microcontroler)~5$Ruleaza

Da, ai citit bine: ESP32-S3, un microcontroler de 5 dolari pe care l-am descris in ghidul nostru complet despre ESP32, poate rula Needle 2. Nu va fi rapid ca un Raspberry Pi, dar faptul ca ruleaza deloc pe un cip atat de mic e o realizare tehnica remarcabila.

Needle 2 vs modelele mici concurente

Needle 2 nu e singurul model mic de pe piata. Dar e cel mai mic care face ce face. Hai sa-l comparam cu alternativele:

ModelParametriMarime fisierRAM necesaraTool callingScor incredere
Needle 245M14 MB28 MBDaDa (empty call)
FunctionGemma270M~150 MB~300 MBDaNu
LFM2.5230M~120 MB~250 MBDaPartial
Apple Foundation ModelsN/AN/AN/ADaDa

Needle 2 e de 5x pana la 70x mai mic decat concurentii sai directi. FunctionGemma de la Google are 270M parametri — de 6 ori mai multi. LFM2.5 de la Liquid AI are 230M. Si totusi, pe benchmark-ul Mobile-Actions (google/mobile-actions, 961 de randuri, exact match strict), Needle 2 concureaza cu ambele.

Ce inseamna exact match strict

Pe benchmark-ul Mobile-Actions, modelul trebuie sa returneze exact apelul corect de functie — nu „aproape”, nu „similar”. E cel mai dur mod de a evalua tool calling-ul. Needle 2 performeaza la nivel comparabil cu modele de 5-70x mai mari.

Scorul de incredere: cand nu stie, refuza

Una dintre cele mai importante functii ale lui Needle 2 e scorul de incredere invatat. Cand modelul nu stie raspunsul, nu inventeaza — returneaza un „empty call” (apel gol). Asta e esential pentru fiabilitate.

De ce conteaza? Pentru ca in scenarii reale — controlul unei case smart, procesarea unei comenzi, clasificarea unui mesaj — un raspuns gresit e mai rau decat niciun raspuns. Daca modelul nu stie ce functie sa cheme, mai bine nu cheama niciuna si lasa un sistem de fallback (cloud, uman, sau o regula simpla) sa decida.

Asta permite colaborarea edge-cloud: rulezi Needle 2 pe dispozitiv pentru majoritatea cererilor, iar cand modelul refuza (empty call), trimiti cererea in cloud catre un model mai mare. Economisesti latenta si bani pentru 90%+ din cereri, iar pentru restul primesti raspuns de la un model puternic.

Cum il incerci: playground in browser si rulare pe hardware real

Playground WebAssembly in browser

Cel mai rapid mod sa vezi ce poate Needle 2 e playground-ul oficial de pe cactuscompute.com/needle. Ruleaza direct in browser prin WebAssembly — nu instalezi nimic, nu descarci nimic. Deschizi pagina, scrii o cerere si vezi rezultatul.

E util pentru:

  • Testarea tool calling-ului cu functii customizate
  • Verificarea vitezei pe calculatorul tau (WebAssembly nu e la fel de rapid ca rularea nativa, dar da o idee)
  • Intelegerea formatului de input si output

Rulare pe Raspberry Pi

Daca ai un Raspberry Pi 5, procesul e direct:

  • Accesezi repo-ul cactus-compute/needle pe GitHub
  • Descarci weights-urile de pe Hugging Face (fisierul de 14 MB)
  • Pornesti motorul de inferenta (vine inclus in repo)
  • Definesti schema functiilor tale in JSON
  • Trimiti cereri si primesti apeluri de functii structurate

Nu ai nevoie de Python, nu ai nevoie de niciun framework. Motorul de inferenta e nativ, optimizat pentru ARM.

Rulare pe ESP32-S3

Pe ESP32-S3 — microcontrolerul de 5 dolari — Needle 2 merge, dar cu niste limite. Memoria disponibila e mica (512 KB SRAM + flash extern), asa ca trebuie sa optimizezi schema functiilor si sa tii contextul scurt. E ideal pentru taskuri simple: aprins/stins lumina, citit senzori, trimis comenzi catre un alt dispozitiv.

Daca vrei sa construiesti un proiect ESP32 cu AI, vezi ghidul nostru complet despre ESP32 si ce poti face cu el.

Gramatica la nivel de byte: de ce Needle 2 nu „halucineaza” formatul

Una dintre problemele modelelor AI e halucinarea de format — ceri JSON si primesti text liber, ceri o functie si primesti un eseu. Needle 2 rezolva asta prin gramatica la nivel de byte compilata din scheme declarative.

Ce inseamna asta concret? Cand definesti o schema de functie (de exemplu, set_light(room: string, state: string, brightness: int)), motorul compila aceasta schema intr-o gramatica care constrange fiecare token generat. Modelul nu are voie sa genereze un token care nu face parte din formatul valid.

E diferit de „speram ca modelul intelege formatul”. E o garantie structurala — ca si cand ai avea un template rigid in care modelul completeaza doar campurile permise. Asta face Needle 2 extrem de fiabil pentru automatizari unde formatul output-ului conteaza mai mult decat continutul „creativ”.

Ce inseamna Needle 2 pentru romani

Sa trecem la partea practica. De ce ar trebui sa-ti pese de un model AI de 14 MB daca esti in Romania?

Case smart ieftine, fara cloud

Daca ai senzori IoT acasa — termostat, lumini, prize smart, camere — majoritatea necesita cloud pentru automatizari inteligente. Asta inseamna ca datele tale (cand esti acasa, cand dormi, cat consumi) pleaca pe serverele cuiva.

Cu Needle 2 pe un Raspberry Pi de 80 de dolari poti:

  • Controla dispozitivele prin comenzi vocale locale („Aprinde lumina in dormitor”, „Seteaza termostatul la 22 de grade”)
  • Clasifica alerte de la senzori (miscare, temperatura, fum) fara internet
  • Automatiza rutine bazate pe context („Daca e ora 22 si lumina e aprinsa in sufragerie, stinge-o”)

Totul se intampla local. Nicio informatie nu pleaca de pe dispozitivul tau.

Privacy: datele raman la tine

Asta e poate cel mai important argument pentru romani — si nu doar pentru cei „paranoici” cu privacy-ul. Cand folosesti un serviciu cloud (Google Home, Amazon Alexa, Samsung SmartThings), toate comenzile tale trec prin serverele companiei. Stiu cand vii acasa, cand pleci, ce dispozitive folosesti, ce obiceiuri ai.

Cu Needle 2, datele raman pe dispozitiv. Nu exista un server care sa-ti inregistreze comenzile. Nu exista un profil de utilizator care sa te targeteze cu reclame. Nu exista riscul ca o brecha de securitate sa-ti explice rutina zilnica.

Vezi si articolul nostru despre Dreptul la inteligenta locala pentru mai multe context despre de ce AI-ul local conteaza.

Automatizari pentru micii antreprenori

Daca ai un magazin, un atelier sau o mica afacere, Needle 2 poate rula pe un calculator ieftin pentru:

  • Clasificarea automata a mesajelor primite (comanda, intrebare, reclamatie)
  • Extractia datelor din formulare simple (nume, adresa, produs)
  • Routing-ul cererilor catre departamentul potrivit

Nu ai nevoie de un abonament la un serviciu AI. Nu ai nevoie de conexiune la internet. Un Raspberry Pi de 80 de dolari si un fisier de 14 MB.

Comparatie cu alte modele AI locale

Daca vrei sa rulezi AI local pe un calculator normal, exista deja optiuni solide. Poti rula Qwen 3.6 27B pentru taskuri generale, sau Muse Glimmer de la Meta pentru agenti locali. Dar acestea necesita hardware serios — GPU cu cel putin 8 GB VRAM sau un Mac cu multa memorie.

Needle 2 e intr-o categorie diferita: ruleaza pe hardware care nu poate rula niciun alt model AI. Un ESP32 nu poate rula Qwen. Un telefon de 150 de dolari nu poate rula Muse Glimmer. Needle 2 poate.

Si daca vrei sa intelegi mai bine ecosistemul modelelor AI locale, vezi ghidul nostru despre cum rulezi AI local cu Ollama.

Ce nu poate face Needle 2

Ca sa fim corecti, Needle 2 are limite clare:

  • Nu e un chatbot — nu poti purta conversatii lungi cu el
  • Nu genereaza text creativ — nu scrie eseuri, povesti sau articole
  • Nu face reasoning complex — nu rezolva probleme de matematica sau logica avansata
  • Context limitat — datorita dimensiunii, nu poate procesa texte lungi
  • Nu inlocuieste modelele mari — pentru taskuri generale, un model de 7B+ e semnificativ mai capabil

Needle 2 e un instrument specializat. Nu e un ciocan elvetian — e un surubelnita de precizie. Daca ai nevoie de surubelnita, e perfect. Daca ai nevoie de ciocan, cauti altceva.

De ce Needle 2 nu inlocuieste ChatGPT sau Claude?

Needle 2 e specializat pe tool calling si extractie structurata. ChatGPT si Claude sunt modele generaliste care pot face conversatie, generare de text, coding, analiza si multe altele. Needle 2 nu incearca sa le concureze — e proiectat pentru taskuri specifice pe hardware pe care ChatGPT si Claude nu pot rula deloc. Un Raspberry Pi de 80$ nu poate rula Claude. Poate rula Needle 2.

Pot folosi Needle 2 pentru automatizari in casa?

Da, exact asta e unul dintre cazurile principale de utilizare. Il rulezi pe un Raspberry Pi, definesti functiile pentru dispozitivele tale (lumini, termostat, prize) si controlezi totul prin comenzi simple. Totul local, fara cloud, fara abonament. Viteza de 500+ tok/s pe Raspberry Pi 5 inseamna ca raspunsul e aproape instantaneu.

Cat costa sa rulezi Needle 2 acasa?

Hardware-ul minim e un Raspberry Pi 5 (~400-500 lei in Romania) sau chiar un ESP32-S3 (~25-30 lei). Fisierul modelului e gratuit (Apache 2.0). Nu exista abonament, nu exista costuri recurente. Platesti o data pentru hardware si rulezi cat vrei.

E sigur sa rulez un model AI pe un dispozitiv IoT?

Needle 2 are un avantaj de securitate fata de modelele cloud: datele nu pleaca de pe dispozitiv. Raspunsul se genereaza local, functiile se executa local. Riscurile sunt aceleasi ca pentru orice dispozitiv IoT — asigura-te ca reteaua ta e securizata si ca dispozitivele au firmware actualizat. Vezi ghidul nostru despre securitatea dispozitivelor IoT pentru detalii.

Functioneaza Needle 2 si offline?

Da, complet offline. Odata ce ai descarcat fisierul de 14 MB si l-ai pus pe dispozitiv, nu mai ai nevoie de internet. Motorul de inferenta ruleaza local, functiile se executa local. E ideal pentru locatii fara internet stabil sau pentru cei care nu vor sa depinda de conexiune.

Ce urmeaza: edge AI ca standard

Needle 2 marcheaza un moment important in evolutia AI-ului. Pana acum, „AI local” insemna sa rulezi un model de 7B+ pe un calculator cu GPU. Acum inseamna sa rulezi un model pe un cip de 5 dolari care incape in palma.

Argumentul Cactus Compute e convingator: 21 de miliarde de dispozitive IoT, 1,5 miliarde de PC-uri, 4 din 5 dispozitive edge sub 200 de dolari. Viitorul AI-ului nu e in cloud-uri uriase alimentate de GPU-uri de mii de dolari. E pe marginea retelei, pe dispozitive mici, ieftine, care proceseaza local si nu trimit date nicaieri.

Pentru romani, asta inseamna acces la inteligenta artificiala fara abonamente, fara cloud si fara compromisuri de intimitate. Un Raspberry Pi de 80 de dolari, un fisier de 14 MB si ai un asistent AI care iti controleaza casa, iti clasifica mesajele si iti automatizeaza rutinele. Totul se intampla la tine acasa, pe hardware-ul tau.

Daca vrei sa experimentezi, incepe cu playground-ul WebAssembly. Dupa ce vezi ce poate, treci pe un Raspberry Pi sau chiar pe un ESP32 si construieste ceva util. Codul e open-source, weights-urile sunt gratuite si comunitatea abia incepe sa creasca.

Distribuie articolul

Articole similare