Tech si AI admin

Inkling — noul model AI open-source de la Thinking Machines Lab: tot ce trebuie să știi în 2026

Inkling este primul model AI cu ponderi open-source de la Thinking Machines Lab, compania fondată de Mira Murati. 975 miliarde parametri, licență Apache 2.0, multimodal — iată cum îl folosești.

Inkling — noul model AI open-source de la Thinking Machines Lab: tot ce trebuie să știi în 2026

Pe 15 iulie 2026, Thinking Machines Lab — compania fondată de Mira Murati, fostul CTO al OpenAI — a lansat Inkling, primul lor model AI cu ponderi complet open-source. Nu e doar un alt model pe listă. Inkling vine cu 975 de miliarde de parametri, arhitectură Mixture-of-Experts, suport multimodal (text, imagini, audio) și o licență Apache 2.0 care permite inclusiv folosirea comercială.

Dacă ești dezvoltator, cercetător sau pur și simplu curios de AI, acest articol îți explică ce este Inkling, cum funcționează, cum se compară cu alte modele open-source și — cel mai important — cum îl poți folosi chiar acum, gratuit sau la costuri reduse.

Ce vei gasi in acest articol

  • Ce este Inkling și de ce contează că vine de la compania Mirai Murati
  • Explicația arhitecturii MoE (Mixture-of-Experts) pe înțelesul tuturor
  • Benchmark-uri comparative cu GPT-5.6 Sol, Claude, DeepSeek și alții
  • Ghid practic: cum accesezi Inkling gratuit (API, playground, download local)
  • Ce este Inkling-Small și când să o folosești
  • Demos notabile și capabilități de fine-tuning

Cine este Thinking Machines Lab și de ce contează

Thinking Machines Lab nu e un startup oarecare. Compania a fost fondată de Mira Murati, care a fost CTO la OpenAI din 2018 până în 2024 — perioada în care OpenAI a lansat GPT-3, GPT-4 și ChatGPT. Murati a condus practic dezvoltarea tehnică a celor mai influente modele AI din istorie.

Când o persoană cu acest background deschide propria companie și primul produs este un model open-source, semnalul e clar: piața AI se schimbă. Nu mai e doar despre modele proprietare accesate prin API-uri scumpe. Inkling este un pariu pe ideea că cele mai bune modele ar trebui să fie accesibile oricui vrea să le folosească, să le studieze sau să le adapteze.

Ce este Inkling — arhitectura explicată simplu

Mixture-of-Experts (MoE) — ce înseamnă asta

Înainte să intrăm în cifre, hai să explicăm arhitectura. Inkling folosește Mixture-of-Experts (MoE), o abordare care a devenit standardul modelelor mari din 2024-2026.

Gândește-te la MoE ca la un spital cu mai mulți medici specialiști. Când vii cu o problemă, nu te consultă toți doctorii deodată — un „router” te trimite la 2-3 specialiști potriviți pentru problema ta specifică. Restul stau și așteaptă alți pacienți.

Asta face și Inkling: are 256 de experți în rețea, dar pentru fiecare token (bucată de text) procesat, doar 6 experți sunt activați. Plus 2 experți „partajați” care ajută la fiecare pas. Rezultatul? Ai puterea unui model de 975 de miliarde de parametri, dar costul computațional al unuia de doar 41 de miliarde de parametri activi per token.

Pe scurt

Inkling are 975 miliarde de parametri în total, dar folosește doar 41 miliarde per token. E ca și cum ai avea o bibliotecă imensă, dar citești doar cărțile relevante pentru subiectul curent — nu toate deodată.

Specificații tehnice complete

SpecificațieInklingInkling-Small
Parametri totali975 miliarde276 miliarde
Parametri activi per token41 miliarde12 miliarde
Experți rutati256
Experți activi per token6 + 2 partajați
Fereastră de context1 milion tokeni
Date de antrenament45 trilioane tokeni (text, imagini, audio, video)
RL rollouts30+ milioane
LicențăApache 2.0Apache 2.0

Suport multimodal — fără encoder separat

Inkling procesează text, imagini și audio în aceeași arhitectură, fără encodere separate pentru fiecare mod. Asta e o diferență importantă față de modelele mai vechi care aveau componente separate pentru viziune și audio.

  • Audio: folosește spectrograme dMel — transformă undele sonore în reprezentări vizuale pe care modelul le procesează direct
  • Viziune: patch-uri de 40x40 pixeli cu un hMLP pe 4 straturi — practic „vede” imaginile ca un puzzle de bucăți mici

Thinking effort controlabil

Una dintre cele mai interesante funcții este controlul efortului de gândire. Poți seta un parametru de la 0.2 la 0.99 care controlează cât de mult „gândește” modelul înainte să răspundă.

  • La 0.2: răspuns rapid, superficial, potrivit pentru întrebari simple
  • La 0.99: gândire profundă, analiză complexă, potrivit pentru probleme dificile

Ce e remarcabil: Inkling folosește o treime din tokeni comparativ cu Nemotron 3 Ultra pentru aceeași performanță pe Terminal Bench. Asta înseamnă costuri mai mici și latență mai mică.

Benchmark-uri — cum se compară Inkling cu alte modele

Inkling nu este cel mai puternic model disponibil pe piață. Și asta e ok — nu a fost conceput pentru asta. A fost conceput ca o bază open-source solidă pe care poți construi, customiza și fine-tuna. Dar asta nu înseamnă că performanțele sunt slabe. Dimpotrivă.

BenchmarkInklingGPT-5.6 SolClaude Fable 5DeepSeek V4 ProGemini 3.1 Pro
AIME 2026 (matematică)97.1%
GPQA Diamond (știință)87.2%
SWE-Bench Verified (coding)77.6%
MMMU Pro (viziune)73.5%
VoiceBench (audio)91.4%
FORTRESS Adversarial (siguranță)78.0%
StrongREJECT (siguranță)98.6%
ForecastBench (fără search)61.161.1
Design Arena (web dev)12571260

Câteva observații

  • ForecastBench: Inkling este la egalitate cu Gemini 3.1 Pro la predicții fără search — un scor foarte bun
  • Design Arena: 1257 puncte, competitiv cu Claude Opus 4.6 (1257) și GPT-5.6 Sol (1260)
  • StrongREJECT: 98.6% — modelul rezistă bine la încercări de manipulare

Inkling-Small — varianta mai mică și mai ieftină

Pe lângă modelul mare, Thinking Machines Lab a lansat și Inkling-Small — o variantă cu 276 miliarde parametri totali și 12 miliarde activi. Momentan este disponibilă ca preview, iar ponderile complete vor fi lansate în curând.

Când să folosești Inkling-Small în loc de Inkling:

  • Coding: generare și review de cod, unde viteza contează mai mult decât profunzimea
  • Grading: evaluare automată de texte, teme, răspunsuri
  • Date sintetice: generare de date pentru antrenarea altor modele
  • Costuri reduse: când bugetul e limitat și nu ai nevoie de capacitățile complete

Epistemics și siguranță — cum gestionează Inkling incertitudinea

Un aspect adesea ignorat la modelele AI este calibrarea — capacitatea modelului de a ști când nu știe ceva. Multe modele „confabulează” (inventează răspunsuri cu încredere) în loc să spună „nu știu”.

Inkling a fost antrenat specific pentru:

  • Calibrare: modelul estimează corect cât de sigur este pe răspunsul său
  • Instruction following: urmează instrucțiunile precise, nu o ia pe arătură
  • Rezistență la cenzură: nu refuză răspunsuri legitime fără motiv

Pentru reducerea halucinațiilor, Inkling folosește:

  • Rubric grader: evaluează răspunsurile pe criterii specifice
  • Claims grader: verifică fiecare afirmație factuală separat

Practic, modelul poate spune „nu știu” în loc să confabuleze. Asta e crucial pentru aplicații unde acuratețea contează — medicină, drept, finanțe.

Demos notabile — ce poate face Inkling

Thinking Machines Lab a demonstrat câteva capabilități impresionante la lansare:

Self-fine-tuning

Cel mai spectaculos demo: Inkling și-a scris propriul job de fine-tuning pe platforma Tinker, l-a rulat, și-a evaluat rezultatele, și-a încărcat noile ponderi — totul autonom. Demonstrarea a fost un „lipogram” (text fără litera „e”), iar modelul a învățat singur această constrângere.

Aplicație web completă dintr-un singur prompt

Inkling a construit o aplicație web funcțională de la un singur prompt. Fără scaffolding, fără template-uri — direct cod complet, gata de rulare.

Joc multiplayer snake prin iterare

A creat un joc multiplayer snake prin 40 de iterări de feedback — practic a scris codul, l-a testat, a identificat problemele și le-a corectat, totul în buclă.

PDF de 9 pagini stil revistă de călătorie

A generat un document PDF de 9 pagini cu layout de revistă de călătorie — cu imagini, text formatat și design profesional.

Cum accesezi Inkling — ghid practic

Inkling este disponibil prin mai multe canale, de la gratuit la costuri reduse.

Gratuit — Inkling Playground

Inkling Playground oferă chat gratuit cu web search, pentru timp limitat. E cel mai simplu mod de a testa modelul fără să configurezi nimic.

Platforma Tinker — fine-tuning cu reducere

Tinker este platforma de fine-tuning de la Thinking Machines Lab. Momentan oferă o reducere de 50% pentru timp limitat. Poți folosi context de 64K sau 256K tokeni.

Fine-tuning înseamnă că poți adapta Inkling pentru task-ul tău specific — de exemplu, să-l înveți terminologia companiei tale, să-l specializezi pe un domeniu anume, sau să-l faci să răspundă într-un anumit stil.

API-uri disponibile

Inkling este disponibil prin mai mulți furnizori API:

  • TogetherAI
  • Fireworks
  • Modal
  • Databricks
  • Baseten

Download local — ponderi pe Hugging Face

Ponderile complete sunt disponibile pe Hugging Face în două variante:

  • Checkpoint original: ponderile complete, așa cum au fost antrenate
  • NVFP4: varianta optimizată pentru GPU-urile NVIDIA Blackwell (seria RTX 50/B200)

Modelul NU este gated — oricine poate downloada fără cerere specială. Asta e o diferență majoră față de modele precum Llama de la Meta, care necesită aprobare.

Inferență open-source

Pentru a rula Inkling local sau pe server propriu, poți folosi:

  • SGLang
  • vLLM
  • Miles
  • TokenSpeed
  • Unsloth (llama.cpp)
  • Hugging Face transformers

Cum rulezi Inkling pe calculatorul tău

Dacă vrei să rulezi Inkling local, trebuie să știi că modelul mare (975 miliarde parametri) necesită hardware serios — cel puțin 4-8 GPU-uri cu memorie mare. Nu e ceva ce rulezi pe un laptop obișnuit.

Dar Inkling-Small (276 miliarde parametri, 12 miliarde activi) ar putea fi fezabil pe hardware consumer cu optimizări de cuantizare. Dacă ești interesat de AI local, vezi ghidul nostru despre cum rulezi AI local cu Ollama pentru fundamente.

Pentru context, află mai multe despre dreptul la inteligență locală — de ce e important să poți rula modele AI pe propriul hardware, fără să depinzi de cloud.

Inkling vs alte modele open-source — comparație directă

Modelele AI mici vs cele mari — unde se încadrează Inkling

Inkling este un model mare — 975 miliarde de parametri totali. Nu e genul de model pe care îl rulezi pe laptop seara ca hobby. E gândit pentru:

  • Companii care vor să integreze AI de top fără să depindă de OpenAI sau Anthropic
  • Cercetători care vor să studieze și să îmbunătățească modele de frontieră
  • Dezvoltatori care fac fine-tuning pentru cazuri de utilizare specifice

Dar e important de înțeles că modelele AI mici ajung la nivelul celor mari în multe scenarii. Nu ai nevoie întotdeauna de 975 de miliarde de parametri. Pentru multe task-uri, un model de 7-27 de miliarde de parametri e suficient.

Ce înseamnă Inkling pentru ecosistemul AI

Lansarea Inkling este un semnal important pentru direcția în care se îndreaptă piața AI:

Open-source câștigă teren

Tot mai multe companii de top aleg să-și lanseze modelele cu ponderi deschise. Am văzut asta cu Apertus din Elveția, cu modelul Portugaliei, și acum cu Inkling de la o companie condusă de fostul CTO al OpenAI.

Fine-tuning devine accesibil

Platforma Tinker face fine-tuning-ul mai ușor ca niciodată. Nu mai trebuie să fii expert în ML ca să adaptezi un model mare pentru nevoile tale. Reducerea de 50% face și costul mai digerabil.

Multimodal devine standard

Inkling procesează text, imagini și audio în aceeași arhitectură, fără componente separate. Asta devine norma — modelele care procesează doar text sunt din ce în ce mai limitate.

Limitări de reținut

  • Inkling nu este cel mai puternic model disponibil — modelele proprietare de top (GPT-5.6 Sol, Claude Fable 5) pot fi mai performante pe anumite task-uri
  • Rulearea locală necesită hardware semnificativ pentru modelul mare
  • Inkling-Small este încă în preview — ponderile complete nu sunt disponibile încă
  • Suportul pentru limba română nu a fost testat specific în benchmark-uri

Checklist: cum să începi cu Inkling

  • Accesează Inkling Playground pentru chat gratuit cu web search (timp limitat)
  • Dacă ai nevoie de fine-tuning, creează cont pe Tinker cu reducerea de 50%
  • Pentru API, alege un furnizor (TogetherAI, Fireworks, Modal, Databricks, Baseten)
  • Pentru download local, descarcă de pe Hugging Face (checkpoint original sau NVFP4 pentru Blackwell)
  • Pentru inferență open-source, folosește SGLang, vLLM sau Unsloth
  • Pentru workload-uri cu buget limitat, încearcă Inkling-Small (preview)

Întrebări frecvente

Inkling este gratuit?

Da, ponderile sunt disponibile gratuit sub licență Apache 2.0. Poți să le descarci de pe Hugging Face și să le rulezi pe hardware propriu. De asemenea, Inkling Playground oferă chat gratuit pentru timp limitat. Dacă vrei să folosești API-ul prin furnizori terți (TogetherAI, Fireworks etc.), aceștia percep taxe per token procesat.

Pot folosi Inkling în scopuri comerciale?

Da. Licența Apache 2.0 permite inclusiv folosirea comercială. Poți integra Inkling în produsele tale, poți oferi servicii bazate pe el, și poți distribui modelele fine-tunate tot sub Apache 2.0. Asta e o diferență majoră față de modele precum Llama de la Meta, care au restricții comerciale.

Cât hardware am nevoie pentru a rula Inkling local?

Pentru modelul mare (975 miliarde parametri): cel puțin 4-8 GPU-uri cu memorie mare (ex: 4x A100 80GB sau echivalent). Nu rulează pe hardware consumer obișnuit. Pentru Inkling-Small (276 miliarde parametri, 12 miliarde activi): ar putea fi fezabil cu optimizări de cuantizare pe hardware mai modest, dar încă necesită GPU dedicat. Dacă vrei AI local pe hardware consumer, modele precum Qwen 3.6 27B sunt mai realiste.

Ce este fine-tuning și de ce aș face asta?

Fine-tuning înseamnă să iei un model AI deja antrenat și să-l adaptezi pentru un task specific. De exemplu: să-l înveți terminologia companiei tale, să-l specializezi pe domeniul tău (medical, juridic, tehnic), sau să-l faci să răspundă într-un anumit stil. Platforma Tinker de la Thinking Machines Lab face asta mai ușor — practic îi dai exemple de cum vrei să răspundă și modelul învață. Reducerea de 50% face costul mai accesibil.

Inkling este mai bun decât ChatGPT?

Depinde de ce „mai bun” înseamnă pentru tine. GPT-5.6 Sol (modelul de top de la OpenAI) este probabil mai performant pe anumite task-uri complexe. Dar Inkling are avantaje clare: este open-source (îl poți rula local, inspecta, modifica), are licență Apache 2.0 (poți folosi comercial), are context de 1 milion de tokeni, și e multimodal nativ. Dacă vrei control total asupra AI-ului tău, Inkling e alegerea superioară.

Ce poți face mai departe

Inkling este un instrument puternic, dar depinde de tine cum îl folosești. Dacă vrei să experimentezi cu AI local, începe cu ghidul despre cum rulezi AI local cu Ollama. Dacă ești interesat de modele mai mici care rulează pe hardware obișnuit, vezi articolul despre modele AI mici la nivelul celor mari.

Pentru viteza maximă la inferență, află despre Groq — cel mai rapid AI gratuit. Iar dacă vrei să înțelegi de ce accesul la modelele AI devine din ce mai restricționat, citește despre cortina de siliciu a Chinei.

Pentru cei care vor să ruleze AI distribuit pe mai multe calculatoare, ghidul despre Mesh LLM explică cum poți pune la lucru mai multe mașini pentru un singur model. Și dacă vrei să vezi unde a ajuns open-source-ul la scară maximă, Kimi K3 de la Moonshot AI e primul model open-source cu 2.8 trilioane de parametri — clasa 3T.


Disclaimer

Acest articol este informativ și reflectă starea Inkling la data lansării (15 iulie 2026). Specificațiile, benchmark-urile și disponibilitatea se pot schimba. Informațiile au fost verificate din surse oficiale (Thinking Machines Lab, Hugging Face). Pentru cele mai recente date, consultă site-ul oficial al Thinking Machines Lab.

Distribuie articolul

Articole similare