Boti AI falsi iti scaneaza site-ul dupa chei API — cum te protejezi in 2026
Atacatorii se dau drept ClaudeBot, GPTBot si Googlebot ca sa gaseasca si sa fure cheile API ale uneltelor AI de programare. Cum verifici si cum te protejezi.
Table of Contents
- Ce este un bot web si de ce ar trebui sa-ti pese
- Campania de spoofing: ce s-a descoperit
- Ce cauta atacatorii: path-urile tintite
- Bot legitim vs bot fals: cum faci diferenta
- Ghid practic: cum iti securizezi site-ul
- Ce faci ca utilizator obisnuit de AI (fara site)
- Checklist de securizare
- Intrebari frecvente
In august 2026, o campanie de atac care parea science-fiction a devenit realitate: mii de site-uri web sunt scanate masiv de boti care se prefac ca sunt crawler-e AI legitimi — ClaudeBot, GPTBot, ChatGPT-User, Googlebot, PerplexityBot. Ce cauta? Chei API, credentiale, fisiere de configurare ale uneltelor de programare AI. Practic, atacatorii s-au imbracat in uniforma botilor pe care deja ii lasi in site si scotocesc prin folderele unde tii secretele.
Datele sunt de la raportul „The Agentic Web Index” publicat de Known Agents, care monitorizeaza traficul de pe peste 5.000 de site-uri. Povestea a ajuns pe prima pagina Hacker News pe 13 august 2026. Si nu e o problema teoretica — e una care te afecteaza fie ca ai un site, fie ca folosesti doar ChatGPT sau Claude acasa.
Atentie — amenintare activa
Ce vei gasi in acest articol:
- Ce sunt botii AI si de ce 35% din traficul web vine de la ei — explicat pe intelesul tuturor
- Cum functioneaza campania de spoofing — atacatorii se prefac ca sunt ClaudeBot, GPTBot si alti boti legitimi
- Path-urile exacte cautate de atacatori — de la
.envsi.claude/pana la.aws/credentials - Ghid practic de securizare — comenzi grep pentru loguri, blocare la nivel de Nginx/Apache/Cloudflare, verificare IP inversa
- Ce faci ca utilizator obisnuit de AI — cum iti protejezi cheile API locale si ce sa faci daca crezi ca ti-a fost furata o cheie
Ce este un bot web si de ce ar trebui sa-ti pese
Un bot (sau crawler) e un program care viziteaza automat site-uri web. Cand Google iti indexeaza pagina, trimite un bot. Cand Claude sau ChatGPT iti citesc continutul pentru a raspunde la intrebari, trimit si ei boti.
Fiecare bot se identifica printr-un user-agent — un sir de text pe care il trimite serverului tau ca sa spuna cine e. De exemplu, Googlebot trimite Googlebot/2.1, iar ClaudeBot trimite ClaudeBot/1.0. E ca si cum bati la usa si spui „Salut, sunt de la Google”.
Problema? Oricine poate minti. User-agent-ul e doar un text in header-ul HTTP. Poti sa te dai drept Googlebot in 30 de secunde cu o comanda simpla:
curl -H "User-Agent: Googlebot/2.1" https://site-ul-tau.ro/
Serverul tau nu stie daca esti intr-adevar Googlebot sau un atacator care poarta o masca. De asta companiile serioase (Google, Anthropic, OpenAI) folosesc verificare prin IP invers si Web Bot Auth — dar majoritatea site-urilor nu verifica deloc.
Si uite asa ajungem la situatia din august 2026.
Campania de spoofing: ce s-a descoperit
Known Agents, compania care publica „The Agentic Web Index”, monitorizeaza traficul web de pe peste 5.000 de site-uri. Raportul lor din august 2026 arata niste cifre care ar trebui sa te puna pe ganduri:
- 35% din tot traficul web vine de la boti, nu de la oameni
- 29% din traficul de boti e legat de AI — in crestere cu 11% fata de perioada anterioara
- Cea mai impersonata identitate: Googlebot (0,5% din tot traficul care pretinde ca e Googlebot e fals), urmat de ChatGPT-User, OAI-SearchBot, GPTBot, PerplexityBot si ClaudeBot (fiecare ~0,1%)
0,1% sau 0,5% pare putin? Gandeste-te ca vorbim de miliarde de cereri zilnice pe internet. Un 0,1% din tot traficul global inseamna milioane de cereri false pe zi care scaneaza site-uri sub masca unor boti AI legitimi.
Ce fac aceste cereri false? Intra pe site-ul tau si cer path-uri specifice — directoare si fisiere unde dezvoltatorii lasa, din greseala sau neatentie, chei API, credentiale de servicii cloud si configuratii sensibile. Nu cauta continutul tau. Nu le pasa de articolele tale. Vor secretele.
Cum definim „spoofed”
In contextul acestui raport, o vizita e considerata „spoofed” atunci cand pretinde o identitate de bot recunoscuta (de exemplu, spune ca e ClaudeBot) dar nu trece metoda de autentificare a acelui bot — adica IP-ul nu corespunde listei oficiale sau nu prezinta un token Web Bot Auth valid.
E exact ca si cum cineva ar veni la usa ta cu legitimatia de la Google, dar cand verifici la sediul Google, zic ca nu-l cunosc.
Sursa datelor
Ce cauta atacatorii: path-urile tintite
Asta e partea care ar trebui sa sperie orice dezvoltator sau oricine are un server. Atacatorii nu cauta pagini normale — cauta fisiere de configurare si credentiale lasate din neatentie in webroot. Iata exemple reale din raportul Known Agents:
Configurari ale uneltelor AI de programare:
/.config/anthropic/credentials/default.json/.claude/settings.json/.claude.json/.hermes/.env/.openclaw/.env/.codex/config.toml/.continue/config.json/.aider.conf.yml
Chei si credentiale generale:
/service-account.json/firebase-adminsdk.json/.aws/credentials/.aws/config/.s3cfg/.npmrc/credentials.json/secrets.json/secrets.yml/key.json/rclone.conf
Fisiere de mediu (.env):
/.env.local/.env.production/.env.backup/.env.old/backend/.env/api/.env/admin/.env
Configurari DevOps:
/dockerfile/docker-compose.yaml/.docker/config.json/terraform.tfstate
Vezi pattern-ul? Fisiere care contin chei API, parole, token-uri de acces, configurari de cloud. Daca unul din aceste fisiere e accesibil pe web, un atacator poate prelua controlul contului tau de cloud, poate accesa baze de date, poate genera costuri uriase in numele tau.
Si daca folosesti atacul supply chain din npm Shai-Hulud ca referinta — stii deja ca o cheie API furata poate duce la compromiterea a sute de pachete. Acum gandeste-te ca aceleasi chei sunt cautate activ pe web.
Bot legitim vs bot fals: cum faci diferenta
Uite un tabel comparativ ca sa intelegi exact diferentele:
| Caracteristica | Bot AI legitim | Bot AI fals (spoofed) |
|---|---|---|
| User-agent | Nume real (ex: ClaudeBot, GPTBot) | Acelasi nume — minte |
| IP verificabil | Da — corespunde listei oficiale a companiei | Nu — IP-ul nu e in lista oficiala |
| Respecta robots.txt | Da, in 98,5% din cazuri | Nu — ignora complet robots.txt |
| Ce path-uri cere | Continut public (pagini, articole) | Fisiere ascunse (.env, .claude/, .aws/) |
| Rate limit | Respecta limitele rezonabile | Cereri rapide, agresive, in bulk |
| Web Bot Auth | Prezinta token valid | Nu are token sau are unul fals |
| Comportament | Citeste continutul site-ului | Scaneaza directoare ascunse, ignora continutul |
Diferenta cheie: botii legitimi vin sa-ti citeasca continutul, botii falsi vin sa-ti fure secretele. Un Googlebot real vrea sa indexeze articolul tau despre retete. Un bot fals care se da drept Googlebot vrea sa gaseasca /.aws/credentials in root-ul site-ului tau.
Cei mai mari scrapere AI reale
Ca sa intelegi contextul, iata cine sunt botii AI reali care scaneaza internetul:
- ClaudeBot (Anthropic) — 27% din traficul de scraping AI
- meta-externalagent (Meta) — 19,3%
- Amazonbot (Amazon) — 19,1%
- GPTBot (OpenAI) — 9,5%
- Bytespider (ByteDance) — 7,3%
La fetching in timp real (cand utilizatorul pune o intrebare si AI-ul acceseaza un link), distributia e diferita:
- ChatGPT-User — 86,1% din trafic
- DuckAssistBot — 3,2%
- Perplexity-User — 2,9%
- Claude-User — 2,7%
Botii reali respecta robots.txt in proportie de 98,5%. Scraperele AI de date respecta in proportie de 97,4%. Dar atacatorii care se prefac a fi boti AI il ignora complet. De asta robots.txt nu e o masura de securitate — e doar o rugaminte.
Daca vrei sa intelegi mai bine cum functioneaza atacurile prin AI, vezi articolul despre ce este prompt injection si cum te protejezi.
Ghid practic: cum iti securizezi site-ul
Daca ai un site, un server sau o aplicatie web, aici pasii concreti ca sa te protejezi.
1. Verifica logurile tale
Primul lucru: afla daca esti deja scanat. Deschide access.log-ul si cauta path-urile tintite de atacatori:
# Cauta cereri catre fisiere .env
grep -i '\.env' /var/log/nginx/access.log | tail -50
# Cauta cereri catre configurari Claude/AI
grep -iE '\.(claude|hermes|openclaw|codex|aider|continue)' /var/log/nginx/access.log | tail -50
# Cauta cereri catre credentiale AWS
grep -iE '\.(aws|s3cfg|npmrc)' /var/log/nginx/access.log | tail -50
# Cauta cereri catre fisiere de secrete
grep -iE '(secrets|credentials|service-account|firebase-adminsdk|terraform)' /var/log/nginx/access.log | tail -50
# Vezi care user-agents cer aceste path-uri
grep -iE '\.(env|claude|aws|credentials)' /var/log/nginx/access.log | awk -F'"' '{print $6}' | sort | uniq -c | sort -rn
Daca vezi cereri de la „ClaudeBot” sau „GPTBot” catre /.claude/settings.json sau /.env.local, inseamna ca site-ul tau e deja in vizorul campaniei.
2. Verificare IP inversa pentru Googlebot
Google publica lista oficiala de IP-uri pentru Googlebot. Daca un bot pretinde ca e Googlebot, poti verifica:
# Verifica daca IP-ul apartine intr-adevar Google
host 66.249.66.1
# Reverse DNS trebuie sa returneze ceva de genul:
# 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com.
# Daca nu returneaza *.googlebot.com, e fals
Pentru ceilalti boti AI (ClaudeBot, GPTBot, PerplexityBot), verifica documentatia oficiala a fiecaruia — majoritatea publica listele de IP-uri. Daca IP-ul nu e in lista, cererea e falsa.
3. Blocheaza accesul la fisiere sensibile
Nginx — adauga in configuratia site-ului:
# Blocheaza accesul la fisiere ascunse si configurari
location ~ /\. {
deny all;
return 404;
}
location ~* \.(env|env\..*|json|yml|yaml|toml|cfg|conf|key|pem)$ {
# Permite doar fisierele JSON necesare pentru aplicatie
# Blocheaza tot restul
deny all;
return 404;
}
# Blocheaza path-urile specifice tintite de atacatori
location ~* (credentials|secrets|service-account|firebase-adminsdk|terraform|rclone) {
deny all;
return 404;
}
Apache — adauga in .htaccess:
# Blocheaza fisierele ascunse
<FilesMatch "^\.">
Require all denied
</FilesMatch>
# Blocheaza fisierele .env
<FilesMatch "\.env(\..*)?$">
Require all denied
</FilesMatch>
# Blocheaza fisierele de configurare
<FilesMatch "\.(json|yml|yaml|toml|cfg|key|pem)$">
Require all denied
</FilesMatch>
Cloudflare — daca folosesti Cloudflare, poti crea un WAF rule:
- Rule 1: Block —
http.request.uri.path contains "/.env"→ Block - Rule 2: Block —
http.request.uri.path contains "/.claude"→ Block - Rule 3: Block —
http.request.uri.path contains "/.aws"→ Block - Rule 4: Challenge — User-Agent contains „Bot” + URI contains „config” sau „credentials”
Daca folosesti Cloudflare si vrei sa blochezi complet crawlerele AI, vezi articolul despre cum Cloudflare blocheaza crawler-ele Google AI.
4. Nu pune niciodata .env sau .claude/ in webroot
Asta pare evident, dar raportul arata ca mii de site-uri fac exact asta. Reguli simple:
- Document root-ul (unde pui fisierele accesibile pe web) trebuie sa contina doar
index.html, CSS, JS si imagini. Atat. .env,.claude/,.aws/,docker-compose.yaml,terraform.tfstate— toate astea trebuie sa fie in afara document root-ului sau blocate prin regulile de server de mai sus.- Daca folosesti un framework (Laravel, Next.js, Django), asigura-te ca doar directorul
public/saustatic/e accesibil pe web.
5. Verifica permisiunile fisierelor
# Verifica permisiunile fisierelor sensibile
ls -la .env .claude/ .aws/ 2>/dev/null
# .env ar trebui sa fie 600 (doar owner-ul citeste)
chmod 600 .env
# Directoarele cu configurari ar trebui sa fie 700
chmod 700 .claude/ .aws/
6. Roteste cheile compromise
Daca ai gasit in loguri ca cineva a accesat fisiere cu chei API:
- Schimba imediat toate cheile — nu le doar dezactiveaza, genereaza altele noi
- Verifica in cloud console (AWS, GCP, Azure) daca au fost folosite cheile — cauta activitate neobisnuita
- Verifica billing-ul — atacatorii folosesc cheile furate pentru minat crypto sau alte activitati care genereaza costuri
- Activeaza MFA pe toate conturile de cloud
- Verifica daca cheile au fost publicate pe GitHub, paste-uri sau forumuri — cauta-le cu Google dorks
Daca ai nevoie de un manager de parole pentru a tine toate cheile organizate si criptate, vezi ghidul despre cum alegi un manager de parole in 2026.
Ce faci ca utilizator obisnuit de AI (fara site)
Nu ai un site? Asta nu inseamna ca nu esti afectat. Daca folosesti Claude Code, Cursor, Codex, Aider sau orice alta unealta AI de programare, cheile tale API pot fi expuse.
Cum iti protejezi cheile API locale
Regula de aur: nu urca niciodata .env pe GitHub.
# Verifica daca ai .env in repo-ul tau
git ls-files | grep -i '\.env'
# Daca apare, scoate-l imediat
git rm --cached .env
echo ".env" >> .gitignore
echo ".env.local" >> .gitignore
echo ".env.*" >> .gitignore
git commit -m "Remove .env from tracking"
Verifica daca cheile tale sunt deja expuse:
# Cauta chei API in codul tau
grep -rn "sk-\|OPENAI_API_KEY\|ANTHROPIC_API_KEY\|AIza" . --include="*.{js,ts,py,json,yaml,yml,env}" 2>/dev/null
# Verifica istoricul Git (chiar si fisiere sterse apar in istoric)
git log --all --full-history -p -- '*.env' '*credentials*' '*secrets*'
Seteaza permisiuni corecte pe configurarile locale:
# Configurarile Claude
chmod 600 ~/.claude.json
chmod 700 ~/.claude/
# Configurarile altor unelte AI
chmod 600 ~/.config/anthropic/credentials/default.json 2>/dev/null
chmod 600 ~/.config/codex/config.toml 2>/dev/null
Ce faci daca crezi ca ti-a fost furata o cheie API
- Schimba cheia imediat — in dashboard-ul furnizorului (OpenAI, Anthropic, Google etc.), dezactiveaza cheia veche si genereaza una noua
- Verifica utilizarea — in dashboard, uita-te la istoricul de cereri. Vezi cereri din locatii sau la ore la care nu ai folosit tu serviciul?
- Verifica costurile — daca ai un plan cu plata, uita-te la billing. Costuri neobisnuit de mari = semn ca cheia a fost folosita de altcineva
- Nu folosi aceeasi cheie peste tot — o cheie pentru dezvoltare, alta pentru productie, alta pentru experimente
- Seteaza limite de cheltuieli — majoritatea furnizorilor AI permit setarea unui monthly budget. Activeaza-l.
Checklist de securizare
- Verifica logurile de acces pentru path-urile tintite (
.env,.claude/,.aws/) - Blocheaza accesul la fisiere ascunse prin Nginx/Apache/Cloudflare
- Mută fisierele de configurare in afara document root-ului
- Verifica permisiunile fisierelor (.env = 600, directoare = 700)
- Verifica IP-ul botilor care cer fisiere sensibile (reverse DNS)
- Confirma ca
.envsi cheile API nu sunt in repo-ul Git - Roteste toate cheile API daca au fost accesate de boti necunoscuti
- Activeaza MFA pe conturile de cloud (AWS, GCP, Azure)
- Seteaza limite de costuri pe conturile de API AI
- Verifica billing-ul pentru activitate neobisnuita
Intrebari frecvente
De ce nu ma protejeaza robots.txt?
Robots.txt e o rugaminte, nu o masura de securitate. Spune botilor „te rog nu intra pe aceste pagini”, dar nu-i opreste tehnic pe nimeni. Raportul Known Agents arata ca botii legitimi il respecta in 98,5% din cazuri, dar atacatorii care se prefac a fi boti AI il ignora complet. E ca si cum ai pune un semn „Nu intrati” pe usa, fara sa incui usa. Robots.txt e util pentru SEO si pentru a directiona botii buni, dar nu e un inlocuitor pentru blocarea reala la nivel de server.
Cum imi dau seama daca un bot care imi viziteaza site-ul e real sau fals?
Verifica IP-ul. Fiecare companie AI (Google, Anthropic, OpenAI, Perplexity) publica lista oficiala de IP-uri de pe care vin botii lor. Daca un bot pretinde ca e ClaudeBot, dar IP-ul nu e in lista Anthropic, e fals. Poti face verificarea cu comanda host <IP> (reverse DNS) sau poti folosi scripturi automate care compara IP-ul vizitatorului cu listele oficiale. Mai simplu: daca un „bot” cauta /.env sau /.claude/, e 100% fals — botii reali nu cauta aceste fisiere.
Am un site mic, de ce m-ar targeta pe mine?
Atacatorii nu cauta site-uri mari. Scaneaza tot internetul automat, la gramada. Ei nu stiu ce site ai — doar trimit cereri catre milioane de adrese IP si vad cine raspunde. Daca raspunzi si ai un fisier .env accesibil, l-au gasit. Nu e atac tintit, e atac in masa. Exact cum functioneaza si atacul supply chain din npm Shai-Hulud — nu conteaza dimensiunea tinte, conteaza expunerea.
Folosesc doar ChatGPT si Claude pe calculator, sunt in pericol?
Nu direct de la aceasta campanie (care tintește site-uri web), dar indirect da. Daca ai un fisier ~/.claude.json sau un ~/.config/anthropic/credentials/ cu cheia API si acel fisier e accesibil printr-un server local sau printr-un port deschis, poate fi accesat. Mai important: daca lucrezi la un proiect si urci codul pe GitHub cu .env inclus, cheia ta API devine publica si poate fi gasita de boti in cateva minute. Regula simpla: verifica ce pui in .gitignore si nu lasa chei API in codul sursa.
Ce e Web Bot Auth si de ce nu e peste tot?
Web Bot Auth e un standard nou prin care botii legitimi pot dovedi ca sunt cine spun ca sunt, printr-un token criptografic verificabil. Gandeste-l ca un buletin digital pentru boti. Problema: e inca in stadiu timpuriu, putine companii il implementeaza, si nu toti botii il folosesc. Deocamdata, verificarea prin IP invers (reverse DNS) ramane metoda principala. E similar cu ce este prompt injection — problema exista, solutiile sunt in curs de adoptare, dar intre timp trebuie sa te protejezi tu activ.
Concluzie: Internetul din 2026 e plin de boti, si nu toti sunt cine spun ca sunt. Campania de spoofing descoperita de Known Agents e un semnal de alarma: daca ai un site sau folosesti unelte AI de programare, verifica-ti acum logurile, securizeaza-ti fisierele de configurare si nu lasa cheile API la vedere. Un grep in access.log dureaza 10 secunde si poate salva mii de lei in costuri de cloud compromise.