Articol Marketing

Indexare Google - cum trimit URL la indexare și verific statusul

Flat illustration navy si amber - laptop cu Google Search Console afisand Coverage report si grafic de URL-uri indexate

Indexarea în Google este pragul minim peste care nimic altceva din SEO nu contează. Poți avea content excelent, structură semantică perfectă, schema.org validată și backlink-uri de la Wikipedia, dar dacă URL-ul nu apare în indexul Google, traficul organic rămâne zero. În cei 14 ani de SEO la agenții și in-house, primul lucru pe care îl verific la orice audit nou este coverage report-ul din Search Console. Aproape 30% din site-urile IMM auditate au între 15% și 40% URL-uri valide care nu sunt indexate, iar majoritatea proprietarilor nu știu asta.

Acest ghid acoperă metodele oficiale prin care influențezi indexarea (URL Inspection, sitemap.xml, robots.txt, meta robots, IndexNow), cum interpretezi statusurile din Coverage report și cum construiești un workflow de debugging când Google refuză să indexeze pagini valide. Dacă pornești de la zero cu un site nou, citește mai întâi schema markup pentru firme mici și strategii de backlink pentru site mic - structura semantică plus autoritatea de domain sunt premise pentru indexare rapidă.

Crawling vs indexare - două etape distincte

Confuzia clasică: a fi crawled nu înseamnă a fi indexed. Googlebot trece prin trei etape independente.

Discovery - Google află că URL-ul există (prin sitemap, link intern, link extern, redirect sau cerere manuală prin URL Inspection).

Crawling - Googlebot descarcă conținutul URL-ului (HTML, CSS, JS) și îl trimite la rendering. Pentru pagini cu JS heavy, crawling-ul are două faze: HTML inițial, apoi rendering complet după resurse.

Indexing - sistemul Google decide dacă pagina merită stocată în index. Aici intervin semnalele de calitate: content unic, EEAT, structură semantică, valoare comparativ cu URL-uri concurente pe aceeași intenție.

Data: în studiul intern 2025 pe 47 site-uri IMM trackate 18 luni, raportul mediu între URL-uri crawled și URL-uri indexed a fost 78%. Diferența de 22% reprezintă pagini pe care Google le-a văzut și a decis activ să nu le indexeze. Cauzele top: thin content (sub 300 cuvinte unice, 41%), duplicate content (variante de URL cu parametri, 23%), low quality signals (lipsa internal links, 18%), canonical conflict (12%) și restul cauze tehnice.

Cum trimit un URL nou la indexare

Pentru URL-uri noi sau pagini cu modificări majore, metoda oficială este URL Inspection tool din Google Search Console.

Workflow concret în 5 pași:

  1. Deschide Search Console și selectează proprietatea (Domain property recomandat peste URL-prefix).
  2. Lipește URL-ul complet în bara de inspecție din partea de sus.
  3. Așteaptă 15-45 secunde - GSC interoghează indexul live.
  4. Verifică statusul: "URL is on Google" (deja indexat) sau "URL is not on Google" (necesită cerere).
  5. Apasă "Request Indexing" - Google adaugă URL-ul în coada prioritară de crawling.

Quota practică: oficial Google nu publică o limită, dar testarea reală arată 10-20 cereri pe zi pe proprietate înainte ca butonul Request Indexing să returneze eroarea "Quota exceeded". Pentru site-uri cu sute de URL-uri noi pe lună (eCommerce, news, marketplace), Request Indexing manual nu scalează. Pentru astea, sitemap.xml plus IndexNow plus internal linking devin singura strategie viabilă.

Atenție la red flag: Request Indexing nu garantează indexare. Dacă pagina are probleme de calitate (thin content, duplicate, canonical conflict), Google o crawlează și apoi o respinge cu status "Crawled - currently not indexed". Cererea repetată pe același URL fără modificări de content este consum inutil de quota.

Sitemap.xml - structura și limitele tehnice

Sitemap.xml este lista canonică de URL-uri pe care vrei să le vadă Google. Specificația oficială (sitemaps.org) impune două limite hard pe care le ratează frecvent site-urile mari.

Limite per fișier sitemap:

  • Maximum 50.000 URL-uri per fișier sitemap.
  • Maximum 50 MB necomprimat per fișier sitemap.
  • Encoding obligatoriu UTF-8.
  • URL-urile trebuie să fie absolute (cu https://) și sub aceeași proprietate (același host sau subdomeniu).

Sitemap index pentru site-uri mari: peste 50.000 URL-uri unice împarți în mai multe sitemap-uri (sitemap-products-1.xml, sitemap-products-2.xml etc.) și creezi un sitemap index master care le leagă. Un index sitemap poate referenția până la 50.000 sitemap-uri copil, deci tehnic suporți 2,5 miliarde de URL-uri într-un singur ierarh, suficient pentru orice site real.

Structura minimă a unui URL în sitemap:

<url>
  <loc>https://exemplu.ro/articol/indexare-google</loc>
  <lastmod>2026-06-09</lastmod>
</url>

Tagurile <changefreq> și <priority> sunt ignorate de Google din 2017 - le poți omite fără penalizare. Singurul tag relevant pentru semnal de prospețime este <lastmod> și doar dacă reflectă o modificare reală de content. Lastmod fals (actualizat la fiecare crawl fără modificare reală) duce la pierderea încrederii în sitemap pe termen lung.

Workflow audit sitemap în 15 min:

  1. Deschide sitemap-ul în browser (de obicei /sitemap.xml sau /sitemap_index.xml).
  2. Verifică XML valid (browserul afișează parser error dacă nu).
  3. Numără URL-urile (în Chrome DevTools console: document.querySelectorAll('url').length).
  4. Spot-check 5-10 URL-uri random - returnează 200 OK? Au content unic?
  5. Submit sitemap în GSC la Sitemaps section și monitorizează statusul "Success" plus numărul Discovered URLs.

robots.txt - rol de gatekeeper, nu de ascundere

robots.txt este primul fișier pe care Googlebot îl cere de la orice site nou. Rolul lui este să controleze crawling-ul, nu indexarea. Confuzia asta produce două erori catastrofale frecvente.

Sintaxă de bază:

User-agent: *
Disallow: /admin/
Disallow: /cart
Allow: /admin/public-doc.pdf

Sitemap: https://exemplu.ro/sitemap_index.xml

Reguli importante:

  • User-agent: * - se aplică la toți crawlerii (Google, Bing, OpenAI, etc.).
  • User-agent: Googlebot - reguli specifice doar pentru Google.
  • Disallow: / - blochează tot site-ul (red flag, accidental după deploy).
  • Allow: - override pentru rute specifice sub un Disallow părinte.
  • Sitemap: - directivă recomandată cu URL absolut spre sitemap.

Capcana critică: dacă blochezi un URL prin robots.txt, Googlebot nu îl crawlează și nu poate vedea meta robots noindex din HTML. Rezultatul: URL-ul poate apărea în SERP cu titlu generic și fără descriere (sub formă de "URL discovered via external link, blocked by robots.txt"). Pentru a scoate efectiv o pagină din indexare ai nevoie de noindex în HTML accesibil pentru crawler (deci nu blocată în robots.txt) sau header X-Robots-Tag la nivel de server.

Warning

Disallow nu egal noindex. Un Disallow: / accidental după deploy (din staging copy) duce la dezindexare graduală în 7-30 zile - Google păstrează URL-urile în index dar nu mai re-crawlează, iar după mai multe încercări eșuate le scoate. Recovery durează 30-90 zile chiar după corectare. Workflow corect: verifică robots.txt cu Tester-ul din GSC (Settings - robots.txt) imediat după orice deploy. Adaugă un test automat în CI/CD care fetchuiește /robots.txt și fail-uiește build-ul dacă conține Disallow: / pe Production.

Meta robots - directive per pagină

Meta robots tag-ul din <head> controlează indexarea și comportamentul snippet la nivel de URL individual.

Directivă Efect
index (default) Pagina poate fi indexată
noindex Pagina NU va fi indexată sau va fi scoasă din index
follow (default) Crawler urmărește link-urile din pagină
nofollow Crawler NU urmărește link-urile (rar folosit la nivel de pagină)
noarchive Google nu afișează versiunea cache
nosnippet Fără descriere în SERP, fără rich snippets
max-snippet:160 Limită caractere pentru descrierea din SERP
max-image-preview:large Permite preview large pentru imagini (recomandat pentru content cu imagini)
max-video-preview:-1 Fără limită pentru preview video
unavailable_after:2026-12-31 Pagina iese din index automat după data X (utile pentru evenimente)

Implementare HTML:

<meta name="robots" content="noindex, follow">
<meta name="robots" content="max-snippet:160, max-image-preview:large, max-video-preview:-1">

Pro tip technical: combinația recomandată pentru articole standard este max-snippet:-1, max-image-preview:large, max-video-preview:-1 - permite Google să afișeze descrieri lungi și preview-uri mari, ce crește CTR cu 10-25% pe queries informaționale.

X-Robots-Tag pentru fișiere non-HTML

Meta robots funcționează doar pentru HTML. Pentru PDF, imagini, fișiere de descărcare ai nevoie de header HTTP X-Robots-Tag, setat la nivel de server (Apache, Nginx, Cloudflare Workers).

Exemplu Nginx pentru excluderea tuturor PDF-urilor din index:

location ~* \.pdf$ {
    add_header X-Robots-Tag "noindex, nofollow";
}

Exemplu Apache (.htaccess):

<FilesMatch "\.(pdf|doc|docx)$">
    Header set X-Robots-Tag "noindex, nofollow"
</FilesMatch>

Verificare cu curl:

curl -I https://exemplu.ro/document.pdf
# Caută header: X-Robots-Tag: noindex, nofollow

X-Robots-Tag suportă aceleași directive ca meta robots (noindex, nofollow, max-snippet, etc.). Pentru site-uri cu sute de PDF-uri (rapoarte, cataloage, ghiduri), header-ul la nivel de Nginx este singura soluție scalabilă.

IndexNow API - push instant la Bing, Yandex, Seznam

IndexNow este un protocol deschis lansat în 2021 de Microsoft (Bing) și Yandex prin care site-urile notifică instant search engine-urile despre URL-uri noi sau modificate. Adopție: Bing, Yandex, Seznam, Naver. Google nu participă oficial la IndexNow, deci pentru Google rămâne sitemap plus internal linking plus URL Inspection.

Cum funcționează:

  1. Generezi o cheie API (32-128 caractere alfanumerice).
  2. Hostezi cheia ca fișier la /YOUR-KEY.txt cu conținut egal cu cheia.
  3. Trimiți URL-uri printr-un POST simplu la endpoint IndexNow.

Exemplu request:

curl -X POST https://api.indexnow.org/indexnow \
  -H "Content-Type: application/json; charset=utf-8" \
  -d '{
    "host": "exemplu.ro",
    "key": "YOUR-32-CHAR-KEY",
    "keyLocation": "https://exemplu.ro/YOUR-32-CHAR-KEY.txt",
    "urlList": [
      "https://exemplu.ro/articol-nou",
      "https://exemplu.ro/articol-actualizat"
    ]
  }'

Integrare WordPress: plugin-urile Rank Math, Yoast SEO Premium și IndexNow Plugin (oficial Microsoft) automatizează submit-ul la publicare sau update. Configurare în 5 minute, fără cod custom. Testez sistematic IndexNow pe site-urile clienților din 2023 și văd indexare Bing în sub 60 minute pentru content nou, comparativ cu 3-7 zile prin sitemap clasic.

Google Indexing API - cazuri limitate oficial

Google Indexing API există ca produs oficial, dar oficial este limitat la două use-case-uri: JobPosting (anunțuri de muncă cu schema JobPosting validă) și BroadcastEvent (live streaming cu schema BroadcastEvent). Documentația Google Search Central este explicită că folosirea pentru content general (articole, produse, pagini de prezentare) nu este suportată și nu garantează indexare.

În practică, comunitatea SEO a testat folosirea Indexing API pentru content general în 2022-2023 cu rezultate mixte: funcționează pe termen scurt pentru unele site-uri, este ignorat sau penalizat pe altele. Din 2024 Google a strâns șurubul - dacă proprietatea trimite masiv URL-uri non-JobPosting prin Indexing API, riscul este suspendarea accesului la API plus posibil semnal negativ de calitate.

Practic, asta înseamnă: nu te baza pe Indexing API ca strategie de indexare rapidă pentru blog sau eCommerce. Pentru JobPosting plus BroadcastEvent (use case-urile oficiale), implementarea aduce indexare în minute, nu zile.

Coverage report - debug pentru fiecare status

Coverage report din Search Console (acum redenumit "Pages") este harta de diagnostic pentru indexare. Fiecare URL ajunge într-unul din statusuri, iar interpretarea corectă te ajută să prioritizezi reparațiile.

Status Interpretare Acțiune
Indexed OK, pagina e în index și poate apărea în SERP Monitorizare doar
Crawled - currently not indexed Google a crawlat dar a respins activ pagina Audit calitate content, EEAT, duplicate
Discovered - currently not indexed Google știe de URL dar nu l-a crawlat încă Crawl budget problem sau autoritate domain joasă
Excluded by noindex tag Tu ai cerut explicit noindex Verifică dacă e intenționat
Blocked by robots.txt Disallow blochează crawling-ul Verifică intenționalitate (atenție la Disallow accidental)
Duplicate without user-selected canonical Google a ales alt URL ca canonical Setează rel=canonical explicit
Duplicate, Google chose different canonical than user Tu ai setat canonical X, Google ignoră și alege Y Audit semnale duplicate (content, structură, internal links)
Soft 404 Pagina returnează 200 dar arată ca 404 Returnează 404 real sau adaugă content substanțial
Not found (404) URL inexistent Verifică dacă e intenționat (delete) sau eroare (broken link)
Page with redirect URL redirectează spre alt URL Verifică tipul redirect (301 permanent, 302 temporar)

Cazurile cele mai problematice:

Crawled - currently not indexed: Google a investit resurse să crawleze pagina și a decis că nu merită spațiu în index. Cauze top: thin content, lipsă valoare unică, structură semantică slabă, autoritate domain joasă. Fix: rescrie content cu mai multă substanță, adaugă internal links din pagini puternice, îmbunătățește schema markup.

Discovered - currently not indexed: Google știe URL-ul (din sitemap sau link) dar nu îl crawlează. Pentru site-uri mari (peste 10.000 URL-uri) este semnal de crawl budget insuficient. Pentru site-uri mici este semnal de autoritate domain prea joasă pentru prioritate de crawl. Fix: îmbunătățește autoritate prin backlink-uri, redu numărul de URL-uri low-value (parametri, faceted nav inutil).

Tip

Workflow audit indexare în 30 min. Combină trei surse: GSC Coverage report (filtrează după "Crawled - currently not indexed" și exportă), comanda Google site:domeniu.ro (count rezultate vs sitemap count - diferența arată gap real de indexare), log file analysis pe server (filtrează User-Agent Googlebot și vezi ce URL-uri sunt crawled efectiv vs ce e doar discovered). Diferența între cele trei surse arată unde se pierde indexarea: gap discovery (sitemap dar nu în logs) egal Google ignoră sitemap-ul, gap crawl-to-index (în logs dar nu în SERP) egal problemă de calitate.

Bulk reindex - ce funcționează și ce nu

Pentru site-uri cu sute sau mii de URL-uri care necesită re-indexare (după migrare, redesign, restructurare URL), întrebarea standard este: cum forțezi Google să re-crawleze masiv?

Ce NU funcționează:

  • URL Inspection în masă - quota practică 10-20 cereri pe zi, nu scalează.
  • Indexing API pentru content non-JobPosting - oficial nesuportat, risc de suspendare.
  • Ping sitemap (HTTP GET la /ping?sitemap=...) - depreciat oficial de Google din ianuarie 2023.
  • Tool-uri terțe care promit "instant indexing" - majoritatea sunt scam sau folosesc Indexing API cu risc de penalizare.

Ce funcționează:

  • Sitemap actualizat cu lastmod corect - Google verifică sitemap-urile la intervale regulate și prioritizează URL-urile cu lastmod recent.
  • Internal linking din pagini puternice - link nou de pe homepage sau dintr-un articol pillar cu trafic semnal puternic de prospețime.
  • IndexNow pentru Bing/Yandex - pentru Google nu ajută, dar diversifică traficul.
  • Backlink-uri externe noi - cel mai puternic semnal de descoperire plus prioritate de crawl.
  • Răbdare strategică - pentru un site cu autoritate medie, re-indexarea completă după migrare ia 30-90 zile.

Common pitfalls - greșelile care omoară indexarea

Listă concretă de erori văzute frecvent în audituri.

noindex accidental post-deploy - staging are noindex pe toate paginile, deploy-ul copiază configul în Production fără să șteargă. Detectare: Search Console alertează după 7-14 zile cu "Page indexing issues detected". Prevenție: test automat în CI/CD care fail-uiește build-ul dacă HTML conține <meta name="robots" content="noindex"> pe pagini de Production.

robots.txt cu Disallow: / - același scenariu, copy from staging. Detectare: GSC Coverage afișează "Blocked by robots.txt" pe rute critice. Prevenție: monitoring extern (UptimeRobot HTTP check pe /robots.txt cu validation pe content).

Canonical greșit - rel=canonical care pointează spre alt domeniu (homepage de dev) sau spre un URL inexistent. Google ignoră semnalul sau, mai rău, dez-indexează pagina în favoarea canonical-ului greșit. Detectare: GSC URL Inspection - "User-declared canonical" vs "Google-selected canonical".

Redirect chain 4+ - URL A redirectează la B, B la C, C la D. Google urmărește maxim 4-5 hop-uri și abandonează. Detectare: Screaming Frog plus filter "Redirect Chains". Fix: flatten la single redirect direct A spre D.

Cont GSC dublu pe același domeniu - Domain property plus URL-prefix property pe variantele http/https/www/non-www. Datele se împart, raportarea devine confuză. Best practice: o singură Domain property la /domeniu.ro/ care agregă toate variantele.

Pagini orfane - URL-uri în sitemap fără internal link spre ele. Google le poate vedea ca low-priority și le clasează "Discovered - currently not indexed". Detectare: cross-check sitemap URL-uri vs crawl Screaming Frog - tot ce e doar în sitemap și nu în crawl este orfan.

Crawl budget - când contează și cum economisești

Crawl budget este numărul de URL-uri pe care Googlebot le crawlează pe site într-o perioadă (zilnic, săptămânal). Pentru site-uri sub 10.000 URL-uri unice crawl budget nu este o problemă practică - Google crawlează ușor tot ce ai. Pentru site-uri peste 10.000 URL-uri (eCommerce mari, marketplace, news cu arhivă) devine factor critic.

Cum economisești crawl budget:

  • Parametri URL - filtre eCommerce (?color=red&size=M) generează combinații exponențiale. Configurează URL parameters în GSC (Settings legacy) sau folosește rel=canonical spre versiunea fără parametri.
  • Faceted navigation - aceeași problemă la magazine cu multe filtre. Solut: noindex,follow pe combinațiile non-prioritare plus internal linking doar spre categoriile principale.
  • Pagini de paginare - /category/page/50/ rareori indexate sau trafice. Recomandare actuală: lasă-le indexable cu rel=canonical pe ele însele (nu pe page 1) sau folosește rel=prev/next (deprecated dar interpretat în continuare de unele crawlere).
  • Duplicate content - canonical clar plus eliminare versiuni duplicate (trailing slash, case sensitivity, www vs non-www).
  • Server speed - TTFB sub 200ms permite Google să crawleze mai multe URL-uri în același timp alocat. Server lent egal crawl budget pierdut.

Data: după un audit pe un site eCommerce cu 47.000 URL-uri, redus la 18.000 URL-uri canonical prin noindex pe faceted nav plus consolidare parametri, am văzut creștere indexare reală de la 11.000 la 16.500 URL-uri în 60 zile, fără adăugare content nou.

Întrebări frecvente

Cât durează indexarea unui URL nou în Google?

Pentru un site cu autoritate medie (DR 20-40), URL nou cu internal link din pagină puternică plus submit prin URL Inspection: 2-7 zile până la indexare. Pentru site nou (sub 6 luni vechime, DR sub 10): 2-8 săptămâni sau chiar mai mult. Pentru site cu autoritate ridicată (DR 60+) și content de news: minute până la ore. Factorul determinant este autoritate domain plus calitate content, nu metoda de submit.

Pot forța Google să re-indexeze o pagină după update?

Da, parțial. Folosește URL Inspection plus Request Indexing pentru pagini individuale (quota 10-20/zi). Pentru update-uri masive (re-design, restructurare), actualizează sitemap-ul cu lastmod corect și așteaptă re-crawl natural (30-90 zile pentru site-uri medii). Nu există buton "re-index all" oficial - Google decide singur prioritatea de re-crawl pe baza freshness signals.

De ce apar URL-uri în GSC ca "Discovered - currently not indexed" luni întregi?

Trei cauze posibile. Crawl budget insuficient pentru site mare (peste 10k URL-uri) - reduci URL-uri low-value. Autoritate domain prea joasă pentru prioritate de crawl - construiește backlink-uri. Calitate content percepută slabă - chiar dacă nu e crawled, Google evaluează semnale circumstanțiale (sitemap structure, internal linking, anchor text). Fix combinatoriu, nu există un singur lever.

IndexNow funcționează pentru Google?

Nu. Google a anunțat oficial în 2022 că testează IndexNow dar nu a aderat la protocol. La data 2026, Google nu acceptă submissions IndexNow. Folosește IndexNow pentru Bing (relevant pentru piața RO, ~5% market share), Yandex, Seznam. Pentru Google rămâne sitemap.xml plus URL Inspection plus internal/external linking.

Ce e mai bine, sitemap în /sitemap.xml sau referențiat în robots.txt?

Ambele. Sitemap la /sitemap.xml este convenție de facto, Googlebot o caută automat. Adăugarea în robots.txt cu directiva Sitemap: https://exemplu.ro/sitemap_index.xml permite descoperire de către crawlere care nu caută locația standard (Bing, OpenAI, Anthropic). Best practice: ambele.

Cum verific dacă o pagină e cu adevărat indexată?

Trei metode complementare. URL Inspection în GSC - sursa de adevăr, arată statusul exact plus ultimul crawl. Comanda site:domeniu.ro/cale-completa în Google - dacă apare pagina, e indexată; dacă nu, fie nu e indexată, fie e filtrată din SERP. Search query exact match din content unic al paginii (citat de 8-10 cuvinte între ghilimele) - dacă pagina apare, e indexată plus rankable. Folosește toate trei pentru cross-check, niciuna singură nu e 100% fiabilă.

Câte URL-uri pot avea într-un sitemap.xml?

Maximum 50.000 URL-uri sau 50 MB necomprimat per fișier sitemap. Peste, împarți în mai multe sitemap-uri și creezi un sitemap index master. Sitemap index suportă până la 50.000 sitemap-uri copil, deci tehnic 2,5 miliarde URL-uri într-un ierarh. Pentru site-uri uriașe (eMAG, OLX), sitemap-urile sunt organizate pe categorii (products, categories, blog, etc.) pentru parsing eficient.

Diferența între noindex și robots.txt Disallow?

noindex (meta robots sau X-Robots-Tag header) permite crawling dar interzice indexare - URL-ul iese din SERP. Disallow (robots.txt) interzice crawling - URL-ul poate rămâne în SERP fără content (afișat cu titlu generic "URL discovered, blocked"). Pentru a scoate o pagină din SERP folosești noindex, NU Disallow. Pentru a opri crawling-ul pe rute private (admin, API endpoints) folosești Disallow.

Concluzie

Indexarea în Google nu este un buton magic, este suma a zeci de semnale tehnice plus calitative pe care Google le evaluează la fiecare URL. Sitemap.xml corect, robots.txt fără capcane, meta robots adecvat, IndexNow pentru Bing și URL Inspection pentru cazuri punctuale - toate astea sunt premise. Dar indexarea reală vine din calitatea content-ului plus autoritatea domeniului: dacă pagina ta nu aduce valoare unică față de top 10 SERP pe query-ul țintă, Google o crawlează și o respinge sub status "Crawled - currently not indexed", indiferent câte semnale tehnice corecte ai.

Monitorizează Coverage report săptămânal, audit-uiește sitemap-ul lunar, verifică robots.txt după fiecare deploy și investește în internal linking plus content depth pe paginile prioritare. SEO tehnic perfect plus content slab egal zero trafic. SEO tehnic corect plus content excelent egal compound growth la 12-24 luni. Asta e math-ul real.

Pentru aprofundare, vezi schema markup pentru firme mici (semnal de calitate la nivel de pagină), strategii de backlink pentru site mic (autoritate domain) și SEO copywriting pentru România (calitate content care trece pragul de indexare).