Daugelis svetainių savininkų ir pradedančiųjų rinkodaros specialistų visą dėmesį skiria turinio kūrimui bei išorinėms nuorodoms, tačiau pamiršta pamatines technines detales. Viena jų yra crawl budget, arba skenavimo biudžetas. Tai išteklių kiekis, kurį Google skiria jūsų svetainės puslapiams rasti ir perskaityti per tam tikrą laiką. Jei jūsų techninis SEO nėra sutvarkytas, Googlebot gali išeikvoti savo energiją bereikšmiams puslapiams, o svarbiausios jūsų prekių kategorijos ar straipsniai liks nepastebėti.
Dirbdami su dideliais e-komercijos projektais SABIS agentūroje pastebime, kad netinkamai valdomas skenavimas tampa pagrindine kliūtimi augimui. Įsivaizduokite, kad turite dešimt tūkstančių prekių, bet Google per dieną aplanko tik šimtą puslapių, iš kurių pusė yra techninės šiukšlės. Tokiu atveju naujų prekių indeksavimas gali užtrukti savaites ar net mėnesius. Šiame straipsnyje aptarsime, kaip suvaldyti šį procesą ir užtikrinti, kad paieškos varikliai dirbtų jūsų naudai.
Kada crawl budget tampa realia problema
Ne kiekvienas svetainės savininkas turi rūpintis skenavimo biudžetu. Jei jūsų svetainė yra nedidelė, pavyzdžiui, paslaugų puslapis su 50 ar 200 puslapių, Googlebot greičiausiai ją visą nuskenuos be jokių sunkumų. Tokiu atveju jūsų prioritetas turėtų būti turinio kokybė ir vartotojo patirtis.
Problemos prasideda tada, kai svetainės apimtis viršija 10 000 unikalių puslapių. Čia skenavimo biudžeto valdymas tampa kritiniu techninio SEO elementu. Dažniausiai su šiais iššūkiais susiduria:
- Didelės el. parduotuvės: turinčios tūkstančius produktų, kategorijų ir, svarbiausia, daugybę filtrų derinių.
- Skelbimų portalai: kur turinys nuolat keičiasi, o seni skelbimai turi būti greitai pašalinami iš indekso.
- Naujienų portalai: kuriems būtinas momentinis naujo turinio indeksavimas, kad jie išliktų konkurencingi.
- Svetainės su automatiškai generuojamu turiniu: pavyzdžiui, paieškos rezultatų puslapiai arba vartotojų profiliai.
Jei pastebite, kad jūsų naujai sukurti puslapiai Google paieškoje pasirodo tik po kelių savaičių, arba Search Console matote pranešimą: „Discovered – currently not indexed“, tai yra pirmasis signalas, kad jūsų skenavimo biudžetas yra eikvojamas netikslingai. Google žino apie puslapį, bet nusprendė, kad jo skenavimas šiuo metu nėra prioritetas arba tam neužtenka resursų.
Kas eikvoja jūsų skenavimo biudžetą
Norint sutaupyti išteklius, pirmiausia reikia suprasti, kur jie prarandami. Googlebot yra efektyvus, tačiau jis gali lengvai pakliūti į technines spąstus, kurie sukuria begalę beverčių URL adresų.
Filtravimo URL ir briaunota navigacija
Tai didžiausias crawl budget priešas el. parduotuvėse. Įsivaizduokite, kad turite kategoriją „Batai“. Vartotojas gali filtruoti pagal dydį, spalvą, medžiagą, prekės ženklą ir kainą. Kiekvienas šis derinys sugeneruoja naują URL adresą. Jei filtrai nėra tinkamai valdomi, viena kategorija gali sukurti tūkstančius puslapių variacijų, kurios Googlebotui atrodo kaip atskiri, bet beveik identiški puslapiai. Tai sukuria dubliuoto turinio problemą ir priverčia robotą skenuoti tą pačią informaciją vėl ir vėl.
Sesijų parametrai ir sekimo kodai
Kai kurie programuotojai vis dar naudoja sesijų ID (pavyzdžiui?sessionid=123) arba naudoja UTM parametrus vidinėse nuorodose. Kiekviena sesija sukuria naują unikalų URL tam pačiam turiniui. Googlebotas mato šiuos adresus kaip skirtingus puslapius. Tai ne tik eikvoja biudžetą, bet ir išsklaido puslapio autoritetą (link equity) per kelis adresus.
Nukreipimų grandinės
Techninis SEO dažnai nukenčia dėl ilgų nukreipimų grandinių. Kai puslapis A nukreipia į B, o B į C, Googlebotas turi atlikti kelias užklausas, kad pasiektų galutinį turinį. Kiekvienas žingsnis šioje grandinėje naudoja resursus. Jei jūsų svetainėje yra tūkstančiai tokių grandinių, skenavimo efektyvumas krenta dramatiškai. Idealiu atveju visi nukreipimai turi būti tiesioginiai (301 nukreipimas tiesiai į galutinį adresą).
Plonas ir dubliuotas turinis
Google nenori gaišti laiko puslapiams, kurie neturi vertės. Tai apima tuščias kategorijas, puslapius su vienu sakiniu arba automatiškai sugeneruotus tag puslapius, kurie dubliuoja pagrindines kategorijas. Indeksavimas tampa selektyvus: jei robotas mato per daug mažos vertės puslapių, jis gali pradėti rečiau lankytis visoje svetainėje.
Konkretūs būdai, kaip taupyti crawl budget
Sėkmingas techninis SEO prasideda nuo prioritetų nustatymo. Jūsų tikslas yra nukreipti Googlebotą į pačius vertingiausius puslapius ir uždaryti kelius į šiukšlyną.
Robots.txt failo optimizavimas
Tai yra galingiausias jūsų įrankis. Naudokite Disallow taisyklę, kad uždraustumėte skenuoti filtrų parametrus, kurie nėra svarbūs paieškai. Pavyzdžiui, jei spalvos filtras jums neša srautą, palikite jį atvirą, bet uždrauskite kainos rėžių ar rūšiavimo parametrus (pvz.?sort=price). Tai akimirksniu atlaisvins didelę dalį biudžeto.
Serverio atsako greitis
Skenavimo biudžetas priklauso ne tik nuo puslapių skaičiaus, bet ir nuo to, kaip greitai jūsų serveris atsako į užklausas. Jei puslapis kraunasi 2 sekundes, Googlebotas per tą patį laiką nuskenuos mažiau puslapių nei svetainėje, kurios atsako laikas yra 200 milisekundžių. Investicija į greitą hostingą ir kodo optimizavimą tiesiogiai padidina jūsų svetainės skenavimo talpą.
Svetainės struktūros valymas
Užtikrinkite, kad svarbiausi puslapiai būtų pasiekiami per 3 ar mažiau paspaudimų nuo pradinio puslapio. Naudokite vidines nuorodas protingai: jei turite tūkstančius produktų, naudokite HTML sitemaps ir logišką kategorijų medį. Pašalinkite nuorodas į 404 klaidos puslapius ir sutvarkykite visas 301 nukreipimų grandines į tiesioginius kelius.
Canonical žymų naudojimas
Nors Canonical žymos tiesiogiai neuždraudžia skenavimo (robotas vis tiek turi aplankyti puslapį, kad pamatytų žymą), jos padeda Google suprasti, kurį puslapį rodyti rezultatuose. Tačiau derinant Canonical su Robots.txt, galima pasiekti geriausių rezultatų: neindeksuojami puslapiai blokuojami per Robots.txt, o panašūs, bet reikalingi variantai, nurodomi per Canonical.
Kaip pamatuoti pokytį Search Console ataskaitose
Atlikus pakeitimus, būtina stebėti rezultatus. Geriausias įrankis tam yra Google Search Console esanti „Crawl Stats“ (Skenavimo statistika) ataskaita, kurią rasite Settings skiltyje.
Svarbiausi rodikliai, į kuriuos reikia atkreipti dėmesį:
- Total crawl requests: po optimizacijos šis skaičius gali laikinai šoktelėti (nes Googlebotas bando suprasti pokyčius), bet vėliau jis turėtų stabilizuotis. Svarbiausia, kad robotas pradėtų lankytis svarbiuose puslapiuose dažniau.
- Average response time: stebėkite, ar šis rodiklis mažėja. Jei vidutinis atsako laikas krenta, Googlebotas galės nuskenuoti daugiau puslapių per tą patį laiką.
- Crawl requests by response: čia turėtumėte matyti dominuojantį „OK (200)“ statusą. Jei matote daug „Not found (404)“ arba „Moved permanently (301)“, tai rodo, kad jūsų vidinė struktūra vis dar eikvoja biudžetą nereikalingoms užklausoms.
- Crawl requests by file type: įsitikinkite, kad robotas neskenuoja per daug vaizdų ar PDF dokumentų, jei jūsų pagrindinis tikslas yra tekstinio turinio indeksavimas.
Kitas svarbus žingsnis yra „Indexing -> Pages“ ataskaita. Stebėkite kategoriją „Excluded“. Jei po jūsų atliktų techninių pakeitimų skaičius „Crawled – currently not indexed“ pradeda mažėti, o „Indexed“ puslapių skaičius auga, vadinasi, jūsų strategija veikia. Tai reiškia, kad Googlebotas pagaliau randa laiko ir resursų jūsų vertingam turiniui.
Skenavimo biudžeto optimizavimas nėra vienkartinis veiksmas, tai nuolatinė techninės higienos dalis. Augant svetainei, atsiranda naujų parametrų, filtrų ir techninių sprendimų, kurie gali vėl išbalansuoti sistemą. Reguliarus auditavimas leidžia išvengti situacijų, kai investicijos į turinį neatsiperka tik dėl to, kad paieškos varikliai paprasčiausiai to turinio nepasiekia.
Apibendrinimas ir praktiniai žingsniai:
Skenavimo biudžetas yra ribotas išteklius, kurį privalote valdyti, jei jūsų svetainė viršija 10 000 puslapių ribą. Pagrindiniai biudžeto eikvotojai yra netvarkingi filtrai, sesijų parametrai ir lėtas serveris. Norėdami pasiekti geresnių rezultatų, atlikite šiuos žingsnius:
- Peržiūrėkite savo Robots.txt failą ir blokuokite visus URL parametrus, kurie nesukuria unikalaus turinio vertės vartotojui.
- Patikrinkite Google Search Console „Crawl Stats“ ataskaitą ir nustatykite, ar serverio atsako laikas viršija 500 ms: jei taip, optimizuokite serverio greitį.



