Teknisk kravspecifikation för AI crawling
Syfte
För att våra AI-lösningar ska fungera korrekt behöver vi kunna crawla ert innehåll på ett strukturerat och tillförlitligt sätt. Denna kravspecifikation beskriver de tekniska förutsättningar som behöver vara uppfyllda.
De här kraven är i linje med Google/Bing/Open AI:s rekommendationer för att få en så bra och snabbt uppdaterad version av sin site som möjligt, även i deras tjänster.
------------------------------------------------------------------------------------------
Övergripande krav
- En sitemap som följer gällande teknisk standard och best practice
- Sitemapen ska tydligt ange och innehålla de sidor som ska crawlas av Kundo
Detaljerade krav
1. Sitemap
Ni behöver tillhandahålla en sitemap som innehåller samtliga sidor ni vill att Kundo ska crawla.
Sitemapen ska:
- Vara tillgänglig för vår crawler
- Innehålla attributet <lastmod> för varje URL
2. Krav på lastmod
- Lastmod ska endast uppdateras när sidans innehåll har ändrats på ett meningsfullt sätt
- Massuppdateringar av lastmod utan innehållsförändringar ska undvikas
Viktigt: Om lastmod leder till fler än 10 000 siduppdateringar per månad tillkommer en extra avgift för att täcka våra ökade crawl-kostnader.
3. Crawling & åtkomst
- Vi crawlar den URL ni hänvisar oss till, inklusive eventuell redirect (även IP-baserad)
- Inget botskydd får blockera sitemapen eller webbplatsen
- Vår crawler måste tillåtas i eventuella brandväggar eller säkerhetslösningar
- Sidor som ska crawlas får inte ligga bakom lösenordsskydd
Viktigt: Vår crawler är baserad i Sverige, så er sida hämtas som om besökaren finns i Sverige.
4. Crawling och personuppgifter
Crawlingen görs av ett amerikanskt företag. Crawlingen behandlar information som är offentligt tillgänglig på er webb. Även om crawlen inte är specifikt utformad för att samla in personuppgifter, kan personuppgifter förekomma i det innehåll som samlas in.
För att undvika crawlingen av personuppgifter och för att minimera personuppgiftsinsamling, har vi implementerat åtgärder för att begränsa insamlingen och behandlingen av personuppgifter. Ni har möjlighet att definiera vilka specifika URL:er och sidor som inte får crawlas genom att etablera blockeringsregler.