Co jeszcze możemy wdrożyć

2026-06-22 · updated 2026-09-05

Obecny crawler zbiera zdrowie DNS/TLS, kolejkę URL-i i stan root domen. To jest baza pod kilka większych produktów badawczych i infrastrukturalnych.

1. Badanie adopcji AI

Możemy mierzyć, jak strony przygotowują się na ruch AI:

Wynik per domena:

{
  "ai_adoption": {
    "llms_txt": true,
    "robots_ai_policy": "allow_search_block_training",
    "machine_readable_docs": true,
    "score": 68
  }
}

To pozwala budować ranking stron gotowych na agentów AI, a nie tylko stron dobrze widocznych w SEO.

2. Cache dla LLM

Crawler może tworzyć cache treści zoptymalizowany pod modele:

Taki cache zmniejsza koszt pobierania tych samych stron przez wiele procesów RAG, agentów i eksperymentów.

3. Globalny RAG jako mapa wiedzy publicznego WWW

Globalny RAG może odpowiadać na pytania o publiczny web: co istnieje, gdzie jest aktualne i jak zmienia się w czasie.

Przykłady:

Ważne: globalny RAG nie powinien być "wrzuć cały HTML do wektorów". Najpierw trzeba mieć kanonikalizację, język, typ strony, świeżość, licencję i jakość ekstrakcji.

4. Ograniczanie poboru energii

Możemy zmniejszać energię przez decyzje schedulera:

To jest praktyczna oszczędność: mniej requestów, mniej transferu, mniej parsowania, mniej embeddingów.

5. Publiczna vector DB sites

Można wystawić publiczny indeks wektorowy stron jako warstwę "sites":

Warto zacząć od metadanych i małej próbki. Publiczna vector DB bez dobrego filtra jakości szybko staje się drogim indeksem spamu.

6. Podobne tematy warte sprawdzenia

Kolejność wdrożenia

Najmniejszy sensowny ciąg prac:

  1. dodać pomiar /llms.txt i polityk AI botów,
  2. zapisywać czysty Markdown snapshot dla wybranych domen,
  3. dodać hash sekcji i wykrywanie zmian,
  4. zbudować mały indeks wektorowy tylko dla jakościowych domen,
  5. mierzyć koszt crawla per root domain,
  6. dopiero potem wystawiać publiczne API.

Powiązane: Plan: report card domeny · SEO na podstawie crawlingu.