doc-scraper: Gå crawler som bygger lokal dokumentationskontext för LLM:er
doc-scraper, av Sriram PR, samlar teknisk webbplatsdokumentation och förbereder den för AI-assisterade arbetsflöden. Appen genomsöker dokumentationssajter och extraherar läsbar innehåll optimerat för användning som modellkontext, riktad mot utvecklare och AI-forskare. Den betonar ren, sökbar output och ett lokalt kunskapslager så att redaktörsbaserade assistenter kan få tillgång till relevant referensmaterial utan att dra in bullriga webbsidor under konstruktionen av uppmaningar.
Konverterar webbplatsens HTML till strukturerad Markdown som är lämplig för modellkontext
Verktyget är en Go-baserad crawler som konverterar dokumentations-HTML till strukturerad Markdown, tar bort navigeringsfält, sidfötter och annan icke-innehållsrelaterad krom. Konverteringen bevarar rubriker och inline-kod samtidigt som den minskar textuell brus, vilket producerar kompakta korpusfiler som behåller navigeringskontext via rena rubriker och länkar för enklare hämtning och referens av nedströms modellarbetsflöden.
Sökbarhet och förändringsdetektering gör korpusen pålitlig för agenter
Appen integrerar en offline BM25 sökning implementerad via SQLite FTS5, vilket möjliggör lokala frågor mot den crawlade korpusen utan internetåtkomst. Tillståndsbevarande med BadgerDB och SQLite stöder återupptagbara operationer och en historikindex. En innehållsmedveten diff-mekanism identifierar faktiska sidförändringar istället för att enbart förlita sig på tidsstämplar, vilket minskar redundanta nedladdningar och håller den lokala korpusen fokuserad på substantiella redigeringar.
Indatamönster och crawl-gränser definierar var den lyckas
doc-scraper upptäcker automatiskt dokumentationsramverk som Docusaurus, MkDocs, Sphinx, GitBook och ReadTheDocs, och använder en läsbarhetsbaserad extraktor på okända webbplatser. Crawlning körs parallellt med delad resursförvaltning och inbyggd hastighetsbegränsning, och crawlern respekterar robots.txt för att förbli artig. Dessa gränser prioriterar att extrahera utvecklarrelevant innehåll samtidigt som man undviker överdriven nätverksbelastning.
Lokal MCP-värd passar redaktörscentrerade AI-arbetsflöden och integritetsbehov
När den körs i serverläge fungerar appen som en Model Context Protocol-server så att lokala AI-agenter kan läsa och söka dokumentation inuti redaktörer. Den lokala, offline kunskapsbasens design håller sökbar dokumentation tillgänglig för agenter som Claude Desktop, Claude Code och Cursor, vilket minskar beroendet av fjärrhämtning. Verktyget är känt inom Go- och AI-utvecklarcommunities för att producera ren output på webbplatser där andra crawlers har problem.
Bäst lämpad för tekniskt kunniga utvecklare som kan bygga och värda lokal kontext
doc-scraper är ett praktiskt alternativ för utvecklare och forskare som behöver verifierbar, lokalt värdad dokumentation som modellkontext. Eftersom verktyget kräver att man bygger från källkod med Go (version 1.25 eller senare), gynnar det tekniskt kapabla användare; team som inte kan kompilera Go-projekt bör förvänta sig installationsöverhuvud. Användare bör inspektera skrapade avsnitt innan de använder dem som auktoritativa modellinmatningar.