>_ DevTrendsde

Sprache

Start

Sprachen

Bereiche

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicherheit
Rust

So führst du einen schnellen Website-Parser für LLMs mit nur 14 Megabyte RAM aus

fastCRW

Das letzte Mal, als ich versucht habe, einen lokalen Stack für Web-Scraping in einer RAG-Pipeline bereitzustellen, hat mein bescheidener VPS schnell um Gnade gefleht. Die Kombination aus Browser-Engines, Task-Warteschlangen und schweren Runtimes hat sofort Gigabytes an Speicher verbraucht. Wenn du auch schon beliebte Lösungen wie Firecrawl selbst gehostet hast, erinnerst du dich wahrscheinlich an diese Systemanforderungen.

Kürzlich ist mir das fastCRW-Projekt aufgefallen (im Repository wird es einfach crw genannt). Der Autor hat die vertrauten Scraping- und Crawling-Funktionen in Rust neu geschrieben und alles in ein kompaktes Binary gepackt.

Was das Projekt kann

fastCRW wurde als direkte Alternative zu Firecrawl und Tavily konzipiert. Es ruft Webseiten per URL ab und liefert sie als sauberes Markdown, bereit für die Verarbeitung durch Sprachmodelle, oder als strukturiertes JSON.

Das Tool erledigt vier Hauptaufgaben:

  1. Scrape: konvertiert eine Seite in Markdown, rohes HTML oder einen Screenshot.
  2. Crawl: durchläuft systematisch Seiten einer Website über interne Links unter Einhaltung der robots.txt.
  3. Map: erstellt eine Link-Karte einer Ressource, ohne jede Seite vollständig zu laden.
  4. Search: durchsucht das Internet und exportiert die Ergebnisse sofort.

fastCRW benchmarks

Laut Benchmarks im Repository zeigte fastCRW bei einem offenen Datensatz von tausend Adressen eine gute Lade-Geschwindigkeit und Vollständigkeit der Datenextraktion, während das Binary im Leerlauf nur etwa 14 Megabyte RAM verwendet.

Wie man damit arbeitet

Du kannst das Tool lokal ohne Registrierung ausprobieren oder einen Cloud-Backend mit einem kostenlosen Kontingent verbinden.

Installation im Terminal:

curl -fsSL https://fastcrw.com/install | sh

Danach ist die CLI sofort verfügbar. Ein einfacher Aufruf gibt analysiertes Markdown direkt an den Ausgabe-Stream zurück:

crw https://example.com

Integration in Code

Für Entwickler gibt es fertige Bibliotheken. So sieht die Datensammlung in Python aus:

from crw import CrwClient

client = CrwClient()
page = client.scrape("https://example.com", formats=["markdown"])

print(page["markdown"])

Für Node.js ist die Syntax praktisch identisch:

import { CrwClient } from "crw-sdk";

const client = new CrwClient();
const page = await client.scrape("https://example.com", {
  formats: ["markdown"],
});

console.log(page.markdown);

Verbindung zu KI-Assistenten über MCP

Ein zusätzlicher Vorteil ist die Unterstützung des Model Context Protocol. Das bedeutet, dass das Tool schnell als Werkzeug für Claude Desktop, Cursor oder jeden anderen Agent verbunden werden kann.

Befehl für die automatische MCP-Einrichtung:

npx -y crw-mcp@latest install

Nach der Installation erhält das Modell die Fähigkeit, selbstständig im Internet zu suchen und Seiten zu lesen, ohne Workarounds mit externen Skripten.

Bereitstellungsoptionen und Lizenzierung

Das Projekt bietet zwei Nutzungspfade. Der erste ist das Ausführen eines lokalen Binary auf eigenen Servern unter Linux oder macOS. Der zweite ist eine Cloud-API mit fertigem schwerem JavaScript-Rendering und Suche.

Es ist wichtig, die Lizenzen zu prüfen, wenn du planst, das Tool in der Produktion einzusetzen. Die Engine selbst und der MCP-Server werden unter der strengen AGPL-3.0-Lizenz vertrieben. Client-Bibliotheken für Python und TypeScript sind unter der vertrauten MIT-Lizenz offen.

Für wen ist das nützlich

fastCRW ist eine ausgezeichnete Wahl, wenn du RAG-Systeme erstellst, Daten für das Feintuning von Modellen sammelst oder autonome KI-Agenten entwickelst. Das Projekt eliminiert die Notwendigkeit, eine schwere Browser-Flotte zu pflegen, nur um reinen Text aus Artikeln und Dokumentation zu extrahieren.

Wenn du es leid bist, die Hälfte deiner Server-Ressourcen schweren Parsern zu widmen, versuche crw lokal auszuführen – der Unterschied im Speicherverbrauch ist von den ersten Sekunden an bemerkbar.

Ähnliche Projekte