>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Rust

Cómo ejecutar un parser web rápido para LLMs con solo 14 megabytes de RAM

fastCRW

La última vez que intenté desplegar una pila local para web scraping en un pipeline RAG, mi modesto VPS rápidamente suplicó clemencia. La combinación de motores de navegador, colas de tareas y runtimes pesados devoró instantáneamente gigabytes de memoria. Si también has intentado autoalojar soluciones populares como Firecrawl, probablemente recuerdas esos requisitos del sistema.

Recientemente, el proyecto fastCRW llamó mi atención (en el repositorio simplemente se llama crw). El autor reescribió las funciones familiares de scraping y crawling en Rust, ajustando todo en un binario compacto.

Lo que puede hacer el proyecto

fastCRW fue concebido como una alternativa directa a Firecrawl y Tavily. Obtiene páginas web por URL y las entrega como Markdown limpio, listo para que los modelos de lenguaje lo consuman, o como JSON estructurado.

La herramienta maneja cuatro tareas principales:

  1. Scrape: convierte una página en Markdown, HTML sin procesar o una captura de pantalla.
  2. Crawl: recorre sistemáticamente las páginas del sitio a través de enlaces internos respetando robots.txt.
  3. Map: construye un mapa de enlaces de un recurso sin cargar completamente cada página.
  4. Search: busca en internet e inmediatamente exporta los resultados.

Comparativas de fastCRW

Según las comparativas en el repositorio, en un conjunto de datos abierto de mil direcciones, fastCRW mostró buena velocidad de carga y completitud en la extracción de datos, mientras que el binario en reposo usa solo unos 14 megabytes de RAM.

Cómo trabajar con esto

Puedes probar la utilidad localmente sin registro, o conectar un backend en la nube con un nivel gratuito.

Instalación en la terminal:

curl -fsSL https://fastcrw.com/install | sh

Inmediatamente después de esto, la CLI está disponible. Una llamada simple devolverá Markdown analizado directamente al flujo de salida:

crw https://example.com

Integración en código

Para los desarrolladores, hay bibliotecas listas para usar. Así se ve la recolección de datos en Python:

from crw import CrwClient

client = CrwClient()
page = client.scrape("https://example.com", formats=["markdown"])

print(page["markdown"])

Para Node.js, la sintaxis es prácticamente la misma:

import { CrwClient } from "crw-sdk";

const client = new CrwClient();
const page = await client.scrape("https://example.com", {
  formats: ["markdown"],
});

console.log(page.markdown);

Conectar con asistentes de IA a través de MCP

Una ventaja adicional es el soporte del Protocolo de Contexto de Modelo. Esto significa que la utilidad puede conectarse rápidamente como una herramienta para Claude Desktop, Cursor o cualquier otro agente.

Comando para configuración automática de MCP:

npx -y crw-mcp@latest install

Después de la instalación, el modelo obtiene la capacidad de buscar en la web y leer páginas de forma independiente sin trucos con scripts externos.

Opciones de despliegue y licenciamiento

El proyecto tiene dos caminos para su uso. El primero es ejecutar un binario local en tus propios servidores bajo Linux o macOS. El segundo es una API en la nube con renderizado pesado de JavaScript y búsqueda listos para usar.

Es importante revisar las licencias si planeas desplegar la herramienta en producción. El motor en sí y el servidor MCP se distribuyen bajo la licencia estricta AGPL-3.0. Las bibliotecas cliente para Python y TypeScript son de código abierto bajo la familiar MIT.

A quién le será útil

fastCRW es una excelente opción si estás construyendo sistemas RAG, recopilando datos para el ajuste fino de modelos, o creando agentes de IA autónomos. El proyecto elimina la necesidad de mantener una flota pesada de navegadores solo para extraer texto plano de artículos y documentación.

Si estás cansado de dedicar la mitad de los recursos de tu servidor a parsers pesados, prueba ejecutar crw localmente — la diferencia en el consumo de memoria se nota desde los primeros segundos.

Proyectos relacionados