Jak przekazać dowolną stronę do sieci neuronowej bez reklam i zbędnych tokenów
pullmd konwertuje strony do czystego Markdown dla agentów LLM, usuwając reklamy i nawigację, zachowując strukturę treści.
Język
Strona głównaJęzyki
Sekcje
pullmd konwertuje strony do czystego Markdown dla agentów LLM, usuwając reklamy i nawigację, zachowując strukturę treści.
Szybka biblioteka OCR do odczytu tablic rejestracyjnych, osiągająca do 14 000 tablic na sekundę dzięki kompaktowym modelom CCT i ONNX Runtime.
Biblioteka Node.js, która wyodrębnia ustrukturyzowany JSON z chaotycznych plików PDF i skanów za pomocą AI, obsługująca modele w chmurze i lokalne.
Tesseract. js przenosi OCR bezpośrednio do przeglądarki. Bez backendu, bez płatności w chmurze — czyste rozpoznawanie tekstu po stronie klienta z WebAssembly.
Potrzebowaliście kiedyś wyodrębnić dane z PDF-a lub skanu? Text-Extract-API łączy nowoczesny OCR z modelami językowymi.
Poznaj PDF Craft – potężne narzędzie Python, które konwertuje skany PDF na edytowalne formaty Markdown i EPUB dzięki inteligentnemu OCR.