Text-Extract-API: Documenten Omzetten naar Gestructureerde Data Zonder Hoofdpijn
Moest je ooit data uit een PDF-rapport of gescand document halen? De vertrouwde nachtmerrie van handmatig tekst kopiëren, worstelen met scheefstaande tabellen en formules kwijtraken? Text-extract-api biedt een elegante oplossing voor dit probleem, met moderne OCR-technologieën en taalmodellen.
Wat is deze tool?
Text-extract-api is een Python API waarmee je het volgende kunt doen:
- PDF, Word, PowerPoint en afbeeldingen converteren naar Markdown of JSON
- Tabellen, cijfers en wiskundige formules extraheren
- Documenten opschonen van persoonlijke gegevens (PII)
- De herkenningskwaliteit verbeteren met LLM-modellen (Llama 3, MiniCPM en anderen)
Het belangrijkste voordeel is dat alles lokaal werkt zonder data naar cloudservices te sturen.
Belangrijkste functies
1. Ondersteuning voor verschillende formaten en herkenningsstrategieën
Het project ondersteunt verschillende OCR-engines:
- EasyOCR — voor snelle tekstherkenning in meer dan 30 talen
- MiniCPM-V — open model voor commercieel gebruik
- Llama 3.2 Vision — meest nauwkeurig, maar resource-intensieve optie
- Remote API — voor integratie met externe services zoals Marker PDF
Voorbeeldopdracht voor conversie:
python client/cli.py ocr_upload --file example.pdf --strategy easyocr
2. Tekstverbetering met LLM
Na herkenning kan tekst verder worden verwerkt door een taalmodel:
- OCR-foutcorrectie
- Gestructureerde data-extractie (bijv. een medisch rapport omzetten naar JSON)
- Verwijdering van persoonlijke gegevens
python client/cli.py ocr_upload --file medical_report.pdf --prompt_file extract_to_json.txt --model llama3.1
3. Flexibele opslag van resultaten
Verschillende strategieën voor het opslaan van verwerkte documenten worden ondersteund:
- Lokaal bestandssysteem
- Google Drive
- Amazon S3
Configuratie via YAML-bestanden maakt het eenvoudig om het systeem aan te passen aan je behoeften.
Technische details
De architectuur van het project is gebouwd op:
- FastAPI voor REST API
- Celery voor asynchrone taakverwerking
- Redis voor resultaten caching
- Ollama voor het werken met lokale LLM-modellen
Twee implementatieopties worden aangeboden:
- Natieve uitvoering (handig voor Mac met Apple Silicon)
- Docker-containers (inclusief GPU-versnelde versie)
Praktische toepassingen
Waar kan text-extract-api van pas komen?
Advocatenkantoren kunnen de verwerking van gescande contracten automatiseren en belangrijke voorwaarden extraheren naar een gestructureerd formaat.
Medische faciliteiten krijgen een tool voor het converteren van papieren rapporten naar elektronische dossiers zonder handmatige datainvoer.
Fintech-startups kunnen bankafschriften en facturen parseren en data extraheren voor boekhoudsystemen.
Onderzoekers zullen de mogelijkheid waarderen om oude boeken en wetenschappelijke artikelen te digitaliseren met behoud van formules en tabellen.
Aan de slag in 5 minuten
- Installeer Docker en Ollama
- Kloon de repository:
git clone https://github.com/CatchTheTornado/text-extract-api.git
cd text-extract-api
- Start de services:
docker-compose up --build
- Probeer je eerste document te converteren!
Text-extract-api is: ✅ Lokale oplossing zonder data naar de cloud te sturen ✅ Ondersteuning voor veel formaten en talen ✅ Flexibele integratie met verschillende opslagopties ✅ Kwaliteitsverbetering door LLM
Het project zal vooral gewaardeerd worden door ontwikkelaars die met documenten in hun applicaties moeten werken, maar niet afhankelijk willen zijn van commerciële API's of tijd willen besteden aan het implementeren van hun eigen OCR.
Er is een demo-versie beschikbaar voor testen, en alle vragen kunnen worden besproken in de Discord-community van het project.
Gerelateerde projecten