Text-Extract-Api: Dokumente in strukturierte Daten umwandeln ohne Kopfschmerzen
Benötigten Sie schon einmal Daten aus einem PDF-Bericht oder gescannten Dokument? Der vertraute Albtraum des manuellen Kopierens von Text, dem Kampf mit schiefen Tabellen und dem Verlust von Formeln? Text-Extract-Api bietet eine elegante Lösung für dieses Problem und kombiniert moderne OCR-Technologien mit Sprachmodellen.
Was ist dieses Tool?
Text-Extract-Api ist eine Python-API, mit der Sie:
- PDF-, Word-, PowerPoint-Dateien und Bilder in Markdown oder JSON konvertieren können
- Tabellen, Zahlen und mathematische Formeln extrahieren können
- Dokumente von persönlichen Daten (PII) bereinigen können
- Die Erkennungsqualität durch LLM-Modelle verbessern können (Llama 3, MiniCPM und andere)
Der Hauptvorteil ist, dass alles lokal funktioniert, ohne Daten an Cloud-Dienste zu senden.
Wichtige Funktionen
1. Unterstützung verschiedener Formate und Erkennungsstrategien
Das Projekt unterstützt mehrere OCR-Engines:
- EasyOCR — für schnelle Texterkennung in über 30 Sprachen
- MiniCPM-V — Open-Source-Modell zur kommerziellen Nutzung
- Llama 3.2 Vision — am genauesten, aber ressourcenintensivste Option
- Remote API — zur Integration mit externen Diensten wie Marker PDF
Beispielbefehl für die Konvertierung:
python client/cli.py ocr_upload --file example.pdf --strategy easyocr
2. Textverbesserung durch LLM
Nach der Erkennung kann der Text weiterverarbeitet werden:
- OCR-Fehlerkorrektur
- Strukturierte Datenextraktion (z.B. Konvertierung eines medizinischen Berichts in JSON)
- Entfernung persönlicher Daten
python client/cli.py ocr_upload --file medical_report.pdf --prompt_file extract_to_json.txt --model llama3.1
3. Flexible Ergebnisspeicherung
Es werden verschiedene Strategien zur Speicherung verarbeiteter Dokumente unterstützt:
- Lokales Dateisystem
- Google Drive
- Amazon S3
Die Konfiguration über YAML-Dateien ermöglicht eine einfache Anpassung des Systems an Ihre Bedürfnisse.
Technische Details
Die Projektarchitektur basiert auf:
- FastAPI für die REST-API
- Celery für asynchrone Aufgabenverarbeitung
- Redis für das Caching von Ergebnissen
- Ollama für die Arbeit mit lokalen LLM-Modellen
Es werden zwei Bereitstellungsoptionen angeboten:
- Nativer Betrieb (nützlich für Mac mit Apple Silicon)
- Docker-Container (inkl. GPU-beschleunigter Version)
Praktische Anwendungen
Wo kann Text-Extract-Api nützlich sein?
Anwaltskanzleien können die Verarbeitung von Vertragsscans automatisieren und wichtige Klauseln in ein strukturiertes Format extrahieren.
Medizinische Einrichtungen erhalten ein Tool zur Konvertierung von Papierberichten in elektronische Akten ohne manuelle Dateneingabe.
Fintech-Startups können Kontoauszüge und Rechnungen analysieren und Daten für Buchhaltungssysteme extrahieren.
Forscher werden die Möglichkeit schätzen, alte Bücher und wissenschaftliche Arbeiten zu digitalisieren, wobei Formeln und Tabellen erhalten bleiben.
In 5 Minuten loslegen
- Docker und Ollama installieren
- Das Repository klonen:
git clone https://github.com/CatchTheTornado/text-extract-api.git
cd text-extract-api
- Die Dienste starten:
docker-compose up --build
- Konvertieren Sie Ihr erstes Dokument!
Text-Extract-Api bietet: ✅ Lokale Lösung ohne Datensendung an die Cloud ✅ Unterstützung vieler Formate und Sprachen ✅ Flexible Integration mit verschiedenen Speicheroptionen ✅ Qualitätsverbesserung durch LLM
Das Projekt wird besonders von Entwicklern geschätzt werden, die mit Dokumenten in ihren Anwendungen arbeiten müssen, aber nicht von kommerziellen APIs abhängig sein oder Zeit für die Implementierung eigener OCR-Lösungen aufwenden möchten.
Eine Demo-Version ist zum Testen verfügbar, und alle Fragen können in der Discord-Community des Projekts besprochen werden.
Ähnliche Projekte