>_ DevTrendsde

Sprache

Start

Sprachen

Bereiche

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicherheit
Python

Text-Extract-Api: Dokumente in strukturierte Daten umwandeln ohne Kopfschmerzen

Benötigten Sie schon einmal Daten aus einem PDF-Bericht oder gescannten Dokument? Der vertraute Albtraum des manuellen Kopierens von Text, dem Kampf mit schiefen Tabellen und dem Verlust von Formeln? Text-Extract-Api bietet eine elegante Lösung für dieses Problem und kombiniert moderne OCR-Technologien mit Sprachmodellen.

Was ist dieses Tool?

Text-Extract-Api ist eine Python-API, mit der Sie:

  • PDF-, Word-, PowerPoint-Dateien und Bilder in Markdown oder JSON konvertieren können
  • Tabellen, Zahlen und mathematische Formeln extrahieren können
  • Dokumente von persönlichen Daten (PII) bereinigen können
  • Die Erkennungsqualität durch LLM-Modelle verbessern können (Llama 3, MiniCPM und andere)

Der Hauptvorteil ist, dass alles lokal funktioniert, ohne Daten an Cloud-Dienste zu senden.

Wichtige Funktionen

1. Unterstützung verschiedener Formate und Erkennungsstrategien

Das Projekt unterstützt mehrere OCR-Engines:

  • EasyOCR — für schnelle Texterkennung in über 30 Sprachen
  • MiniCPM-V — Open-Source-Modell zur kommerziellen Nutzung
  • Llama 3.2 Vision — am genauesten, aber ressourcenintensivste Option
  • Remote API — zur Integration mit externen Diensten wie Marker PDF

Beispielbefehl für die Konvertierung:

python client/cli.py ocr_upload --file example.pdf --strategy easyocr

2. Textverbesserung durch LLM

Nach der Erkennung kann der Text weiterverarbeitet werden:

  • OCR-Fehlerkorrektur
  • Strukturierte Datenextraktion (z.B. Konvertierung eines medizinischen Berichts in JSON)
  • Entfernung persönlicher Daten
python client/cli.py ocr_upload --file medical_report.pdf --prompt_file extract_to_json.txt --model llama3.1

3. Flexible Ergebnisspeicherung

Es werden verschiedene Strategien zur Speicherung verarbeiteter Dokumente unterstützt:

  • Lokales Dateisystem
  • Google Drive
  • Amazon S3

Die Konfiguration über YAML-Dateien ermöglicht eine einfache Anpassung des Systems an Ihre Bedürfnisse.

Technische Details

Die Projektarchitektur basiert auf:

  • FastAPI für die REST-API
  • Celery für asynchrone Aufgabenverarbeitung
  • Redis für das Caching von Ergebnissen
  • Ollama für die Arbeit mit lokalen LLM-Modellen

Es werden zwei Bereitstellungsoptionen angeboten:

  1. Nativer Betrieb (nützlich für Mac mit Apple Silicon)
  2. Docker-Container (inkl. GPU-beschleunigter Version)

Praktische Anwendungen

Wo kann Text-Extract-Api nützlich sein?

Anwaltskanzleien können die Verarbeitung von Vertragsscans automatisieren und wichtige Klauseln in ein strukturiertes Format extrahieren.

Medizinische Einrichtungen erhalten ein Tool zur Konvertierung von Papierberichten in elektronische Akten ohne manuelle Dateneingabe.

Fintech-Startups können Kontoauszüge und Rechnungen analysieren und Daten für Buchhaltungssysteme extrahieren.

Forscher werden die Möglichkeit schätzen, alte Bücher und wissenschaftliche Arbeiten zu digitalisieren, wobei Formeln und Tabellen erhalten bleiben.

In 5 Minuten loslegen

  1. Docker und Ollama installieren
  2. Das Repository klonen:
git clone https://github.com/CatchTheTornado/text-extract-api.git
cd text-extract-api
  1. Die Dienste starten:
docker-compose up --build
  1. Konvertieren Sie Ihr erstes Dokument!

Text-Extract-Api bietet: ✅ Lokale Lösung ohne Datensendung an die Cloud ✅ Unterstützung vieler Formate und Sprachen ✅ Flexible Integration mit verschiedenen Speicheroptionen ✅ Qualitätsverbesserung durch LLM

Das Projekt wird besonders von Entwicklern geschätzt werden, die mit Dokumenten in ihren Anwendungen arbeiten müssen, aber nicht von kommerziellen APIs abhängig sein oder Zeit für die Implementierung eigener OCR-Lösungen aufwenden möchten.

Eine Demo-Version ist zum Testen verfügbar, und alle Fragen können in der Discord-Community des Projekts besprochen werden.

Ähnliche Projekte