diff --git a/Aufzeichnung.mp3 b/Aufzeichnung.mp3 new file mode 100644 index 0000000..6fa1f8b Binary files /dev/null and b/Aufzeichnung.mp3 differ diff --git a/test_PDFandJPG.py b/test_PDFandJPG.py new file mode 100644 index 0000000..580f23e --- /dev/null +++ b/test_PDFandJPG.py @@ -0,0 +1,25 @@ +import pymupdf +import io +from PIL import Image +import pytesseract + +pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract-OCR\tesseract.exe' + +def extrahiere_text_und_bilder(pdf_datei): + doc = pymupdf.open(pdf_datei) + text = "" + for seite in doc: + text += seite.get_text() + for bild in seite.get_images(full=True): + xref = bild[0] + basis_bild = doc.extract_image(xref) + bild_daten = basis_bild["image"] + bild_objekt = Image.open(io.BytesIO(bild_daten)) + bild_text = pytesseract.image_to_string(bild_objekt, lang="deu") + text += " " + bild_text + return text + +pdf_datei = 'any.pdf' +text = extrahiere_text_und_bilder(pdf_datei) + +print(text) \ No newline at end of file diff --git a/test_mp3parser.py b/test_mp3parser.py new file mode 100644 index 0000000..c6d90b8 --- /dev/null +++ b/test_mp3parser.py @@ -0,0 +1,12 @@ +import whisper +import json + + +model = whisper.load_model('tiny') + + +result = model.transcribe(str("Aufzeichnung.mp3"), language='de', verbose=True) + +# Dump the results to a JSON file +with open('transcript.json', "w") as file: + json.dump(result['text'], file, indent=4) \ No newline at end of file diff --git a/transcript.json b/transcript.json new file mode 100644 index 0000000..800feea --- /dev/null +++ b/transcript.json @@ -0,0 +1 @@ +" Hallo, das ist ein Test, Hello World." \ No newline at end of file