Zum Hauptinhalt springen

Produkt / Audio und Texterkennung

Aufnahmen und Scans durchsuchbar machen

Audio und Texterkennung erschließt Inhalte, die als Datei vorliegen, aber nicht als Text: Aufnahmen werden transkribiert, Scans und Bilder per Texterkennung gelesen. Die Verarbeitung startet automatisch beim Hochladen. Danach steht der erkannte Text in der Wissensbasis, ist über die Dokumentensuche auffindbar und im KI Chat Nex verwendbar. Audio kommt als MP3, WAV, M4A oder OGG, Scans als PDF, JPG, PNG, BMP oder WebP.

Stand

Definition

Was Audio und Texterkennung ist

Ein Satz

Transkription und Texterkennung machen Audio, Scans und Bilder durchsuchbar und als Firmenwissen nutzbar.

Zwei Verfahren stecken dahinter. Transkription wandelt gesprochene Sprache aus einer Aufnahme in Text um. Texterkennung, auch OCR für optical character recognition, erkennt geschriebene Zeichen in einem Bild und gibt sie als Text zurück. Beide lösen dasselbe Problem: Eine Datei enthält Inhalt, aber keine Zeichenkette, nach der sich suchen ließe.

Produktsteckbrief

Audio und Texterkennung

Transkription und Texterkennung machen Audio, Scans und Bilder durchsuchbar und als Firmenwissen nutzbar.

Kategorie
Transkription und Texterkennung
Problem
Ersetzt manuelle Transkription und manuelle Erfassung gescannter Unterlagen.
Zielgruppe
Unternehmen, das Angebot richtet sich an Unternehmer im Sinne des § 14 BGB.
Kernfunktionen
  • Audio transkribieren
  • Texte aus Scans erkennen
  • Inhalte indexieren
  • Ergebnisse durchsuchen
Eingabe
Audiodateien, Scans und Bilder
Ausgabe
Durchsuchbarer Text, der indexiert und in Nex genutzt werden kann
Integration in Nexoria
Teil des Basisprodukts, erkannte Inhalte stehen anschließend in Nex und in der Dokumentensuche bereit.
Datenschutz
Die Angaben zu Verarbeitung, lokaler Analyse und Mandantentrennung stehen im Abschnitt Datenschutz und Infrastruktur auf dieser Seite.
Hosting
Server in deutschen Rechenzentren, Verarbeitungsorte je Komponente auf der Seite Sicherheit und Datenschutz.
Status
nicht hinterlegt

Problem

Welches Problem gelöst wird

Ein großer Teil des Firmenwissens liegt in Formen, die keine Suche erreicht. Der Aktenordner mit den Verträgen aus den Jahren vor der Digitalisierung ist eingescannt, aber jede Seite ist ein Bild. Die Aufzeichnung des Kundengesprächs liegt als Audiodatei im Ordner, und was darin gesagt wurde, weiß nur, wer dabei war.

Solange diese Inhalte nicht als Text vorliegen, sind sie für eine Suche und für einen KI-Assistenten nicht vorhanden. Nicht schlecht auffindbar, sondern schlicht nicht vorhanden. Wer sie braucht, blättert oder hört ab. Genau diese Lücke schließt der Schritt, den diese Seite beschreibt.

Funktionsweise

Wie die Verarbeitung abläuft

  1. Schritt 1

    Datei in die Wissensbasis hochladen

    Audio- und Bilddateien werden beim Hochladen automatisch verarbeitet. Ein gesonderter Auftrag ist nicht nötig.

  2. Schritt 2

    Transkription oder Texterkennung

    Aufnahmen werden in Text umgewandelt, gescannte Dokumente und Bilder per Texterkennung gelesen.

  3. Schritt 3

    Erkannten Text indexieren

    Das Ergebnis wird Teil der Wissensbasis des Workspaces und indexiert, wie jeder andere freigegebene Inhalt auch.

  4. Schritt 4

    Suchen und weiterverwenden

    Die Dokumentensuche durchsucht die Inhalte eines Workspaces semantisch und nennt zu jedem Ergebnis die Quelle. Im KI Chat Nex lässt sich der Inhalt zusammenfassen oder weiterverarbeiten.

Hochgeladen wird in Nexoria Drive, gefunden wird über die Dokumentensuche. Ein erkannter Scan kann anschließend als Quelle für eine Ausarbeitung dienen, etwa für einen Bericht aus DocStudio. Bearbeitet wird der Text danach in den Anwendungen von Nexoria Office.

Fakten

Unterstützte Formate

Welche Dateien beim Hochladen verarbeitet werden. Es sind ausschließlich die Formate genannt, die in der Plattform-Anleitung stehen.. Stand .
VerfahrenFormate und ErgebnisFundstelle
TranskriptionMP3, WAV, M4A und OGG werden beim Hochladen in Text umgewandelt. Der transkribierte Text ist danach über die Wissenssuche durchsuchbar.Plattform-Anleitung, Abschnitt Audio und Texterkennung
geprüft am
TexterkennungPDF, JPG, PNG, BMP und WebP werden gelesen, der erkannte Text ist nach dem Hochladen in der Wissensbasis durchsuchbar.Plattform-Anleitung, Abschnitt Audio und Texterkennung
geprüft am
Start der Verarbeitungautomatisch beim Hochladen, Audiodateien werden transkribiert, gescannte Dokumente per Texterkennung gelesenPlattform-Anleitung, Abschnitt Audio und Texterkennung
geprüft am
Ergebnisdurchsuchbarer Text, der indexiert und in Nex genutzt werden kannProduktübersicht, Baustein Audio und Texterkennung
geprüft am

Voraussetzungen

Voraussetzungen

  • Ein Nexoria-Zugang im Tarif Base oder Pro. Audio und Texterkennung gehört zum Basisprodukt.
  • Ein Workspace, in dessen Wissensbasis die Dateien abgelegt werden. Die Freigabe des Workspaces entscheidet, wer den erkannten Text später findet.
  • Dateien in einem der oben genannten Formate. Andere Formate stehen in der Anleitung nicht und werden hier deshalb nicht zugesichert.
  • Speicherplatz im Tarif: 10 GB je Unternehmen im Tarif Base, 20 GB im Tarif Pro, darüber hinaus 0,20 Euro je GB und Monat.

Verarbeitung

Datenschutz und Infrastruktur

Wo Aufnahmen, Scans und der daraus erkannte Text verarbeitet werden. Die Formulierungen stammen unverändert aus der Claim-Registry des Unternehmens.. Stand .
MerkmalAngabeFundstelle
HostingDateien, Index, Suche und Antwortaufbereitung laufen auf dedizierten Servern in deutschen Rechenzentren. Website und Dashboard werden ebenfalls in Deutschland gehostet.Sicherheit und Datenschutz
geprüft am
Lokale VerarbeitungDokument-Embeddings, Analyse und semantische Suche laufen vollständig lokal auf deutschen Servern.Sicherheit und Datenschutz
geprüft am
Public CloudDie Plattform läuft ohne Public-Cloud-Infrastruktur wie AWS, Azure oder Google Cloud.Sicherheit und Datenschutz
geprüft am
MandantentrennungStrikte Datenisolierung pro Mandant auf Datenbank- und Vektorspeicher-Ebene, Rollenmodell mit Admin, Mitglied und Betrachter, serverseitige Berechtigungsprüfung auf jedem API-Endpunkt.Sicherheit und Datenschutz
geprüft am

Beleg

Inhalte aus der Plattform werden nicht zum Trainieren von KI-Modellen verwendet. Mistral AI sichert für den API-Betrieb zu, dass über die Schnittstelle gesendete Daten nicht in das Modelltraining einfließen. Festgeschrieben im Auftragsverarbeitungsvertrag. Dazu gehört die Einschränkung: Die Herstellerdokumentation von Mistral AI beschreibt daneben ein Training als Verantwortlicher, soweit der Kunde nicht widersprochen hat.

Fundstelle: Nexoria auf einen Blick. Geprüft am .

Welche Komponente wo verarbeitet wird, führt die Seite Sicherheit und Datenschutz einzeln auf, einschließlich der dort benannten Ausnahmen.

Funktionsumfang

Konkrete Funktionen

  • Audiodateien transkribieren, ohne die Aufnahme abzutippen.
  • Text aus gescannten Dokumenten und Bildern erkennen.
  • Erkannte Inhalte indexieren und damit in die Wissensbasis überführen.
  • Ergebnisse über die Dokumentensuche finden, mit Quellenangabe je Treffer.
  • Erkannten Text im KI Chat Nex zusammenfassen und weiterverarbeiten.

Typische Anlässe sind Gesprächsnotizen, die erschlossen werden sollen, Altakten, die digital durchsuchbar werden müssen, und Scans, die in das Firmenwissen gehören.

Einordnung

Vergleich zur manuellen Erfassung

Automatische Verarbeitung beim Hochladen und die bisherige Handarbeit im Vergleich.. Stand .
KriteriumAudio und TexterkennungManuelle Transkription und Erfassung
Auslöserautomatisch beim Hochladen der Dateieine Person setzt sich hin und tippt ab
ErgebnisortText in der Wissensbasis des Workspaces, indexiertTextdatei im Ordner, nicht zwingend im Wissensbestand
Auffindbarkeitüber die Dokumentensuche, mit Quellenangabe je Treffernur, wenn jemand die Datei benannt und abgelegt hat
Weiterverwendungim KI Chat Nex und als Quelle für DocStudioerneutes Kopieren in das jeweilige Werkzeug
Prüfung des Ergebnissesbleibt nötig, das Ergebnis ist eine maschinelle Umsetzungbleibt ebenfalls nötig, Tippfehler entstehen auch hier

Grenzen

Grenzen

  • Verarbeitet werden die oben genannten Formate. Für andere Dateiarten wird an dieser Stelle nichts zugesichert, weil die Anleitung sie nicht führt.
  • Zur Erkennungsgüte veröffentlichen wir keine Quote. Es liegt keine Messung vor, die eine solche Angabe tragen würde, und eine geschätzte Zahl wäre keine Angabe, sondern eine Behauptung.
  • Das Ergebnis ist eine maschinelle Umsetzung. Wo es auf den Wortlaut ankommt, etwa bei einer Vertragsklausel, gehört der Abgleich mit dem Original dazu.
  • Was nicht in der Wissensbasis eines Workspaces liegt, wird auch nicht verarbeitet. Der Weg beginnt beim Hochladen, nicht beim Aktenschrank.

FAQ

Häufige Fragen zu Audio und Texterkennung

Welche Audioformate werden transkribiert?

MP3, WAV, M4A und OGG. Wird eine solche Datei in die Wissensbasis hochgeladen, wird sie in Text umgewandelt. Der transkribierte Text ist anschließend über die Suche auffindbar.

Welche Formate erkennt die Texterkennung?

PDF, JPG, PNG, BMP und WebP. Wird ein gescanntes Dokument oder ein Bild hochgeladen, erkennt die Texterkennung den enthaltenen Text automatisch. Nach dem Hochladen ist der erkannte Text in der Wissensbasis durchsuchbar.

Muss ich die Verarbeitung manuell starten?

Nein. Audio- und Bilddateien werden beim Hochladen automatisch verarbeitet, Audiodateien transkribiert, gescannte Dokumente per Texterkennung gelesen. Ein gesonderter Auftrag im Chat ist dafür nicht nötig.

Was passiert mit dem erkannten Text?

Er wird Teil der Wissensbasis und indexiert. Danach steht er in der Dokumentensuche zur Verfügung, die die Inhalte eines Workspaces semantisch durchsucht und zu jedem Ergebnis die Quelle nennt, und er lässt sich im KI Chat Nex weiterverwenden.

Wofür wird das im Arbeitsalltag gebraucht?

Für drei wiederkehrende Fälle: Gesprächsnotizen aus Aufnahmen erschließen, Altakten digital durchsuchbar machen und Scans in das Firmenwissen überführen. Gemeinsam ist ihnen, dass der Inhalt vorhanden, aber als Text bisher nicht auffindbar ist.

Wo werden Aufnahmen und Scans verarbeitet?

Dateien, Index, Suche und Antwortaufbereitung laufen auf dedizierten Servern in deutschen Rechenzentren. Dokument-Embeddings, Analyse und semantische Suche laufen vollständig lokal auf deutschen Servern. Inhalte aus der Plattform werden nicht zum Trainieren von KI-Modellen verwendet, festgeschrieben im Auftragsverarbeitungsvertrag. Dazu gehört die Einschränkung: Die Herstellerdokumentation von Mistral AI beschreibt daneben ein Training als Verantwortlicher, soweit der Kunde nicht widersprochen hat.

Nächster Schritt

Mit dem eigenen Bestand anfangen

Nehmen Sie einen Ordner mit Scans und eine Gesprächsaufnahme. Wir laden beides in eine Testumgebung, und Sie suchen anschließend selbst nach einer Passage, von der Sie wissen, dass sie darin vorkommt. Danach lässt sich beurteilen, was der Schritt für Ihren Bestand bringt.