Zum Hauptinhalt springen
Nexoria
Jetzt starten

Nexoria Audio & Texterkennung

Audio und Texterkennung: Aufnahmen und Scans durchsuchbar machen

Aufnahmen, Scans und Bilder in durchsuchbaren Text verwandeln. Damit auch diese Inhalte in Ihrem Firmenwissen ankommen.

Audio & Texterkennung kennenlernen

Gesprochenes erschließen.

Audiodateien transkribieren, ohne die Aufnahme von Hand abzutippen.

Scans lesbar machen.

Texte aus gescannten Dokumenten und Bildern erkennen.

Wissen weiterverwenden.

Erkannte Inhalte in der Dokumentensuche finden und in Nex nutzen.

Audio & Texterkennung · Aufnahme

Ein Gespräch als Datei.
Ein Text zum Weiterarbeiten.

  • Audiodateien als MP3, WAV, M4A oder OGG hochladen.
  • Die Transkription startet automatisch beim Hochladen.
  • Den erkannten Text in die Wissensbasis des Workspaces übernehmen.
Unterstützte Formate ansehen

Audio & Texterkennung · Scans

Aus gescannten Seiten
wird auffindbarer Inhalt.

  • Texte in gescannten PDFs und Bildern erkennen.
  • JPG, PNG, BMP und WebP als Bildformate verarbeiten.
  • Erkannte Inhalte automatisch indexieren lassen.
Die Verarbeitung ansehen

Audio & Texterkennung · Firmenwissen

Nicht nur erfassen.
Auch wiederfinden.

  • Den erkannten Text über die Dokumentensuche finden.
  • Treffer mit Quellenangabe dem Ausgangsdokument zuordnen.
  • Inhalte in Nex zusammenfassen und weiterverarbeiten.
Alle Funktionen ansehen

Wie die Verarbeitung abläuft

Hochgeladen wird in Nexoria Drive, gefunden wird über die Dokumentensuche. Ein erkannter Scan kann anschließend als Quelle für eine Ausarbeitung dienen, etwa für einen Bericht, den Nex direkt im KI-Chat erstellt. Bearbeitet wird der Text danach in den Anwendungen von Nexoria Office.

  1. Schritt 1

    Datei in die Wissensbasis hochladen

    Audio- und Bilddateien werden beim Hochladen automatisch verarbeitet. Ein gesonderter Auftrag ist nicht nötig.

  2. Schritt 2

    Transkription oder Texterkennung

    Aufnahmen werden in Text umgewandelt, gescannte Dokumente und Bilder per Texterkennung gelesen.

  3. Schritt 3

    Erkannten Text indexieren

    Das Ergebnis wird Teil der Wissensbasis des Workspaces und indexiert, wie jeder andere freigegebene Inhalt auch.

  4. Schritt 4

    Suchen und weiterverwenden

    Die Dokumentensuche durchsucht die Inhalte eines Workspaces semantisch und nennt zu jedem Ergebnis die Quelle. Die Angabe beschreibt die Funktionsweise der Suche, nicht ihre Trefferqualität. Im KI-Chat Nex lässt sich der Inhalt zusammenfassen oder weiterverarbeiten.

Nexoria Audio & Texterkennung · Ablauf
01von 4 Schritten
  1. 1Datei in die Wissensbasis hochladenDieser Schritt ist geöffnet
  2. 2Transkription oder Texterkennung
  3. 3Erkannten Text indexieren
  4. 4Suchen und weiterverwenden
Erklärgrafik · Ablauf passend zum ausgewählten Schritt

Nexoria Audio & Texterkennung im Detail

Alles, was Sie wissen möchten.

Audio und Texterkennung erschließt Inhalte, die als Datei vorliegen, aber nicht als Text: Aufnahmen werden transkribiert, Scans und Bilder per Texterkennung gelesen. Die Verarbeitung startet automatisch beim Hochladen. Danach steht der erkannte Text in der Wissensbasis, ist über die Dokumentensuche auffindbar und im KI-Chat Nex verwendbar. Audio kommt als MP3, WAV, M4A oder OGG, Scans als PDF, JPG, PNG, BMP oder WebP.

Stand

Definition

Was Audio und Texterkennung ist

Ein Satz

Transkription und Texterkennung machen Audio, Scans und Bilder durchsuchbar und als Firmenwissen nutzbar.

Zwei Verfahren stecken dahinter. Transkription wandelt gesprochene Sprache aus einer Aufnahme in Text um. Texterkennung, auch OCR für optical character recognition, erkennt geschriebene Zeichen in einem Bild und gibt sie als Text zurück. Beide lösen dasselbe Problem: Eine Datei enthält Inhalt, aber keine Zeichenkette, nach der sich suchen ließe.

Produktsteckbrief

Audio und Texterkennung

Transkription und Texterkennung machen Audio, Scans und Bilder durchsuchbar und als Firmenwissen nutzbar.

Kategorie
Transkription und Texterkennung
Problem
Ersetzt manuelle Transkription und manuelle Erfassung gescannter Unterlagen.
Zielgruppe
Unternehmen, das Angebot richtet sich an Unternehmer im Sinne des § 14 BGB.
Kernfunktionen
  • Audio transkribieren
  • Texte aus Scans erkennen
  • Inhalte indexieren
  • Ergebnisse durchsuchen
Eingabe
Audiodateien, Scans und Bilder
Ausgabe
Durchsuchbarer Text, der indexiert und in Nex genutzt werden kann
Integration in Nexoria
Teil des Basisprodukts, erkannte Inhalte stehen anschließend in Nex und in der Dokumentensuche bereit.
Datenschutz
Die Angaben zu Verarbeitung, lokaler Analyse und Mandantentrennung stehen im Abschnitt Datenschutz und Infrastruktur auf dieser Seite.
Hosting
Server in deutschen Rechenzentren, Verarbeitungsorte je Komponente auf der Seite Sicherheit und Datenschutz.
Status
Funktion verfügbar. Registrierung und Online-Kauf der Tarife Base und Pro sind seit dem 15.09.2026 verfügbar.

Problem

Welches Problem gelöst wird

Ein großer Teil des Firmenwissens liegt in Formen, die keine Suche erreicht. Der Aktenordner mit den Verträgen aus den Jahren vor der Digitalisierung ist eingescannt, aber jede Seite ist ein Bild. Die Aufzeichnung des Kundengesprächs liegt als Audiodatei im Ordner, und was darin gesagt wurde, weiß nur, wer dabei war.

Solange diese Inhalte nicht als Text vorliegen, sind sie für eine Suche und für einen KI-Assistenten nicht vorhanden. Nicht schlecht auffindbar, sondern schlicht nicht vorhanden. Wer sie braucht, blättert oder hört ab. Genau diese Lücke schließt der Schritt, den diese Seite beschreibt.

Fakten

Unterstützte Formate

Diese Dateien verarbeitet Nexoria automatisch beim Hochladen.. Stand .
VerfahrenFormate und ErgebnisFundstelle
TranskriptionMP3, WAV, M4A und OGG werden beim Hochladen in Text umgewandelt. Der transkribierte Text ist danach über die Wissenssuche durchsuchbar.Plattform-Anleitung, Abschnitt Audio und Texterkennung
geprüft am
TexterkennungPDF, JPG, PNG, BMP und WebP werden gelesen, der erkannte Text ist nach dem Hochladen in der Wissensbasis durchsuchbar.Plattform-Anleitung, Abschnitt Audio und Texterkennung
geprüft am
Start der Verarbeitungautomatisch beim Hochladen, Audiodateien werden transkribiert, gescannte Dokumente per Texterkennung gelesenPlattform-Anleitung, Abschnitt Audio und Texterkennung
geprüft am
Ergebnisdurchsuchbarer Text, der indexiert und in Nex genutzt werden kannProduktübersicht, Baustein Audio und Texterkennung
geprüft am

Voraussetzungen

Voraussetzungen

  • Ein Nexoria-Zugang im Tarif Base oder Pro. Audio und Texterkennung gehört zum Basisprodukt.
  • Ein Workspace, in dessen Wissensbasis die Dateien abgelegt werden. Die Freigabe des Workspaces entscheidet, wer den erkannten Text später findet.
  • Dateien in einem der oben genannten Formate: MP3, WAV, M4A und OGG für Audio, PDF, JPG, PNG, BMP und WebP für Scans und Bilder.
  • Speicherplatz im Tarif: 10 GB je Unternehmen im Tarif Base, 20 GB im Tarif Pro, darüber hinaus 1,00 Euro je GB und Monat.

Verarbeitung

Datenschutz und Infrastruktur

Speicherung, semantische Suche und KI-Antworten: getrennte Datenwege für Dateien und die daraus erschlossenen Inhalte.. Stand .
MerkmalAngabeFundstelle
HostingDateien, Wissensindex und semantische Suche laufen auf dedizierten Servern in Deutschland. Website und Dashboard werden ebenfalls in Deutschland gehostet.Sicherheit und Datenschutz
geprüft am
Einbettungen und KI-AntwortenDokument-Embeddings werden lokal auf den deutschen Servern berechnet. Die Antwortgenerierung durch Nex nutzt Mistral AI.Sicherheit und Datenschutz
geprüft am
Dateiablage, Index und SucheDateiablage, Wissensindex und semantische Suche werden auf dedizierten Servern in Deutschland betrieben.Sicherheit und Datenschutz
geprüft am
MandantentrennungStrikte Datenisolierung pro Mandant auf Datenbank- und Vektorspeicher-Ebene, Rollenmodell mit Admin, Mitglied und Betrachter, serverseitige Berechtigungsprüfung auf jedem API-Endpunkt.Sicherheit und Datenschutz
geprüft am

Beleg

In der geprüften Mistral-Organisation von Nexoria ist die Nutzung neuer API-Interaktionen für Modelltraining deaktiviert (Kontoprüfung vom 26.09.2026). Diese Einstellung gilt für die dort verarbeiteten neuen Interaktionen. Für optional verbundene eigene KI-Konten gelten die Einstellungen des jeweiligen Kontos.

Fundstelle: Nexoria auf einen Blick. Geprüft am .

Welche Komponente wo verarbeitet wird, führt die Seite Sicherheit und Datenschutz einzeln auf, einschließlich der dort benannten Ausnahmen.

Funktionsumfang

Konkrete Funktionen

  • Audiodateien transkribieren, ohne die Aufnahme abzutippen.
  • Text aus gescannten Dokumenten und Bildern erkennen.
  • Erkannte Inhalte indexieren und damit in die Wissensbasis überführen.
  • Ergebnisse über die Dokumentensuche finden, mit Quellenangabe je Treffer.
  • Erkannten Text im KI-Chat Nex zusammenfassen und weiterverarbeiten.

Typische Anlässe sind Gesprächsnotizen, die erschlossen werden sollen, Altakten, die digital durchsuchbar werden müssen, und Scans, die in das Firmenwissen gehören.

Einordnung

Vergleich zur manuellen Erfassung

Automatische Verarbeitung beim Hochladen und die bisherige Handarbeit im Vergleich.. Stand .
KriteriumAudio und TexterkennungManuelle Transkription und Erfassung
Auslöserautomatisch beim Hochladen der Dateieine Person setzt sich hin und tippt ab
ErgebnisortText in der Wissensbasis des Workspaces, indexiertTextdatei im Ordner, nicht zwingend im Wissensbestand
Auffindbarkeitüber die Dokumentensuche, mit Quellenangabe je Treffernur, wenn jemand die Datei benannt und abgelegt hat
Weiterverwendungim KI-Chat Nex, auch als Quelle für Berichte und Präsentationenerneutes Kopieren in das jeweilige Werkzeug
Prüfung des ErgebnissesAbgleich mit der Ausgangsdatei über die Quellenangabe je TrefferKorrekturlesen des abgetippten Texts

Hinweise

Gute Ergebnisse vorbereiten

  • Verarbeitet werden Audio als MP3, WAV, M4A und OGG sowie Scans und Bilder als PDF, JPG, PNG, BMP und WebP.
  • Prüfen Sie den erkannten Text vor der geschäftlichen Verwendung. Wo es auf den genauen Wortlaut ankommt, etwa bei einer Vertragsklausel, ordnen Sie den Treffer über die Quellenangabe dem Ausgangsdokument zu und gleichen die Stelle dort ab.
  • Die Verarbeitung startet, sobald Sie eine Datei in die Wissensbasis eines Workspaces hochladen. Papierakten scannen Sie dafür zuerst ein.

FAQ

Häufige Fragen zu Audio und Texterkennung

Welche Audioformate werden transkribiert?

MP3, WAV, M4A und OGG. Wird eine solche Datei in die Wissensbasis hochgeladen, wird sie in Text umgewandelt. Der transkribierte Text ist anschließend über die Suche auffindbar.

Welche Formate erkennt die Texterkennung?

PDF, JPG, PNG, BMP und WebP. Wird ein gescanntes Dokument oder ein Bild hochgeladen, erkennt die Texterkennung den enthaltenen Text automatisch. Nach dem Hochladen ist der erkannte Text in der Wissensbasis durchsuchbar.

Muss ich die Verarbeitung manuell starten?

Nein. Audio- und Bilddateien werden beim Hochladen automatisch verarbeitet, Audiodateien transkribiert, gescannte Dokumente per Texterkennung gelesen. Ein gesonderter Auftrag im Chat ist dafür nicht nötig.

Was passiert mit dem erkannten Text?

Er wird Teil der Wissensbasis und indexiert. Danach steht er in der Dokumentensuche zur Verfügung, die die Inhalte eines Workspaces semantisch durchsucht und zu jedem Ergebnis die Quelle nennt, und er lässt sich im KI-Chat Nex weiterverwenden.

Wofür wird das im Arbeitsalltag gebraucht?

Für drei wiederkehrende Fälle: Gesprächsnotizen aus Aufnahmen erschließen, Altakten digital durchsuchbar machen und Scans in das Firmenwissen überführen. Gemeinsam ist ihnen, dass der Inhalt vorhanden, aber als Text bisher nicht auffindbar ist.

Wo werden Aufnahmen und Scans verarbeitet?

Dateien, Wissensindex und semantische Suche laufen auf dedizierten Servern in Deutschland. Dokument-Embeddings werden lokal auf diesen Servern berechnet. Die Antwortgenerierung durch Nex nutzt Mistral AI. In der geprüften Mistral-Organisation von Nexoria ist die Nutzung neuer API-Interaktionen für Modelltraining deaktiviert (Kontoprüfung vom 26.09.2026). Diese Einstellung gilt für die dort verarbeiteten neuen Interaktionen. Für optional verbundene eigene KI-Konten gelten die Einstellungen des jeweiligen Kontos.

Nächster Schritt

Mit dem eigenen Bestand anfangen

Nehmen Sie einen Ordner mit Scans und eine Gesprächsaufnahme. Wir laden beides in eine Testumgebung, und Sie suchen anschließend selbst nach einer Passage, von der Sie wissen, dass sie darin vorkommt. Danach lässt sich beurteilen, was der Schritt für Ihren Bestand bringt.