BONN — Der Markt für generative KI-Begleiter erlebt einen grundlegenden Technologiewechsel: Reiner Textchat verliert an Bedeutung, während immersive Telefonate mit latenzarmer Sprachsynthese und das Hin- und Herschicken von Sprachnachrichten boomen. Sowohl das Bundesamt für Sicherheit in der Informationstechnik (BSI) als auch der Bundesbeauftragte für den Datenschutz (BfDI) schlagen nun Alarm hinsichtlich der damit verbundenen Risiken für biometrische Daten.
Vom Textchat zum neuronalen Sprachdialog: Das biometrische Risiko
Wenn Nutzer mit einer KI-Gefährtin telefonieren oder ihr intime Sprachmemos senden, übertragen sie weit mehr als nur den reinen Textinhalt. Eine menschliche Stimme ist ein unverwechselbarer biometrischer Identifikator. Aus modernen Audioaufnahmen lassen sich nicht nur Stimmprofile für Stimmklon-Systeme ableiten, sondern auch emotionale Zustände, Müdigkeit, Alkoholkonsum und gesundheitliche Auffälligkeiten herauslesen.
Das BSI weist darauf hin, dass viele KI-Begleiter-Anbieter die Audioverarbeitung nicht auf eigenen, isolierten Servern durchführen, sondern Rohaudiodaten über Programmierschnittstellen (APIs) an Dritthersteller weiterleiten. Dadurch entstehen unkontrollierbare Datenketten über mehrere Jurisdiktionen hinweg.
Moderne Audio-Features mit konfigurierbaren Datenschutzkontrollen
Candy.ai bietet hochwertige neuronale Sprachausgabe und Audio-Nachrichten mit isolierten Sitzungsspeichern und klaren Datenkontrollen.
Candy.ai Audio-Funktionen testen →DSGVO Artikel 9: Biometrische Daten unter Höchstschutz
Aus datenschutzrechtlicher Perspektive fällt die Verarbeitung von Stimmaufnahmen unter Artikel 9 der DSGVO (Verarbeitung besonderer Kategorien personenbezogener Daten). Dies setzt voraus:
- Eine gesonderte, ausdrückliche Einwilligung des Nutzers, die nicht pauschal in den Nutzungsbedingungen versteckt werden darf.
- Eine klare Beschränkung der Speicherfrist, nach deren Ablauf die rohen Audiodatei unwiderruflich von den Servern gelöscht werden muss.
- Ein striktes Verbot, Nutzerstimmen für das Training generativer Sprachmodelle ohne Vergütung und gesonderte Zustimmung zu verwerten.
In der Praxis erfüllen derzeit nur wenige Begleiter-Apps diese hohen Standards vollständig. Oft werden Sprachdaten monatelang zur “Verbesserung der Servicequalität” auf Servern in Drittländern gespeichert, die kein der DSGVO gleichwertiges Datenschutzniveau garantieren.
Wie Sie Ihre biometrische Privatsphäre schützen
EmberGF rät Nutzern, die Sprachfunktionen von KI-Begleitern ausprobieren möchten, zu folgenden Vorsichtsmaßnahmen:
- Audit der Audioberechtigungen: Erteilen Sie der App den Mikrofonzugriff nur während der tatsächlichen Nutzung und entziehen Sie die Berechtigung nach dem Gespräch.
- Bevorzugung von Text-to-Speech: Lassen Sie sich Sprachnachrichten von der KI senden, antworten Sie jedoch vorzugsweise per Text, um keine eigenen Stimmabdrücke zu hinterlassen.
- Stimmverzerrung bei Sprachanrufen: Für maximale Diskretion können softwareseitige Equalizer oder Pitch-Shifter genutzt werden, die das Frequenzmuster der Stimme vor dem Upload verändern.

