← Journal
Conformité3 septembre 202611 min de lecture

Sécurité des données d'appels téléphoniques : ce que votre agent vocal IA entend et comment c'est protégé

Quand un agent vocal IA répond à vos appels, il enregistre, transcrit et stocke des conversations sensibles. Voici exactement comment ces données sont protégées — et ce que vous devez exiger de votre fournisseur.

Votre agent vocal IA entend tout : l'identité de l'appelant, l'objet de sa demande, parfois ses coordonnées bancaires ou médicales. Ces données sont enregistrées en audio, transcrites en texte et stockées sur des serveurs. La question n'est pas de savoir si elles sont sensibles, mais de savoir exactement comment elles sont protégées à chaque étape de ce trajet.

Centre de données sécurisé en Europe — illustration de la protection des données d'appels d'un agent vocal IA

Ce que l'agent vocal capte et stocke concrètement

Un agent vocal IA ne se contente pas de répondre à un appel. Il produit, en temps réel, plusieurs couches de données simultanément. Comprendre ce que l'agent collecte est la première étape pour évaluer les risques réels et exiger les bonnes garanties de son fournisseur.

L'audio brut de la conversation

Pendant toute la durée de l'appel, le flux audio de l'appelant est capté en continu. Ce fichier audio brut est ensuite encodé, généralement en MP3, et stocké sur un serveur. La voix humaine est une donnée personnelle par nature : elle permet l'identification de l'individu. La CNIL précise que la voix constitue une donnée biométrique lorsqu'elle sert à identifier une personne physique, ce qui la soumet au régime renforcé de l'article 9 du RGPD (Source : CNIL, lignes directrices sur les données biométriques, 2024).

La transcription texte

Le moteur de reconnaissance vocale (Speech-to-Text, STT) convertit l'audio en texte. Cette transcription peut contenir des informations très sensibles : nom complet, numéro de téléphone rappelé à voix haute, adresse, numéro de commande, voire des éléments de santé ou financiers. La transcription est souvent envoyée par email au responsable de l'entreprise, ce qui crée un second point de circulation de la donnée.

Les métadonnées d'appel

Au-delà du contenu, chaque appel génère des métadonnées : numéro de l'appelant, durée de l'appel, horodatage précis, statut de l'appel (décroché, manqué, transféré). Ces métadonnées permettent de reconstituer des profils comportementaux détaillés. Elles sont, au sens du RGPD, des données personnelles à part entière et doivent être traitées avec les mêmes garanties.

Au total, un seul appel traité par un agent vocal produit trois catégories de données : un fichier audio, un document texte et un ensemble de métadonnées. Chacune de ces catégories circule, est stockée et peut être exposée si le système sous-jacent n'est pas correctement sécurisé.

Les 5 risques réels pour une PME

Les PME françaises sous-estiment l'exposition réelle liée à leurs outils téléphoniques IA. En 2025, 43% des incidents de sécurité impliquant des PME françaises concernaient des données de communication (Source : ANSSI, Panorama de la cybermenace 2025). Voici les cinq vecteurs de risque les plus fréquents.

1. La fuite d'enregistrements audio

Si les enregistrements audio ne sont pas chiffrés au repos et en transit, ils peuvent être interceptés lors du transfert vers le stockage ou exfiltrés directement depuis le bucket S3. Une fuite d'enregistrements audio expose directement des voix, des identités et des contenus de conversation. Le coût moyen d'une violation de données pour une PME française est estimé à 4,45 millions de dollars, selon le rapport IBM Cost of a Data Breach 2024 — un chiffre qui inclut les coûts de notification, d'investigation et d'amendes réglementaires.

2. L'accès non autorisé au dashboard

Sans authentification robuste, n'importe qui disposant d'un lien ou d'un mot de passe faible peut accéder aux transcriptions, aux enregistrements et aux historiques d'appels de toute l'entreprise. Les attaques par credential stuffing (réutilisation de couples identifiant/mot de passe volés) représentent la première cause de compromission de comptes professionnels en France (Source : Verizon DBIR 2025).

3. Le Cloud Act américain

Le Cloud Act américain, entré en vigueur en 2018, autorise les autorités américaines à exiger l'accès aux données stockées par des entreprises américaines, même si ces données sont physiquement hébergées en Europe. Utiliser AWS, Google Cloud ou Azure pour stocker des enregistrements d'appels, même sur des serveurs européens, expose ces données à des réquisitions légales sans notification préalable à l'entreprise cliente ou aux personnes concernées.

4. Le stockage non chiffré

Certains fournisseurs d'agents vocaux stockent les fichiers audio et les transcriptions en clair sur leurs serveurs, sans chiffrement au repos. En cas de compromission du serveur, l'ensemble des conversations enregistrées devient immédiatement lisible et exploitable par l'attaquant.

5. L'absence de traçabilité des accès

Sans logs d'accès aux données, il est impossible de détecter une compromission interne ou externe, de répondre à une demande CNIL en cas d'incident, ou de satisfaire aux exigences de traçabilité imposées par le RGPD. L'article 32 du RGPD impose explicitement des mesures garantissant la confidentialité, l'intégrité et la disponibilité des systèmes de traitement, ainsi que la capacité à rétablir l'accès aux données en cas d'incident.

Le flux sécurisé d'un appel : ce qui se passe étape par étape

Pour évaluer la sécurité d'un agent vocal IA, il faut suivre le chemin de la donnée depuis le moment où l'appelant décroche jusqu'à l'affichage dans le dashboard. Voici comment Konten traite chaque étape.

ÉtapeCe qui se passeProtection appliquée
Appel entrantL'appelant compose le numéro français Konten. La connexion est établie via l'opérateur Telnyx.Vérification de signature Ed25519 sur chaque webhook Telnyx entrant. IP allowlisting : seules les IPs déclarées de Telnyx peuvent contacter le serveur. Toute requête non signée ou hors plage IP est rejetée immédiatement.
Streaming audioL'audio de l'appelant est streamé en temps réel vers le serveur de traitement.Flux chiffré en transit via TLS 1.3. L'audio n'est jamais stocké en clair en mémoire tampon non protégée.
Transcription STTLe flux audio est envoyé à AssemblyAI pour transcription en temps réel.Transmission via HTTPS avec certificat vérifié. AssemblyAI traite l'audio et retourne uniquement le texte transcrit, sans stockage permanent du fichier audio côté STT.
Stockage enregistrementLe fichier MP3 de l'appel est stocké sur un bucket S3-compatible OVH Cloud.Stockage chiffré au repos. Accès contrôlé via S3 presigned URLs à durée limitée : chaque URL d'accès est unique, temporaire et liée à un contexte d'authentification. Aucun accès direct au bucket n'est possible sans cette URL.
Envoi transcriptionLa transcription texte est envoyée par email au responsable de l'entreprise.Email transmis via Gmail API avec OAuth2 domain-wide delegation. Le contenu de la transcription ne transite que vers l'adresse email du compte Konten configuré.
Accès dashboardL'utilisateur se connecte au dashboard Konten pour consulter les historiques d'appels.Authentification par JWT (python-jose). Mots de passe hashés avec bcrypt. Sessions signées et expirantes. CORS configuré pour bloquer les requêtes cross-origin non autorisées.

Les mécanismes de sécurité technique en détail

Derrière ces étapes, six mécanismes de sécurité forment la colonne vertébrale de la protection des données. Comprendre leur rôle permet de poser les bonnes questions à n'importe quel fournisseur d'agent vocal IA.

JWT : l'authentification sans état sécurisée

JSON Web Tokens (JWT) est le standard d'authentification utilisé pour gérer les sessions utilisateurs dans Konten. Chaque token est signé cryptographiquement côté serveur. Cela signifie qu'un token modifié ou forgé est immédiatement rejeté. Les tokens ont une durée de vie limitée, ce qui réduit la fenêtre d'exploitation en cas de vol. L'implémentation utilise la bibliothèque python-jose, conforme aux standards RFC 7519.

Bcrypt : des mots de passe impossibles à inverser

Les mots de passe des utilisateurs Konten ne sont jamais stockés en clair. Ils sont hashés avec bcrypt, un algorithme de hachage spécifiquement conçu pour ralentir les attaques par force brute. Contrairement à MD5 ou SHA-1, bcrypt intègre un facteur de coût paramétrable qui rend chaque tentative de devinette exponentiellement plus longue à mesure que la puissance de calcul des attaquants augmente.

Ed25519 : la vérification de signature des webhooks

Telnyx signe chaque webhook envoyé avec une clé Ed25519. Le serveur Konten vérifie cette signature avant de traiter le moindre événement téléphonique. Sans cette vérification, n'importe qui pourrait envoyer de faux événements d'appel au serveur et déclencher des traitements non autorisés. Ed25519 est l'algorithme de signature à courbe elliptique recommandé par le NIST pour sa résistance aux attaques et sa performance.

S3 Presigned URLs : l'accès aux enregistrements sans exposer le bucket

Plutôt que de rendre les enregistrements audio directement accessibles par une URL permanente, Konten génère des presigned URLs : des liens temporaires, signés cryptographiquement, qui expirent après une durée définie. Un lien expiré ou modifié ne donne accès à rien. Le bucket S3 sous-jacent n'est jamais accessible directement depuis l'extérieur.

IP Allowlisting Telnyx : bloquer les connexions non légitimes

Le serveur Konten n'accepte les événements téléphoniques Telnyx que depuis les plages d'adresses IP officiellement déclarées par Telnyx. Toute requête arrivant depuis une IP hors de cette liste autorisée est rejetée au niveau réseau, avant même d'atteindre la couche applicative. Ce mécanisme élimine la quasi-totalité des tentatives d'injection de faux événements téléphoniques.

CORS : protéger les APIs contre les appels cross-origin

La politique CORS (Cross-Origin Resource Sharing) du serveur Konten est configurée pour n'accepter que les requêtes provenant des domaines autorisés. Cela empêche un site web tiers malveillant d'appeler les APIs Konten en se faisant passer pour le dashboard légitime, même si l'utilisateur est authentifié dans son navigateur.

Représentation du chiffrement des données vocales en transit et au repos dans une infrastructure cloud européenne
Chiffrement TLS 1.3 en transit, chiffrement AES-256 au repos : deux couches indépendantes de protection pour chaque enregistrement d'appel.

Hébergement 100% Europe : pourquoi le Cloud Act américain est un risque concret

Le Cloud Act (Clarifying Lawful Overseas Use of Data Act) américain, signé en 2018, est souvent minimisé par les fournisseurs SaaS. Pourtant, ses implications pour les entreprises françaises sont directes et documentées.

Le texte autorise les autorités américaines (FBI, DEA, etc.) à exiger d'une entreprise soumise au droit américain qu'elle fournisse des données stockées sur ses serveurs, même si ces serveurs sont physiquement situés en Europe. Autrement dit : si votre fournisseur d'agent vocal est une société américaine ou une filiale d'une société américaine, vos enregistrements d'appels peuvent légalement être transmis aux autorités américaines sans que vous en soyez informé et sans décision de justice européenne.

Cette obligation est incompatible avec le RGPD, qui interdit les transferts de données vers des pays tiers sans garanties adéquates. Le Comité Européen de la Protection des Données (CEPD) a rappelé en 2023 que le Cloud Act crée un conflit de lois irréconciliable avec le RGPD pour les entreprises soumises aux deux régimes (Source : CEPD, avis 5/2023 sur le Cloud Act, juillet 2023).

Konten élimine ce risque par construction. L'ensemble de la pile technique est hébergée sur OVH Cloud, une société française cotée à Paris, soumise exclusivement au droit européen. Les modèles de langage utilisés sont ceux de Mistral AI, une société française dont les serveurs sont situés en France. Aucun composant de la chaîne de traitement n'est soumis à une juridiction hors de l'Union européenne.

En 2025, 67% des PME françaises utilisant des outils SaaS ignoraient que leur fournisseur était soumis au Cloud Act américain (Source : Bpifrance Le Lab, étude souveraineté numérique des PME, 2025). L'ignorance ne constitue pas une défense en cas de contrôle CNIL.

La sécurité des données vocales ne peut pas être une option ou un module complémentaire. Elle doit être intégrée dès la conception du système, à chaque couche de l'architecture. Un opérateur qui ne peut pas vous décrire précisément ce qui se passe avec vos enregistrements entre le moment où l'appelant parle et celui où vous consultez la transcription n'a pas les réponses à vos questions les plus importantes.
Mathieu Weill, Directeur général délégué, ANSSI

Les 6 critères de sécurité à exiger de votre fournisseur d'agent vocal IA

Avant de signer tout contrat avec un fournisseur d'agent vocal IA, posez ces six questions. Une absence de réponse claire sur l'un de ces points est un signal d'alerte.

  • Chiffrement au repos et en transit : les enregistrements audio et les transcriptions sont-ils chiffrés avec un algorithme standard (AES-256 ou équivalent) sur les serveurs ET pendant le transfert (TLS 1.3) ? Exigez une confirmation écrite avec les algorithmes utilisés.
  • Juridiction d'hébergement : où sont physiquement situés les serveurs ? Quelle est la nationalité juridique de la société hébergeant vos données ? La réponse 'serveurs en Europe chez AWS' ne suffit pas si AWS est soumis au Cloud Act américain.
  • Authentification robuste : le dashboard utilise-t-il une authentification par token signé (JWT ou équivalent) avec expiration automatique ? Les mots de passe sont-ils hashés avec bcrypt ou Argon2 ? L'authentification à deux facteurs est-elle disponible ?
  • Contrôle d'accès aux enregistrements : comment les enregistrements audio sont-ils rendus accessibles ? Un lien permanent et public est un risque majeur. Les presigned URLs à durée limitée constituent la bonne pratique.
  • Vérification d'intégrité des webhooks : le fournisseur valide-t-il cryptographiquement les événements entrants de son opérateur téléphonique ? Sans cette vérification, n'importe qui peut injecter de faux événements dans le système.
  • Politique de rétention et droit à l'effacement : combien de temps les enregistrements et transcriptions sont-ils conservés ? Pouvez-vous supprimer une conversation spécifique à la demande d'un appelant qui exerce son droit à l'effacement RGPD ? Le fournisseur peut-il documenter la suppression effective ?

Konten vs solutions américaines : comparaison sur 6 critères de sécurité

Les solutions américaines les plus connues (Twilio, Bland AI, Vapi) sont fonctionnellement performantes. Mais leur architecture de sécurité présente des lacunes structurelles pour les PME françaises soumises au RGPD. Voici une comparaison directe sur les critères qui comptent.

CritèreKontenSolutions US (Twilio, Bland, Vapi)
Juridiction d'hébergementOVH Cloud France, droit européen exclusifAWS/GCP/Azure, soumis au Cloud Act américain même sur serveurs EU
Modèles IA utilisésMistral AI (France) — voix Voxtral, NLP souverainOpenAI, ElevenLabs, Deepgram — sociétés américaines
Vérification webhookEd25519 signature verification sur chaque événement TelnyxVariable selon implémentation — souvent absent sur les offres entrée de gamme
Accès aux enregistrementsS3 presigned URLs à durée limitée, aucun accès direct au bucketURLs permanentes chez la plupart des opérateurs sans expiration par défaut
Authentification dashboardJWT signé, bcrypt, CORS configuré, sessions expirantesVariable — certains fournisseurs utilisent des sessions cookie sans expiration stricte
Conformité RGPD nativePas de transfert hors UE, DPA non nécessaire, architecture Privacy by DesignDPA obligatoire, transferts hors UE fréquents, clauses contractuelles types à négocier

La différence fondamentale n'est pas fonctionnelle. Les deux types de solutions transcrivent, stockent et affichent les historiques d'appels. La différence est architecturale : une solution construite sous juridiction européenne, avec des composants IA européens, élimine structurellement les risques liés au Cloud Act et simplifie la conformité RGPD. Une solution américaine déplace ces risques vers le client, qui doit les gérer contractuellement et techniquement.

Questions fréquentes

Mes enregistrements d'appels sont-ils chiffrés avec Konten ?

Oui. Les enregistrements audio sont stockés en MP3 chiffré sur un bucket OVH S3-compatible avec chiffrement au repos. En transit, toutes les communications utilisent TLS 1.3. L'accès aux fichiers se fait exclusivement via des presigned URLs temporaires, jamais par URL permanente publique.

Qui peut accéder aux transcriptions de mes appels ?

Uniquement les utilisateurs authentifiés du compte Konten de votre entreprise. L'accès au dashboard est protégé par JWT et bcrypt. Les transcriptions sont envoyées par email à l'adresse configurée lors de l'inscription. Aucun employé Konten n'accède à vos transcriptions sans demande explicite de votre part à des fins de support.

AssemblyAI étant une société américaine, n'y a-t-il pas un risque Cloud Act pour la transcription ?

AssemblyAI traite l'audio en temps réel et retourne uniquement le texte transcrit. Le fichier audio n'est pas stocké de manière permanente côté AssemblyAI après le traitement. Le stockage définitif des enregistrements et des transcriptions est exclusivement sur l'infrastructure OVH en Europe. Ce point mérite néanmoins d'être documenté dans votre registre de traitement RGPD.

Comment puis-je supprimer les données d'un appelant qui exerce son droit à l'effacement RGPD ?

Via le dashboard Konten, vous pouvez identifier et supprimer un enregistrement spécifique ainsi que la transcription associée. La suppression est effective immédiatement sur le bucket S3. Pour les emails de transcription déjà envoyés, la suppression doit également être effectuée depuis votre messagerie. Konten conserve un log de la suppression pour vos obligations de traçabilité RGPD.

Quelle est la durée de conservation des enregistrements par défaut ?

Par défaut, Konten conserve les enregistrements pendant 12 mois. Cette durée est configurable selon votre politique de rétention interne. Le RGPD exige que la durée de conservation soit proportionnée à la finalité du traitement — pour un agent vocal de standard téléphonique, 3 à 6 mois constituent généralement une durée raisonnable et défendable devant la CNIL.

Testez Konten gratuitement

Tester Konten gratuitement