Une app d’enregistrement vocal utilise-t-elle vos enregistrements pour entraîner une IA sur iPhone ?
Réponse courte : une app ne peut pas entraîner un modèle avec un audio qu'elle ne reçoit jamais. La vraie question n'est pas ce que promet une politique de confidentialité, mais lesquels de vos enregistrements quittent réellement le téléphone — et pour l'essentiel de la transcription sur iPhone, « l'essentiel » n'est pas « tout ».
Entraîner un modèle suppose trois choses, dans l'ordre : l'audio doit atteindre un serveur quelque part, il doit être journalisé ou conservé plutôt que jeté, et il doit finir dans l'ensemble utilisé plus tard pour entraîner quelque chose. Chaque étape est un fait sur un système, pas une promesse sur une intention, ce qui fait de celle-ci l'une des rares questions de confidentialité dont la réponse se vérifie plutôt qu'elle ne se croit sur parole.
La question qui tranche réellement
Demandez d'abord « cette app a-t-elle un serveur par lequel passent mes enregistrements » avant de demander « les utiliserait-elle pour entraîner quelque chose ». Une app sans serveur à elle, sans compte et sans SDK d'analyse n'a nulle part où collecter un enregistrement au départ. C'est une garantie plus solide qu'une phrase dans une politique promettant de ne pas utiliser vos données, parce qu'elle ne dépend de la tenue d'aucune promesse : il n'y a tout simplement aucune infrastructure de l'autre côté où un enregistrement pourrait atterrir.
Le seul endroit où l'audio peut réellement quitter le téléphone
La transcription est l'endroit où une réponse nette du type « tout reste sur le téléphone » se complique. La majeure partie de la transcription sur iPhone, dans cette app comme dans presque toutes celles qui n'embarquent pas leur propre modèle vocal, s'appuie sur le framework Speech d'Apple, qui tente d'abord la reconnaissance sur l'appareil et, pour certaines langues et certains audios, réessaie contre le propre serveur d'Apple si cette passe locale revient vide ou échoue.
Ce repli mérite d'être nommé clairement plutôt que passé sous silence, parce que c'est exactement le cas où une affirmation « nous n'envoyons jamais votre audio nulle part » peut cesser d'être vraie sans que personne ne mente. Si une langue n'a pas de modèle local installé, ou si l'audio était trop faible, trop lointain ou trop long pour que la passe locale s'en charge, l'audio part vers le service vocal d'Apple pour être transcrit. C'est une voie propre à Apple, pas un tiers au milieu — mais c'est bel et bien de l'audio qui quitte l'appareil, et prétendre le contraire ne serait pas honnête.
À qui appartient la politique qui régit vraiment ces données
Ce qu'il advient de l'audio une fois arrivé au service vocal d'Apple — combien de temps il est conservé, si une partie sert à améliorer les propres modèles d'Apple — n'est pas quelque chose que le développeur d'une app contrôle, ni quelque chose qu'il peut promettre au nom d'Apple. C'est l'infrastructure d'Apple, couverte par la propre documentation de confidentialité d'Apple pour le framework Speech, la même qui couvre la dictée du clavier, puisque c'est le même service en dessous. Un développeur qui vous dit « vos enregistrements ne servent jamais à entraîner une IA » fait une affirmation sur ses propres systèmes. Il n'est pas en mesure de faire la même affirmation sur ce qui se passe une fois l'audio arrivé sur les serveurs d'Apple, et une réponse honnête le dit plutôt que de mélanger les deux.
Ce sont réellement deux risques distincts, qu'il vaut la peine de ne pas confondre. Le premier, c'est une entreprise sans lien avec Apple qui collecte votre voix sur un serveur construit exactement pour ça, sans autre explication à son existence. Le second, c'est un repli documenté et propre à Apple, à l'intérieur de la même fonction iOS qui fait déjà tourner la dictée sur chaque iPhone, régi par les engagements qu'Apple prend sur cette fonction en général. Aucun des deux n'est anodin — mais ce ne sont pas la même question, et une app qui ne répond qu'à l'une n'a pas vraiment répondu à celle-ci.
Ce que « pas de SDK d'analyse » écarte, séparément
Mettez la transcription de côté un instant. Beaucoup d'apps qui ne touchent jamais à vos enregistrements envoient malgré tout un journal continu de votre usage — quels écrans vous ouvrez, combien de temps vous y restez, ce que vous touchez — via un SDK d'analyse ou de publicité d'un tiers intégré à l'app. Ce flux n'est pas votre audio, mais reste une information sur vous qui quitte l'appareil vers une entreprise dont le métier entier consiste à agréger exactement ce genre de données, parfois à des fins qui recoupent l'entraînement de tout autre chose. Une app sans aucun SDK d'analyse n'a rien de tel à envoyer, quoi qu'elle fasse par ailleurs de l'audio.
Comment vérifier vous-même plutôt que de croire une affirmation
Vous n'avez rien de tout cela à croire sur parole. Le même test qui répond en général à la question local contre cloud répond à celle-ci : activez le mode Avion, enregistrez quelque chose, et transcrivez-le. Un texte qui revient a été produit entièrement sur le téléphone, puisqu'aucun réseau n'était disponible pour envoyer quoi que ce soit. S'il revient vide ou échoue, cela vous indique que cette langue et cet audio précis auraient emprunté le repli serveur si vous aviez été connecté — un fait sur cet enregistrement, pas une promesse marketing sur l'app.
Comment Voice Studio procède
Voice Studio n'a ni serveur à lui, ni compte, ni synchronisation CloudKit, ni SDK d'analyse — il n'y a aucune infrastructure de notre côté où un enregistrement pourrait être collecté, encore moins utilisé ensuite pour quoi que ce soit. La transcription tente d'abord la voie locale et ne bascule vers le service vocal d'Apple, exactement comme décrit ci-dessus, que si cette passe locale revient vide ou échoue ; quand c'est le cas, cet audio est traité par Apple, sous les engagements propres d'Apple pour le framework Speech, pas par nous. Si un enregistrement précis compte assez pour vouloir une certitude plutôt qu'une explication, le test du mode Avion ci-dessus s'applique ici exactement comme partout ailleurs où cette question se pose.
Questions fréquentes
Une app peut-elle entraîner un modèle d'IA avec ma voix si elle n'a pas de serveur ?
Pas de façon significative. Entraîner suppose que l'audio soit d'abord collecté quelque part, et une app sans serveur, sans compte et sans SDK d'analyse n'a nulle part où le collecter, quoi que dise une politique sur l'intention.
Apple utilise-t-il l'audio envoyé à son service vocal pour entraîner ses propres modèles ?
Cette question relève de la propre documentation de confidentialité d'Apple pour le framework Speech, pas de l'app qui a déclenché le repli. Un développeur peut décrire ce qui se passe sur ses propres systèmes, mais ne peut rien promettre sur l'infrastructure d'Apple au nom d'Apple.
Comment vérifier si un enregistrement précis a quitté mon téléphone ?
Activez le mode Avion avant de le transcrire. Un texte qui revient a été produit entièrement sur l'appareil, puisqu'aucun réseau ne permettait d'envoyer quoi que ce soit ; s'il revient vide ou échoue, cet enregistrement aurait emprunté le repli serveur.
« Pas d'IA tierce » signifie-t-il que rien de mon enregistrement ne quitte jamais l'appareil ?
Pas nécessairement. Cela signifie en général que le développeur ne fait pas transiter votre audio par le service d'IA d'une autre entreprise. Le pipeline propre à Apple, local d'abord puis repli serveur, est une question distincte, et une réponse complète traite les deux, pas une seule.
Essayer dans Voice Studio
Voice Studio enregistre, transcrit à l’intérieur de votre iPhone et range chaque note par heure et par lieu — pour que l’idée venue en voiture soit encore retrouvable le mois prochain.
Téléchargement gratuit · iPhone et iPad · iOS 16.4 ou version ultérieure