Il est temps de sonner LALM

Partager

LALMs. Il y a encore quelques années, les systèmes d'IA à interactions vocales comme Alexa d'Amazon convertissaient d'abord le signal audio en texte, puis utilisaient un modèle de langage pour générer une réponse. Aujourd'hui, le son est traité directement, sans passer par une conversion en texte, par des modèles de langage audio, ou LALMs.

Sans défenses. Ces modèles offrent des vulnérabilités nouvelles. D'une part, ils peuvent utiliser des signaux comme l'accent, la manière de parler ou les bruits de fond pour inférer l'âge, la richesse ou la localisation d'une personne. Une expérience a montré que les modèles, utilisés en contexte médical, changeaient leurs diagnostics en fonction de la personne qui parlait. D'autre part, des personnes mal-intentionnées peuvent utiliser des sons imperceptibles à l'oreille pour influencer ces modèles audio, ce qui les rend d'autant plus complexes à auditer. Enfin, nos voix étant uniques, les fournisseurs de modèles audio peuvent surveiller leurs utilisateurs bien plus précisément qu'avec des interactions uniquement textuelles.

Pourquoi c'est important. L'app d'IA la plus populaire en Chine est Doubao, de ByteDance (la maison-mère de TikTok). Près de la moitié des personnes qui l'ont installée lui parle régulièrement. L'IA a commande vocale est en passe de devenir la norme.

Kaiwen Luo et al., A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook. pré-print, 18 mai (en anglais)