Lors d’une visite au nouveau bureau new-yorkais de Synthesia, start‑up britannique spécialisée dans les avatars vidéo, on m’a proposé de créer mon propre double numérique. Après quelques séances de prise de vue et d’enregistrement vocal, j’ai pu interagir avec une version virtuelle de moi‑même, capable de répondre uniquement à un texte pré‑déterminé. Cette expérience soulève des questions majeures sur la technologie sous‑jacente, ses applications professionnelles et les limites éventuelles pour le journalisme.
Synthesia et la montée des avatars numériques
Fondée au Royaume‑Uni, Synthesia s’est rapidement imposée aux côtés de D‑ID, HeyGen ou Colossyan. L’entreprise a atteint une valorisation de 4 milliards de dollars et déclare plus de 100 millions de dollars de revenu annuel récurrent. Son offre principale permet aux entreprises de créer des vidéos de formation où des avatars animés lisent des scripts fournis. Récemment, la société a lancé Roleplay Sessions, une plateforme où les salariés peuvent s’entraîner à des pitchs ou à des scénarios de vente en dialoguant avec un avatar capable de réagir et d’évaluer leurs réponses.
Le projet d’avatar personnel pour un journaliste constitue une première pour Synthesia : il s’agit d’un avatar interactif entraîné exclusivement sur un article traitant de la fraude dans les start‑ups financées par le capital‑risque. L’objectif était de démontrer la capacité de la technologie à reproduire une personnalité ciblée tout en restant strictement limité à un domaine de connaissance.
Comment fonctionne un avatar interactif ?
La création d’un double numérique repose sur une chaîne de modèles intégrés :
- Capture visuelle et vocale : plusieurs dizaines de photos et un enregistrement de deux minutes de la voix du sujet sont réalisés dans un mini‑studio.
- Modèle de reconnaissance vocale : il convertit les questions orales en texte.
- Modèle de langage agentique : il analyse le texte, le compare à la base d’entraînement (l’article choisi) et génère une réponse appropriée.
- Modèle de synthèse vocale : il transforme la réponse textuelle en audio, en s’appuyant sur les voix de Synthesia ou sur des alternatives comme Cartesia, ElevenLabs, Google ou OpenAI.
- Modèle d’animation vidéo : il anime l’avatar en synchronisant les mouvements faciaux avec le flux audio.
Les clients peuvent héberger leurs avatars sur le cloud de leur choix ou confier l’hébergement à Synthesia. La plateforme propose trois produits distincts : une solution de création vidéo classique, la plateforme interactive Sessions et une API permettant d’intégrer les modèles vidéo et voix dans des services tiers.
Impacts potentiels sur le journalisme et le travail
Le fait de pouvoir interroger un avatar qui ne répond qu’à un sujet précis pose la question de la valeur ajoutée pour les médias. D’un côté, un double numérique pourrait assurer une présence continue, répondre à des questions de base et libérer du temps aux journalistes pour des enquêtes plus approfondies. De l’autre, la confiance, pilier du métier, repose sur l’authenticité et la capacité à improviser ; un avatar déterministe, limité à son corpus d’entraînement, ne peut pas reproduire cette flexibilité.
Des investisseurs restent sceptiques quant à la substitution du présentateur humain par un avatar. Certains voient toutefois un usage complémentaire : des résumés vidéo automatisés, des interviews de routine ou des présentations internes d’entreprise. Le principal risque identifié est la diffusion d’informations inexactes ou biaisées si le modèle n’est pas correctement supervisé.
Perspectives et limites
Les avatars déterministes, comme celui que j’ai testé, offrent une expérience rassurante mais parfois « creepy », notamment lorsqu’ils ne peuvent pas répondre à des questions personnelles hors du cadre prévu. Une version non déterministe, alimentée par un chatbot libre, pourrait créer des interactions plus naturelles mais soulève le danger d’une « psychose » numérique, où l’utilisateur attribue des intentions humaines à une entité purement algorithmique.
Pour les entreprises, la possibilité de créer des jumeaux numériques de leurs dirigeants ou de leurs experts ouvre la porte à une disponibilité 24 h/24, à la formation personnalisée et à la diffusion de messages de marque cohérents. Cependant, la question de la gouvernance des données, du consentement et de la transparence reste centrale.
En fin de compte, mon expérience montre que la technologie est prête à offrir des avatars convaincants, mais que son adoption dépendra davantage de la capacité à établir des règles d’usage claires que de la simple prouesse technique. Le futur des avatars numériques sera probablement celui d’un outil d’appoint, plutôt que d’un remplacement complet du professionnel humain.