Domaine 03 · Agents haute fréquence

Des agents qui répondent au rythme d'une conversation

Au téléphone ou dans une application : l'agent écoute, comprend, agit dans vos outils et répond, sans le silence gênant des assistants habituels.

Démonstration

Un appel, de bout en bout

En attente d'appelAgent vocal · accueil téléphonique d'un garage
00:00
Démonstration illustrative · latences cibles d'un agent en production

Connecteurs

L'agent agit dans 1 406 applications

Un agent utile ne se contente pas de répondre : il réserve, cherche, met à jour, envoie. Chaque application ci-dessous peut être branchée à un agent, pour qu'il y lise et y agisse avec les droits que vous lui donnez, et seulement ceux-là. Votre logiciel n'y figure pas ? Nous créons le connecteur : c'est l'objet de notre domaine MCP & connecteurs

1 406 connecteurs

Données & analytique 201

  • 21risk
  • AccuWeather
  • Adafruit IO
  • Agenty
  • Akta
  • Ambee
  • Amplitude
  • ApexVerify
  • Api ninjas
  • Api sports
  • Apify
  • Audioscrape
  • Baremetrics
  • Beach Day API
  • Beaconchain
  • Big data cloud
  • Bing Webmaster Tools
  • Bitquery
  • Bread & Butter
  • Bright Data
  • Brightdata
  • Browseai
  • BSC Designer
  • Builtwith
  • Byteforms
  • Cabinpanda
  • Candid
  • CarsXE
  • Census bureau
  • Chameleon

Développement & DevOps 169

  • 1password
  • Ably
  • Abuselpdb
  • Alchemy
  • Algolia
  • Anchor browser
  • Apiverve
  • Appcircle
  • Appdrag
  • Appveyor
  • Authyo
  • AWS Marketplace
  • Azure Monitor Activity Log
  • Backendless
  • Bench
  • Better stack
  • Bitbucket
  • Blazemeter
  • Blocknative
  • Bolt iot
  • Browserbase
  • Browserbase tool
  • Browserless
  • Bubble
  • Bug Recorder
  • Bugsnag
  • Buildkite
  • Bunnycdn
  • CaptureKit
  • Circleci

Marketing & réseaux sociaux 159

  • Active campaign
  • ActiveTrail
  • Adobe Marketing Agent
  • Adtraction
  • Ahrefs
  • AimTell
  • Amcards
  • Beaconstac
  • Beamer
  • Beehiiv
  • Benchmark email
  • Bigmailer
  • Bitly
  • BlueFox Email
  • Bouncify
  • Brandfetch
  • Braze
  • Brevo
  • Buffer
  • Bulk Email Checker
  • BulkPublish
  • Campaign cleaner
  • Campayn
  • Cardly
  • ClickSend
  • Constant Contact
  • ContentStudio
  • Crustdata
  • Curated
  • Customer.io

Productivité & gestion de projet 139

  • Addressfinder
  • Agiled
  • AirOps
  • Airtable
  • Amazing Marvin
  • AnyDB
  • ApptiveGrid
  • Asana
  • Atlassian
  • Basecamp
  • Beeminder
  • Breeze
  • Bugherd
  • Canny
  • Checkvist
  • Chmeetings
  • Circleback
  • Clickup
  • Clientary
  • Clio Manage (US)
  • Coda
  • CommCare
  • CompanyCam
  • Contacts+
  • Craft
  • Dart
  • Datascope
  • Desktime
  • Dub
  • Ecologi

Ventes, CRM & support client 130

  • Acculynx
  • Affinity
  • Agencyzoom
  • Agile CRM
  • Apollo
  • Attio
  • Better proposals
  • Bettercontact
  • Bidsketch
  • Blackbaud
  • Blitz API
  • Bolna
  • Botdog
  • BotPenguin
  • Botsonic
  • Botstar
  • Brilliant directories
  • Callingly
  • Callpage
  • Capsule crm
  • Centralstationcrm
  • Charla
  • Chatforma
  • Clarify
  • Clay
  • Clearout
  • Close
  • Convolo ai
  • Crisp
  • Delighted

Intelligence artificielle 120

  • All images ai
  • AltTextLab
  • Anthropic administrator
  • Api labz
  • Apiframe
  • Apipie ai
  • Arize AX
  • Artificial Analysis
  • AssemblyAI
  • Astica ai
  • Avoma
  • Bigml
  • Bland AI
  • Botbaba
  • BotMape
  • Botpress
  • BrainGraph
  • Braintrust
  • Browser tool
  • BytePlus Ark
  • CAMB.AI
  • Ceramic
  • Chatbotkit
  • Cody
  • CometAPI
  • Copyleaks
  • Customgpt
  • Datarobot
  • Deepgram
  • DeepImage

Documents & fichiers 105

  • ActiveMerge
  • Affinda
  • Agility cms
  • Airparser
  • Algodocs
  • Api2pdf
  • Archive.org
  • Aryn
  • Box
  • Carbone
  • Castingwords
  • CertSeal
  • Cloudconvert
  • CloudPDF
  • Cloudpress
  • ComPDF
  • Contentful graphql
  • Contractbook
  • Conversion tools
  • Convertapi
  • Cradl AI
  • Craftmypdf
  • CSVBox
  • Docmosis
  • Docnify
  • Docparser
  • DocRaptor
  • Docsautomator
  • Docsumo
  • Docugenerate

Finance & comptabilité 81

  • 44API
  • Airwallex
  • Aiwyn Tax
  • Alpaca
  • Alpha vantage
  • Altoviz
  • Benzinga
  • Bigdata.com
  • Billsby
  • Brex
  • Cashfree Payments
  • Chaser
  • Clarity AI
  • Coinbase
  • Coinbase Wallet
  • Coupa
  • CurrencyScoop
  • Daffy
  • Debitura
  • Didit
  • Donately
  • Eagle doc
  • Elorus
  • Eodhd apis
  • Era Context
  • Fidel api
  • Finage
  • Finlight
  • Finmei
  • Finmo

Communication & collaboration 65

  • 2chat
  • Agent mail
  • Android Texter
  • Blooio
  • CallOnTheGo
  • Carbon Voice
  • CardClan
  • Chatwork
  • Clickmeeting
  • Confluence
  • Daily
  • Dailybot
  • Dialmycalls
  • Dialpad
  • Discord
  • Discordbot
  • Gmail
  • Gong
  • Google Chat
  • Google Meet
  • Heartbeat
  • LabsMobile
  • LINE
  • Loomio
  • Mailersend
  • Microsoft teams
  • Missive
  • Mocean
  • Msg91
  • Nylas

Design & création 55

  • Abyssale
  • Alttext ai
  • Are.na
  • Bannerbear
  • Bannerbite
  • Builder.io
  • Canva
  • Claid ai
  • Cloudinary
  • Contentdrips
  • Creatomate
  • Cults
  • Dreamstudio
  • Dynamic Mockups
  • Dynapictures
  • Eraser
  • Excalidraw
  • Figma
  • Gamma
  • Higgsfield
  • HTML/CSS to Image
  • Imagior
  • Imejis io
  • Inspo
  • Kraken io
  • Layerre
  • Logo dev
  • Lucid
  • Magic Hour
  • Magic Patterns

Automatisation 48

  • 0CodeKit
  • Airtop
  • Apilio
  • Basin
  • Bika.ai
  • Botster
  • Bouncer
  • BrowserAct
  • Celigo
  • CheckFlow
  • Conveyor
  • Crowdin
  • Detrack
  • Dify
  • Digital Humani
  • Dnsfilter
  • EnforcedFlow
  • Feathery
  • Fillout forms
  • Formcrafts
  • Formdesk
  • Formsite
  • Human Approval - HITL Platform
  • Hyperbrowser
  • Inistate
  • Leverly
  • Maintainx
  • Make
  • Manus
  • NeetoForm

E-commerce 34

  • Baselinker
  • Bluebarry
  • Btcpay server
  • Cloudcart
  • Commerce Layer
  • Countdown api
  • Dpd2
  • Finerworks
  • Fingertip
  • Gelato
  • Gumroad
  • Instacart
  • Junglescout
  • Ko fi
  • Lemon squeezy
  • Lightspeed Retail X-Series
  • Loyverse
  • Memberstack
  • MerchantPro
  • Open sea
  • Order Desk
  • Payhip
  • Printify
  • RedCircle API
  • Reloadly
  • Retailed
  • Shipday
  • Shipengine
  • Shippo
  • Shopify

Agenda & réservation 29

  • Apaleo
  • Bart
  • Blue Pillow Hotels & Stays
  • Bookingmood
  • Booqable
  • Cal
  • Calendarhero
  • Calendly
  • Check Cherry
  • Cronfree Time Scheduler
  • Etermin
  • Evenium
  • Eventzilla
  • Google Calendar
  • GoTable
  • Ignav Flights
  • Jinko
  • Lodgify
  • Mindbody
  • OneTapCheckIn
  • Planyo Online Booking
  • Scheduleonce
  • Supersaas
  • Sympla
  • Taskrabbit
  • Trivago
  • Uplisting
  • Viator
  • Workiz

RH & recrutement 25

  • 7shifts
  • Ashby
  • Async interview
  • Bamboohr
  • Breathe HR
  • Breezy Hr
  • Connecteam
  • ContactOut
  • Coresignal
  • Dice
  • Greenhouse
  • Gusto
  • Hireflix
  • HR Partner
  • Lever
  • Personio
  • Recruitee
  • Remote retrieval
  • Sap successfactors
  • Talenthr
  • Web3 Career
  • Workable
  • Workday
  • Workday RaaS
  • ZipRecruiter

Médias & divertissement 22

  • AllTrails
  • Amara
  • Captions
  • Chatfai
  • Descript
  • Dungeon fighter online
  • Elevenlabs
  • Eranol
  • Headout
  • Listennotes
  • News api
  • RAWG Video Games Database
  • Shotstack
  • SoundCloud
  • Spotify
  • Ticket Tailor
  • Ticketmaster
  • Twitch
  • VideoDB
  • Vimeo
  • Youtube
  • YouTube Transcript

Éducation 17

  • Accredible certificates
  • Api bible
  • Blackboard
  • Canvas
  • Certifier
  • Classmarker
  • Consensus
  • D2lbrightspace
  • Dictionary api
  • Google Classroom
  • Heights Platform
  • Lessonspace
  • Linguapop
  • Memberspot
  • Membervault
  • Mighty Networks
  • WaniKani

Autres 7

  • Bitwarden
  • Borneo
  • Hotspotsystem
  • Identitycheck
  • Ip2proxy
  • Postgrid
  • Raisely

Ce que c'est

La haute fréquence : répondre en moins d'une seconde

Dans une conversation humaine, on se répond en deux dixièmes de seconde. Au-delà d'une seconde, le silence se remarque ; au-delà de deux, on croit la ligne coupée.

Un agent IA est un programme qui comprend une demande en langage naturel, décide de ce qu'il faut faire, et le fait : il consulte un agenda, crée une fiche client, envoie une confirmation. Il est haute fréquence quand toute cette boucle, de l'écoute à la réponse, tient dans le rythme d'une conversation : sous la seconde, idéalement autour d'une demi-seconde.

La haute fréquence, c'est aussi le volume : des dizaines d'appels simultanés, jour et nuit, sans file d'attente, chacun traité avec la même attention.

Pour quoi faire

  • Accueil téléphonique : décrocher à chaque appel, orienter, répondre aux questions courantes, sans musique d'attente.
  • Prise de rendez-vous : proposer un créneau réel, le réserver, envoyer la confirmation.
  • Qualification commerciale : comprendre le besoin d'un prospect et le transmettre, fiche remplie, au bon interlocuteur.
  • Support et suivi : l'état d'une commande, d'un dossier ou d'une intervention, consulté à la source.
  • Relances : rappeler un rendez-vous, une échéance, un document manquant.

Comment c'est fait

Chaque milliseconde compte

  1. 01

    Flux audio

    La voix arrive en continu, par paquets de 20 millisecondes, depuis le téléphone ou le navigateur.

  2. 02

    Fin de tour

    Détecter que la personne a fini sa phrase, et non qu'elle marque une pause pour réfléchir.

  3. 03

    Transcription en flux

    La parole devient du texte pendant qu'elle est prononcée, pas après.

  4. 04

    Décision

    Le modèle de langage comprend, décide, et appelle les outils nécessaires : agenda, CRM, SMS.

  5. 05

    Synthèse en flux

    La réponse est dite dès ses premiers mots générés, sans attendre la phrase entière.

  6. 06

    Interruption

    Si on lui coupe la parole, l'agent se tait et écoute, comme un interlocuteur poli.

Le budget de latence

Un agent vocal classique enchaîne trois modèles : transcription, modèle de langage, synthèse vocale. Chaque étape ajoute son délai ; tout l'art consiste à les faire se chevaucher. Ordres de grandeur d'un agent bien construit :

Détection de fin de tour100 – 300 ms
Fin de transcription50 – 150 ms
Premier mot du modèle150 – 400 ms
Premier son de la synthèse80 – 200 ms
Réseau et téléphonie50 – 150 ms
Réponse perçuemoins d'une seconde

Tout en flux

Aucune étape n'attend la précédente. La transcription produit des résultats partiels pendant que la personne parle ; le modèle de langage commence à écrire dès que la fin de tour est probable ; la synthèse vocale prononce les premiers mots pendant que la suite s'écrit. Le délai ressenti n'est plus la somme des étapes, mais le temps jusqu'au premier son.

Savoir quand l'autre a fini

Le point le plus délicat n'est pas la vitesse de calcul : c'est de décider quand répondre. Trop tôt, l'agent coupe la parole ; trop tard, il laisse un blanc. Un simple seuil de silence ne suffit pas : on combine la détection d'activité vocale à un modèle de fin de tour, qui s'appuie sur l'intonation et sur le sens de la phrase en cours.

Accélérer le modèle

Le modèle de langage est le poste le plus coûteux. On le rend rapide par des modèles dimensionnés pour la tâche, le décodage spéculatif (un petit modèle devine, le grand valide), la gestion fine de la mémoire de conversation, des serveurs placés près des utilisateurs, et des consignes courtes. Pendant qu'un outil travaille, l'agent dit « je regarde » : un silence habité ne se ressent pas comme une attente.

La parole directe, sans transcription

Depuis 2024, des modèles parole-à-parole traitent le son directement et peuvent écouter en parlant (full-duplex). Ils descendent sous les 300 millisecondes et restituent l'intonation, là où une chaîne classique la perd à la transcription. Pour un usage métier, on choisit selon le besoin : la chaîne classique reste plus facile à contrôler, à auditer et à brancher sur des outils.

Agir, avec des garde-fous

Chaque action passe par un connecteur aux droits minimaux : lire l'agenda et y créer un rendez-vous, pas le supprimer. Les actions sensibles demandent confirmation, chaque appel est journalisé, et l'agent sait passer la main à un humain quand la demande sort de son périmètre.

Latence
Le temps entre la fin de votre phrase et le début de la réponse. C'est lui qui fait qu'une conversation semble naturelle, ou non.
Streaming
Traiter les données au fil de l'eau, morceau par morceau, au lieu d'attendre qu'elles soient complètes.
Détection d'activité vocale
Distinguer la parole du silence et du bruit de fond, à chaque fraction de seconde.
Barge-in
La possibilité d'interrompre l'agent pendant qu'il parle, et d'être entendu aussitôt.
Appel d'outil
L'agent déclenche une action dans un logiciel (réserver, chercher, envoyer) au lieu de seulement répondre.
Full-duplex
Écouter et parler en même temps, comme deux personnes au téléphone, au lieu de parler chacun son tour.

Recherche & évolutions 2026

De l'assistant qui attend à l'agent qui converse

En quelques années, les trois briques d'un agent vocal ont changé d'échelle : une transcription robuste dans toutes les langues, des modèles de langage capables d'utiliser des outils, et des moteurs d'inférence qui servent des milliers de conversations à la fois. La frontière se déplace désormais vers le naturel de l'échange : écouter et parler en même temps, gérer les interruptions, prendre la parole au bon moment.

Tendance 2026

La voix de bout en bout

Les modèles parole-à-parole et full-duplex passent de la démonstration à la production : moins d'étapes, moins de latence, et une intonation conservée.

Tendance 2026

La prise de parole prédite

Des modèles dédiés anticipent la fin d'une phrase avant le silence, à partir du rythme et du sens : l'agent répond au moment où un humain l'aurait fait.

Tendance 2026

Des agents qui agissent partout

Avec le protocole MCP, brancher un agent sur un nouveau logiciel ne demande plus un développement spécifique pour chaque modèle : les connecteurs deviennent réutilisables.

Tendance 2026

Mesurer en conditions réelles

Latence au 95ᵉ centile, taux de demandes résolues sans humain, erreurs d'action : l'évaluation se fait sur de vrais appels, pas sur des exemples choisis.

Les publications de référence

  • 2025
    High-Fidelity Simultaneous Speech-To-Speech Translation (Hibiki)

    T. Labiausse, L. Mazaré, E. Grave, P. Pérez, A. Défossez, N. Zeghidour · arXiv 2025 · Kyutai

    Une traduction orale simultanée, voix de l'orateur conservée, produite par le laboratoire parisien Kyutai. La preuve qu'un modèle peut écouter et parler en même temps, en continu.

  • 2024
    Moshi: a speech-text foundation model for real-time dialogue

    A. Défossez, L. Mazaré, M. Orsini, A. Royer, P. Pérez, H. Jégou, E. Grave, N. Zeghidour · arXiv 2024 · Kyutai

    Un modèle de dialogue qui traite directement le son, sans passer par une transcription, et converse en full-duplex avec une latence de l'ordre de 200 millisecondes. Il inaugure les agents qui parlent vraiment au rythme humain.

  • 2024
    Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents

    B. Veluri, B. N. Peloquin, B. Yu, H. Gong, S. Gollakota · EMNLP 2024

    Synchronise un modèle de langage sur une horloge réelle, pour qu'il gère chevauchements, acquiescements et interruptions : la conversation cesse d'être un échange de tours rigides.

  • 2023
    Efficient Memory Management for Large Language Model Serving with PagedAttention

    W. Kwon, Z. Li, S. Zhuang, Y. Sheng, L. Zheng, C. H. Yu, J. E. Gonzalez, H. Zhang, I. Stoica · SOSP 2023

    Gère la mémoire des modèles comme un système d'exploitation gère ses pages : bien plus de conversations simultanées sur le même matériel. C'est le moteur de service vLLM.

  • 2023
    Fast Inference from Transformers via Speculative Decoding

    Y. Leviathan, M. Kalman, Y. Matias · ICML 2023

    Un petit modèle propose plusieurs mots d'avance, le grand les valide en une fois : la génération accélère de deux à trois fois, sans rien changer au résultat.

  • 2023
    ReAct: Synergizing Reasoning and Acting in Language Models

    S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K. Narasimhan, Y. Cao · ICLR 2023

    Alterner raisonnement et action : le modèle réfléchit, agit dans un outil, observe le résultat, puis continue. C'est le schéma de fonctionnement de la plupart des agents actuels.

  • 2023
    Toolformer: Language Models Can Teach Themselves to Use Tools

    T. Schick, J. Dwivedi-Yu, R. Dessì, R. Raileanu, M. Lomeli, L. Zettlemoyer, N. Cancedda, T. Scialom · NeurIPS 2023

    Un modèle apprend seul quand et comment appeler une calculatrice, un moteur de recherche ou un agenda. Le point de départ de l'appel d'outils.

  • 2022
    Robust Speech Recognition via Large-Scale Weak Supervision (Whisper)

    A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, I. Sutskever · ICML 2023

    Une reconnaissance vocale entraînée sur 680 000 heures d'audio, robuste aux accents, au bruit et au vocabulaire. Elle a banalisé la transcription de qualité, en français comme dans une centaine de langues.

  • 2022
    FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

    T. Dao, D. Y. Fu, S. Ermon, A. Rudra, C. Ré · NeurIPS 2022

    Réorganise le calcul au cœur des modèles pour limiter les allers-retours en mémoire : le même résultat, plusieurs fois plus vite. Présent aujourd'hui dans presque tous les moteurs d'inférence.

  • 2009
    Universals and cultural variation in turn-taking in conversation

    T. Stivers, N. J. Enfield, P. Brown et al. · PNAS

    Mesuré dans dix langues : entre deux tours de parole, l'écart typique est d'environ 200 millisecondes, partout dans le monde. C'est la cible que vise un agent haute fréquence.

Collaborer

Un sujet technique qui résiste ?

Faisabilité, méthode, mesure du résultat.

Proposer un projet