Domaine 03 · Agents haute fréquence
Des agents qui répondent au rythme d'une conversation
Au téléphone ou dans une application : l'agent écoute, comprend, agit dans vos outils et répond, sans le silence gênant des assistants habituels.
Démonstration
Un appel, de bout en bout
Connecteurs
L'agent agit dans 1 406 applications
Un agent utile ne se contente pas de répondre : il réserve, cherche, met à jour, envoie. Chaque application ci-dessous peut être branchée à un agent, pour qu'il y lise et y agisse avec les droits que vous lui donnez, et seulement ceux-là. Votre logiciel n'y figure pas ? Nous créons le connecteur : c'est l'objet de notre domaine MCP & connecteurs
Données & analytique 201
- 21risk
- AccuWeather
- Adafruit IO
- Agenty
- Akta
- Ambee
- Amplitude
- ApexVerify
- Api ninjas
- Api sports
- Apify
- Audioscrape
- Baremetrics
- Beach Day API
- Beaconchain
- Big data cloud
- Bing Webmaster Tools
- Bitquery
- Bread & Butter
- Bright Data
- Brightdata
- Browseai
- BSC Designer
- Builtwith
- Byteforms
- Cabinpanda
- Candid
- CarsXE
- Census bureau
- Chameleon
Développement & DevOps 169
- 1password
- Ably
- Abuselpdb
- Alchemy
- Algolia
- Anchor browser
- Apiverve
- Appcircle
- Appdrag
- Appveyor
- Authyo
- AWS Marketplace
- Azure Monitor Activity Log
- Backendless
- Bench
- Better stack
- Bitbucket
- Blazemeter
- Blocknative
- Bolt iot
- Browserbase
- Browserbase tool
- Browserless
- Bubble
- Bug Recorder
- Bugsnag
- Buildkite
- Bunnycdn
- CaptureKit
- Circleci
Marketing & réseaux sociaux 159
- Active campaign
- ActiveTrail
- Adobe Marketing Agent
- Adtraction
- Ahrefs
- AimTell
- Amcards
- Beaconstac
- Beamer
- Beehiiv
- Benchmark email
- Bigmailer
- Bitly
- BlueFox Email
- Bouncify
- Brandfetch
- Braze
- Brevo
- Buffer
- Bulk Email Checker
- BulkPublish
- Campaign cleaner
- Campayn
- Cardly
- ClickSend
- Constant Contact
- ContentStudio
- Crustdata
- Curated
- Customer.io
Productivité & gestion de projet 139
- Addressfinder
- Agiled
- AirOps
- Airtable
- Amazing Marvin
- AnyDB
- ApptiveGrid
- Asana
- Atlassian
- Basecamp
- Beeminder
- Breeze
- Bugherd
- Canny
- Checkvist
- Chmeetings
- Circleback
- Clickup
- Clientary
- Clio Manage (US)
- Coda
- CommCare
- CompanyCam
- Contacts+
- Craft
- Dart
- Datascope
- Desktime
- Dub
- Ecologi
Ventes, CRM & support client 130
- Acculynx
- Affinity
- Agencyzoom
- Agile CRM
- Apollo
- Attio
- Better proposals
- Bettercontact
- Bidsketch
- Blackbaud
- Blitz API
- Bolna
- Botdog
- BotPenguin
- Botsonic
- Botstar
- Brilliant directories
- Callingly
- Callpage
- Capsule crm
- Centralstationcrm
- Charla
- Chatforma
- Clarify
- Clay
- Clearout
- Close
- Convolo ai
- Crisp
- Delighted
Intelligence artificielle 120
- All images ai
- AltTextLab
- Anthropic administrator
- Api labz
- Apiframe
- Apipie ai
- Arize AX
- Artificial Analysis
- AssemblyAI
- Astica ai
- Avoma
- Bigml
- Bland AI
- Botbaba
- BotMape
- Botpress
- BrainGraph
- Braintrust
- Browser tool
- BytePlus Ark
- CAMB.AI
- Ceramic
- Chatbotkit
- Cody
- CometAPI
- Copyleaks
- Customgpt
- Datarobot
- Deepgram
- DeepImage
Documents & fichiers 105
- ActiveMerge
- Affinda
- Agility cms
- Airparser
- Algodocs
- Api2pdf
- Archive.org
- Aryn
- Box
- Carbone
- Castingwords
- CertSeal
- Cloudconvert
- CloudPDF
- Cloudpress
- ComPDF
- Contentful graphql
- Contractbook
- Conversion tools
- Convertapi
- Cradl AI
- Craftmypdf
- CSVBox
- Docmosis
- Docnify
- Docparser
- DocRaptor
- Docsautomator
- Docsumo
- Docugenerate
Finance & comptabilité 81
- 44API
- Airwallex
- Aiwyn Tax
- Alpaca
- Alpha vantage
- Altoviz
- Benzinga
- Bigdata.com
- Billsby
- Brex
- Cashfree Payments
- Chaser
- Clarity AI
- Coinbase
- Coinbase Wallet
- Coupa
- CurrencyScoop
- Daffy
- Debitura
- Didit
- Donately
- Eagle doc
- Elorus
- Eodhd apis
- Era Context
- Fidel api
- Finage
- Finlight
- Finmei
- Finmo
Communication & collaboration 65
- 2chat
- Agent mail
- Android Texter
- Blooio
- CallOnTheGo
- Carbon Voice
- CardClan
- Chatwork
- Clickmeeting
- Confluence
- Daily
- Dailybot
- Dialmycalls
- Dialpad
- Discord
- Discordbot
- Gmail
- Gong
- Google Chat
- Google Meet
- Heartbeat
- LabsMobile
- LINE
- Loomio
- Mailersend
- Microsoft teams
- Missive
- Mocean
- Msg91
- Nylas
Design & création 55
- Abyssale
- Alttext ai
- Are.na
- Bannerbear
- Bannerbite
- Builder.io
- Canva
- Claid ai
- Cloudinary
- Contentdrips
- Creatomate
- Cults
- Dreamstudio
- Dynamic Mockups
- Dynapictures
- Eraser
- Excalidraw
- Figma
- Gamma
- Higgsfield
- HTML/CSS to Image
- Imagior
- Imejis io
- Inspo
- Kraken io
- Layerre
- Logo dev
- Lucid
- Magic Hour
- Magic Patterns
Automatisation 48
- 0CodeKit
- Airtop
- Apilio
- Basin
- Bika.ai
- Botster
- Bouncer
- BrowserAct
- Celigo
- CheckFlow
- Conveyor
- Crowdin
- Detrack
- Dify
- Digital Humani
- Dnsfilter
- EnforcedFlow
- Feathery
- Fillout forms
- Formcrafts
- Formdesk
- Formsite
- Human Approval - HITL Platform
- Hyperbrowser
- Inistate
- Leverly
- Maintainx
- Make
- Manus
- NeetoForm
E-commerce 34
- Baselinker
- Bluebarry
- Btcpay server
- Cloudcart
- Commerce Layer
- Countdown api
- Dpd2
- Finerworks
- Fingertip
- Gelato
- Gumroad
- Instacart
- Junglescout
- Ko fi
- Lemon squeezy
- Lightspeed Retail X-Series
- Loyverse
- Memberstack
- MerchantPro
- Open sea
- Order Desk
- Payhip
- Printify
- RedCircle API
- Reloadly
- Retailed
- Shipday
- Shipengine
- Shippo
- Shopify
Agenda & réservation 29
- Apaleo
- Bart
- Blue Pillow Hotels & Stays
- Bookingmood
- Booqable
- Cal
- Calendarhero
- Calendly
- Check Cherry
- Cronfree Time Scheduler
- Etermin
- Evenium
- Eventzilla
- Google Calendar
- GoTable
- Ignav Flights
- Jinko
- Lodgify
- Mindbody
- OneTapCheckIn
- Planyo Online Booking
- Scheduleonce
- Supersaas
- Sympla
- Taskrabbit
- Trivago
- Uplisting
- Viator
- Workiz
RH & recrutement 25
- 7shifts
- Ashby
- Async interview
- Bamboohr
- Breathe HR
- Breezy Hr
- Connecteam
- ContactOut
- Coresignal
- Dice
- Greenhouse
- Gusto
- Hireflix
- HR Partner
- Lever
- Personio
- Recruitee
- Remote retrieval
- Sap successfactors
- Talenthr
- Web3 Career
- Workable
- Workday
- Workday RaaS
- ZipRecruiter
Médias & divertissement 22
- AllTrails
- Amara
- Captions
- Chatfai
- Descript
- Dungeon fighter online
- Elevenlabs
- Eranol
- Headout
- Listennotes
- News api
- RAWG Video Games Database
- Shotstack
- SoundCloud
- Spotify
- Ticket Tailor
- Ticketmaster
- Twitch
- VideoDB
- Vimeo
- Youtube
- YouTube Transcript
Éducation 17
- Accredible certificates
- Api bible
- Blackboard
- Canvas
- Certifier
- Classmarker
- Consensus
- D2lbrightspace
- Dictionary api
- Google Classroom
- Heights Platform
- Lessonspace
- Linguapop
- Memberspot
- Membervault
- Mighty Networks
- WaniKani
Autres 7
- Bitwarden
- Borneo
- Hotspotsystem
- Identitycheck
- Ip2proxy
- Postgrid
- Raisely
Ce que c'est
La haute fréquence : répondre en moins d'une seconde
Dans une conversation humaine, on se répond en deux dixièmes de seconde. Au-delà d'une seconde, le silence se remarque ; au-delà de deux, on croit la ligne coupée.
Un agent IA est un programme qui comprend une demande en langage naturel, décide de ce qu'il faut faire, et le fait : il consulte un agenda, crée une fiche client, envoie une confirmation. Il est haute fréquence quand toute cette boucle, de l'écoute à la réponse, tient dans le rythme d'une conversation : sous la seconde, idéalement autour d'une demi-seconde.
La haute fréquence, c'est aussi le volume : des dizaines d'appels simultanés, jour et nuit, sans file d'attente, chacun traité avec la même attention.
Pour quoi faire
- Accueil téléphonique : décrocher à chaque appel, orienter, répondre aux questions courantes, sans musique d'attente.
- Prise de rendez-vous : proposer un créneau réel, le réserver, envoyer la confirmation.
- Qualification commerciale : comprendre le besoin d'un prospect et le transmettre, fiche remplie, au bon interlocuteur.
- Support et suivi : l'état d'une commande, d'un dossier ou d'une intervention, consulté à la source.
- Relances : rappeler un rendez-vous, une échéance, un document manquant.
Comment c'est fait
Chaque milliseconde compte
- 01
Flux audio
La voix arrive en continu, par paquets de 20 millisecondes, depuis le téléphone ou le navigateur.
- 02
Fin de tour
Détecter que la personne a fini sa phrase, et non qu'elle marque une pause pour réfléchir.
- 03
Transcription en flux
La parole devient du texte pendant qu'elle est prononcée, pas après.
- 04
Décision
Le modèle de langage comprend, décide, et appelle les outils nécessaires : agenda, CRM, SMS.
- 05
Synthèse en flux
La réponse est dite dès ses premiers mots générés, sans attendre la phrase entière.
- 06
Interruption
Si on lui coupe la parole, l'agent se tait et écoute, comme un interlocuteur poli.
Le budget de latence
Un agent vocal classique enchaîne trois modèles : transcription, modèle de langage, synthèse vocale. Chaque étape ajoute son délai ; tout l'art consiste à les faire se chevaucher. Ordres de grandeur d'un agent bien construit :
| Détection de fin de tour | 100 – 300 ms |
| Fin de transcription | 50 – 150 ms |
| Premier mot du modèle | 150 – 400 ms |
| Premier son de la synthèse | 80 – 200 ms |
| Réseau et téléphonie | 50 – 150 ms |
| Réponse perçue | moins d'une seconde |
Tout en flux
Aucune étape n'attend la précédente. La transcription produit des résultats partiels pendant que la personne parle ; le modèle de langage commence à écrire dès que la fin de tour est probable ; la synthèse vocale prononce les premiers mots pendant que la suite s'écrit. Le délai ressenti n'est plus la somme des étapes, mais le temps jusqu'au premier son.
Savoir quand l'autre a fini
Le point le plus délicat n'est pas la vitesse de calcul : c'est de décider quand répondre. Trop tôt, l'agent coupe la parole ; trop tard, il laisse un blanc. Un simple seuil de silence ne suffit pas : on combine la détection d'activité vocale à un modèle de fin de tour, qui s'appuie sur l'intonation et sur le sens de la phrase en cours.
Accélérer le modèle
Le modèle de langage est le poste le plus coûteux. On le rend rapide par des modèles dimensionnés pour la tâche, le décodage spéculatif (un petit modèle devine, le grand valide), la gestion fine de la mémoire de conversation, des serveurs placés près des utilisateurs, et des consignes courtes. Pendant qu'un outil travaille, l'agent dit « je regarde » : un silence habité ne se ressent pas comme une attente.
La parole directe, sans transcription
Depuis 2024, des modèles parole-à-parole traitent le son directement et peuvent écouter en parlant (full-duplex). Ils descendent sous les 300 millisecondes et restituent l'intonation, là où une chaîne classique la perd à la transcription. Pour un usage métier, on choisit selon le besoin : la chaîne classique reste plus facile à contrôler, à auditer et à brancher sur des outils.
Agir, avec des garde-fous
Chaque action passe par un connecteur aux droits minimaux : lire l'agenda et y créer un rendez-vous, pas le supprimer. Les actions sensibles demandent confirmation, chaque appel est journalisé, et l'agent sait passer la main à un humain quand la demande sort de son périmètre.
- Latence
- Le temps entre la fin de votre phrase et le début de la réponse. C'est lui qui fait qu'une conversation semble naturelle, ou non.
- Streaming
- Traiter les données au fil de l'eau, morceau par morceau, au lieu d'attendre qu'elles soient complètes.
- Détection d'activité vocale
- Distinguer la parole du silence et du bruit de fond, à chaque fraction de seconde.
- Barge-in
- La possibilité d'interrompre l'agent pendant qu'il parle, et d'être entendu aussitôt.
- Appel d'outil
- L'agent déclenche une action dans un logiciel (réserver, chercher, envoyer) au lieu de seulement répondre.
- Full-duplex
- Écouter et parler en même temps, comme deux personnes au téléphone, au lieu de parler chacun son tour.
Recherche & évolutions 2026
De l'assistant qui attend à l'agent qui converse
En quelques années, les trois briques d'un agent vocal ont changé d'échelle : une transcription robuste dans toutes les langues, des modèles de langage capables d'utiliser des outils, et des moteurs d'inférence qui servent des milliers de conversations à la fois. La frontière se déplace désormais vers le naturel de l'échange : écouter et parler en même temps, gérer les interruptions, prendre la parole au bon moment.
La voix de bout en bout
Les modèles parole-à-parole et full-duplex passent de la démonstration à la production : moins d'étapes, moins de latence, et une intonation conservée.
La prise de parole prédite
Des modèles dédiés anticipent la fin d'une phrase avant le silence, à partir du rythme et du sens : l'agent répond au moment où un humain l'aurait fait.
Des agents qui agissent partout
Avec le protocole MCP, brancher un agent sur un nouveau logiciel ne demande plus un développement spécifique pour chaque modèle : les connecteurs deviennent réutilisables.
Mesurer en conditions réelles
Latence au 95ᵉ centile, taux de demandes résolues sans humain, erreurs d'action : l'évaluation se fait sur de vrais appels, pas sur des exemples choisis.
Les publications de référence
- 2025High-Fidelity Simultaneous Speech-To-Speech Translation (Hibiki)
Une traduction orale simultanée, voix de l'orateur conservée, produite par le laboratoire parisien Kyutai. La preuve qu'un modèle peut écouter et parler en même temps, en continu.
- 2024Moshi: a speech-text foundation model for real-time dialogue
Un modèle de dialogue qui traite directement le son, sans passer par une transcription, et converse en full-duplex avec une latence de l'ordre de 200 millisecondes. Il inaugure les agents qui parlent vraiment au rythme humain.
- 2024Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
Synchronise un modèle de langage sur une horloge réelle, pour qu'il gère chevauchements, acquiescements et interruptions : la conversation cesse d'être un échange de tours rigides.
- 2023Efficient Memory Management for Large Language Model Serving with PagedAttention
Gère la mémoire des modèles comme un système d'exploitation gère ses pages : bien plus de conversations simultanées sur le même matériel. C'est le moteur de service vLLM.
- 2023Fast Inference from Transformers via Speculative Decoding
Un petit modèle propose plusieurs mots d'avance, le grand les valide en une fois : la génération accélère de deux à trois fois, sans rien changer au résultat.
- 2023ReAct: Synergizing Reasoning and Acting in Language Models
Alterner raisonnement et action : le modèle réfléchit, agit dans un outil, observe le résultat, puis continue. C'est le schéma de fonctionnement de la plupart des agents actuels.
- 2023Toolformer: Language Models Can Teach Themselves to Use Tools
Un modèle apprend seul quand et comment appeler une calculatrice, un moteur de recherche ou un agenda. Le point de départ de l'appel d'outils.
- 2022Robust Speech Recognition via Large-Scale Weak Supervision (Whisper)
Une reconnaissance vocale entraînée sur 680 000 heures d'audio, robuste aux accents, au bruit et au vocabulaire. Elle a banalisé la transcription de qualité, en français comme dans une centaine de langues.
- 2022FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Réorganise le calcul au cœur des modèles pour limiter les allers-retours en mémoire : le même résultat, plusieurs fois plus vite. Présent aujourd'hui dans presque tous les moteurs d'inférence.
- 2009Universals and cultural variation in turn-taking in conversation
Mesuré dans dix langues : entre deux tours de parole, l'écart typique est d'environ 200 millisecondes, partout dans le monde. C'est la cible que vise un agent haute fréquence.
Collaborer
Un sujet technique qui résiste ?
Faisabilité, méthode, mesure du résultat.