Il y a une abondance de discussions sur les modèles et architectures IA, mais beaucoup moins de focus sur l’infrastructure sous-jacente et l’intégrité des données qui décident finalement si l’IA peut être fiable, auditée et mise à l’échelle dans les environnements d’entreprise.
En pratique, l’IA n’est fiable que si l’infrastructure et les pipelines de données qui la soutiennent le sont, depuis la capture des données jusqu’à leur transmission et validation. C’est de plus en plus là que se produira la vraie différenciation.
La réalité est que l’IA se manifeste dans des moments très concrets : un appel routé via le réseau téléphonique public à un patient, un client d’hôtel ou un client attendant un service. Lorsqu’une telle interaction se produit, le facteur décisif n’est pas uniquement la qualité du modèle, mais la fiabilité de l’infrastructure sous-jacente.
Cette infrastructure est télécom, et elle est sur le point de devenir l’une des couches les plus stratégiques et contestées de la technologie d’entreprise.
Le problème de suivre les guerres de modèles
La façon dont l’industrie IA se parle, on pourrait croire que seules les références, les fenêtres de contexte et le modèle de base d’une startup comptent. Cette conversation n’est pas totalement fausse ; la capacité du modèle est importante. Mais elle est dangereusement incomplète, et cette lacune surprendra de nombreuses organisations.
Pensez à ce dont un agent vocal IA a réellement besoin pour fonctionner dans un hôpital, un district scolaire, une chaîne hôtelière ou une entreprise de détail moyenne. Il a besoin d’un vrai numéro de téléphone. Il a besoin d’un trunk SIP pour transporter l’audio du PSTN vers l’endroit où le modèle tourne. Il a besoin d’un contrôleur de bord de session pour gérer le traversée NAT, la négociation de codec et la prévention de fraude. Il a besoin d’une logique de routage suffisamment sophistiquée pour escalader vers un humain lorsque l’agent atteint ses limites. Tout cela doit fonctionner sous 200 milliseconds of round-trip latency, car c’est le seuil en dessous duquel une conversation vocale reste naturelle pour un être humain. Dépasser ce seuil, l’agent semble cassé, peu importe son intelligence.
Aucun de ces éléments n’est construit par OpenAI, Anthropic ou Google. Ils construisent le raisonnement. Quelqu’un d’autre doit construire le pipeline ; et bâtir un pipeline vocal de production qui fonctionne sur chaque opérateur, chaque appareil, chaque environnement réglementaire est vraiment difficile. Cela prend des années, de l’expérience opérationnelle qui ne se transfère pas de l’ingénierie logicielle. Et il s’avère que les entreprises qui l’ont déjà fait ne sont pas celles mentionnées dans TechCrunch.
La couche d’intelligence continuera de s’améliorer. Les modèles deviendront moins chers, plus rapides et plus capables sur un cycle d’environ 18 mois. L’infrastructure sur laquelle ils tournent ne suit pas la même courbe.
Le schéma historique que personne ne veut appliquer ici
Nous avons déjà vu cela. Quand Internet a grandi à la fin des années 1990, les entreprises d’infrastructure de routage, les Ciscos, les fournisseurs de bande passante, les vendeurs d’équipements réseau ont capté de la valeur à chaque cycle de guerres de navigateurs et de volatilité des dot-com. Quand le mobile a grandi, les entreprises qui possédaient le spectre et les tours sont restées précieuses à travers les générations de smartphones. Quand le cloud computing a grandi, AWS et Azure sont devenus parmi les entreprises les plus rentables du monde, non pas en construisant la meilleure application mais en possédant la couche sur laquelle chaque application tournait.
Le schéma n’est pas subtil : l’intelligence se commodifie plus vite que l’infrastructure. L’application en haut change ; le pipeline qu’elle traverse est plus difficile à construire et à remplacer. Pourtant chaque fois qu’une nouvelle transition de plateforme se produit, la conversation se concentre sur la couche d’intelligence jusqu’à ce qu’il soit trop tard pour obtenir une bonne position sur la couche d’infrastructure.
Nous sommes dans cette fenêtre en ce moment avec les agents IA et la voix.
Où se trouve réellement le marché
L’ampleur de ce qui se forme ici mérite d’être examinée, car les chiffres ne sont pas incrémentaux.
Le marché UCaaS en Amérique du Nord était déjà de 41 $ B en 2025 et devrait presque doubler d’ici 2032, selon Mobility Foresights. En même temps, les communications PME croissent à un taux annuel de 27,8 % jusqu’en 2030 (Mordor Intelligence), tandis que les modèles d’adoption changent tout aussi rapidement. La télésanté est un exemple clair, avec 86 % des médecins l’utilisant en 2021, contre seulement 15 % il y a deux ans (Market.us / Newstrail).
Ensuite, il y a le chiffre qui mérite plus d’attention qu’il ne reçoit. Les organisations constatent une hausse de 53 % de leurs revenus lorsque UCaaS, CCaaS et CPaaS proviennent d’une pile intégrée unique (Mordor Intelligence). Cela ne signifie pas que les produits groupés sont marginalement meilleurs. Cela montre que lorsque l’infrastructure vocale, la couche centre de contact et la couche communications programmables sont conçues pour fonctionner ensemble, le résultat commercial est transformateur.
Un agent IA peut alors facilement passer de l’automatisé aux humains, passer de la voix au SMS et récupérer l’historique de conversation sur plusieurs canaux. C’est très différent de rassembler ces éléments à partir de trois vendeurs distincts. L’intégration de la pile est ce qui fait réellement fonctionner les agents IA en production.
Les quatre industries qui vont prouver cela
Toutes les verticales ne progressent pas au même rythme, et comprendre cette séquence est aussi important que comprendre l’opportunité elle‑même.
| Vertical | Cas d’usage principal | Où elle en est aujourd’hui | La vraie friction |
|---|---|---|---|
| Retail & SMB | Réceptionniste IA, suivi de commandes, relance de fidélité | Maintenant | Essentiellement aucune — décisions rapides, pas de surcharge de conformité sauf PCI, ROI immédiat |
| Hospitality | Réservation vocale, services aux clients, communications multi‑propriétés | Prochain | Faible — décisions de niveau GM, pas de données réglementées, l’histoire ROI se clôt rapidement |
| Education | Alertes d’urgence, classe hybride, communications d’assiduité | Planification | Cycles budgétaires annuels, certification FERPA — plus lent mais churn quasi‑zéro une fois en place |
| Healthcare | Routage télésanté, planification des patients, gestion des appels cliniques | En considération | BAAs HIPAA, intégrations EHR, achats multi‑parties — et un marché de 9,8 $ B |
Le retail et l’hospitalité sont les domaines où cela sera prouvé prochainement. Un agent vocal IA dans une chaîne de restaurants capture déjà 30 % des appels entrants manqués avec un retour sur investissement annuel documenté de 760 %.
Ce sont des chiffres de production, et c’est le type de ROI qui rend toutes les autres technologies timides en comparaison. Ces déploiements se produisent maintenant ; ils fonctionnent, et ils construisent la base de référence qui rendra les conversations en santé et en éducation beaucoup plus faciles dans 12 mois.
La santé est un long jeu et le plus important. Le cycle de vente est vraiment douloureux ; les accords d’associé commercial HIPAA (BAA), les revues de sécurité informatique clinique, les exigences d’intégration EHR et les comités d’achat incluant médecins, administrateurs et responsables conformité qui ne sont pas toujours d’accord.
Cette friction est réelle, mais c’est aussi la raison pour laquelle, une fois qu’une organisation de santé déploie une infrastructure vocale IA conforme, elle ne la quitte presque jamais. Le travail de conformité qu’elle a fait avec le fournisseur, les intégrations qui sont intégrées dans les flux de travail cliniques ; ce sont des coûts de changement qui se cumulent en quelque chose de quasi‑permanent. La santé n’est pas la première victoire. C’est la plus précieuse.
La complexité réglementaire qui semble être un obstacle de l’extérieur est un fossé de l’intérieur. Chaque certification HIPAA, chaque audit FERPA, chaque revue PCI‑DSS qu’un fournisseur d’infrastructure vocale franchit est une autre chose qu’un concurrent doit reproduire avant même d’être considéré. La plupart ne s’en soucient pas.
La partie de l’histoire que les équipes d’ingénierie connaissent déjà
Il y a un détail sur la façon dont les agents vocaux IA sont réellement construits aujourd’hui qui n’est pas discuté dans la presse business, mais que toute personne qui construit dans cet espace rencontre immédiatement.
Une approche courante pour connecter de grands modèles linguistiques à de vrais appels téléphoniques aujourd’hui implique des cadres comme Asterisk, un cadre open‑source éprouvé et hautement adaptable. Utilisé avec des technologies telles que l’API Realtime d’OpenAI, Google Gemini Live et Deepgram, Asterisk offre un moyen flexible et fiable de relier l’audio généré par l’IA aux appels PSTN. Son interface AudioSocket, par exemple, permet le streaming en temps réel entre les modèles IA et les appels en direct, ce qui en fait un choix solide pour les développeurs construisant des systèmes IA vocaux.
Il existe un écosystème croissant de projets open‑source et de communautés de développeurs construisant des frameworks d’agents vocaux IA prêts pour la production sur Asterisk. Ce schéma gagne du terrain parce qu’il donne aux développeurs le contrôle sur la gestion des appels, le routage média et la logique d’intégration d’une manière que de nombreuses plateformes supérieures abstraient.
Cela a une importance stratégique car ce qui se produit lorsqu’un écosystème de développeurs standardise une partie de l’infrastructure. L’adoption d’entreprise suit l’adoption des développeurs d’environ 18 à 24 mois. Les ingénieurs qui construisent aujourd’hui des systèmes vocaux IA sur Asterisk sont les architectes qui spécifieront l’infrastructure pour les déploiements d’entreprise en 2027. Et Sangoma, l’entreprise qui a dirigé Asterisk ces deux dernières décennies, a la relation la plus profonde avec cette communauté de développeurs et l’influence la plus forte sur la direction future du cadre, n’est pas une startup. C’est la même organisation qui l’a construit.
Red Hat a construit un business extraordinaire en faisant exactement cela avec Linux. Elastic l’a fait avec la recherche. Le fossé open‑source est l’une des formes d’avantage concurrentiel les plus durables en technologie, précisément parce qu’il ne repose pas sur l’enclenchement des clients. Il est tellement ancré dans la façon dont les gens construisent que passer à autre chose nécessite de repartir de zéro.
Ce que les organisations devraient réellement faire maintenant
Si vous êtes un leader technologique ou opérationnel qui envisage le déploiement d’agents IA, la question à se poser n’est pas quel modèle utiliser. Il s’agit plutôt de savoir si l’infrastructure vocale sur laquelle vous construisez est de production, certifiée conforme à votre secteur et capable de survivre à une augmentation de 5× du volume d’appels lorsque le déploiement est en ligne.
La plupart des projets vocaux IA qui échouent en production échouent au niveau de l’infrastructure. Le modèle était solide. La latence était correcte en test. La documentation de conformité semblait adéquate. Et puis un environnement clinique réel, une chaîne de détail multi‑emplacements ou un district scolaire avec 40 000 élèves ont poussé le système de manières que l’intégration n’était pas conçue pour, et tout s’est effondré.
Il y a une autre dimension que la plupart des discussions sur les agents IA ignorent complètement. Quand un agent IA communique avec un humain, ou de plus en plus, avec un autre agent IA, chacune de ces interactions génère une trace de données sensibles qui doit être authentifiée, horodatée et sécurisée sur toute la pile de communication. Qui a parlé. Quand. Ce qui a été dit. Si la voix sur la ligne était bien celle qu’elle prétendait être. Si les données échangées entre agents ont été interceptées ou altérées en transit. Ce ne sont pas des cas limites. Ce sont les exigences de base de toute mise en œuvre vocale IA dans un environnement réglementé, et elles deviennent exponentiellement plus difficiles à garantir lorsqu’une entreprise assemble la voix d’un vendeur, la messagerie d’un autre, la vidéo d’un troisième et la sécurité réseau d’un quatrième.
Personne dans cette configuration ne possède la chaîne de bout en bout. Personne ne peut garantir où les données résident, qui les a touchées ou si la traçabilité tient sous un examen HIPAA ou une enquête de violation. Le certificat de conformité sur le mur d’un seul vendeur ne couvre que la tranche de ce vendeur. Les lacunes entre vendeurs, les transferts, les appels API, les données en transit entre plateformes appartiennent à personne. Ce fossé de responsabilité est là où les violations se produisent, où l’exposition réglementaire s’accumule, et où les déploiements d’agents IA échouent silencieusement aux exigences de confiance que les clients d’entreprise et de santé ne peuvent pas compromettre.
Un fournisseur unique et de confiance qui possède la pile complète, voix, messagerie, vidéo et réseau & sécurité, ne simplifie pas seulement l’achat. Il ferme entièrement le fossé de responsabilité, donne aux entreprises une chaîne de custodie unique pour chaque interaction, et rend la conformité quelque chose qui est structurellement garanti plutôt que manuellement assemblé à travers des contrats avec des vendeurs qui chacun renie la responsabilité de ce qui se passe hors de leur frontière. Sangoma est l’un des très rares fournisseurs sur le marché qui peut faire cette garantie, parce qu’il a construit l’ensemble de la pile lui‑même.
Les organisations qui réussissent le font sont celles qui ont traité l’infrastructure vocale comme une décision architecturale de premier ordre plutôt que comme un achat de commodité. Elles ont choisi des vendeurs avec des engagements SLA de niveau opérateur, des certifications de conformité existantes pour leur secteur et une expérience opérationnelle réelle pour maintenir la qualité vocale à l’échelle. Elles ont ensuite construit leur couche IA sur cette fondation plutôt que l’inverse.
La fenêtre pour prendre cette décision de façon réfléchie, avant que la pression concurrentielle n’oblige à un choix précipité, est probablement de 12 à 18 mois. Après cela, les organisations qui ont bien fait l’infrastructure tôt auront des déploiements de référence, des investissements de conformité cumulatifs et des bases installées que leurs concurrents passeront des années à essayer de déloger.
L’économie des agents IA se construit maintenant. Et comme chaque transition de plateforme avant, la couche d’infrastructure va compter plus, et plus longtemps, que la couche d’intelligence que tout le monde débat actuellement.
Chez Sangoma, nous construisons cette infrastructure depuis plus de 40 ans, bien avant que quelqu’un ne l’appelle IA‑ready. Ce que nous observons maintenant, c’est le marché qui rattrape enfin ce que la couche vocale a toujours été capable de faire. Cela ne nous rend pas à l’aise. Cela nous rend plus concentrés!
