Pourquoi EluxAI est-elle plus qu’une entreprise d’IA agentique?
Les agents sont la partie visible. En dessous, nos ingénieurs optimisent la façon dont les grands modèles de langage répondent aux gens. Ce travail porte sur ce que le modèle reçoit, sur ce qu’il renvoie et sur les jetons qu’il consomme entre les deux. Résultat : un système qui ne se contente pas de suivre des consignes ou d’écumer le Web. Il améliore et enrichit ce que produit le modèle.
Bien des produits d’IA branchent un modèle sur quelques outils et relaient tel quel ce qu’il dit. Cette approche hérite de toutes les faiblesses du modèle : contexte manquant, erreurs affirmées avec aplomb, réponses qui s’arrêtent en chemin et factures qui grossissent à chaque jeton gaspillé.
Notre approche ajoute une couche d’ingénierie entre les deux. La différence est révolutionnaire parce qu’elle améliore tous les agents à la fois. Dès que notre façon d’utiliser un modèle progresse, l’agent réceptionniste, les agents de recherche et les agents de programmation s’améliorent le jour même.
Cette ingénierie s’applique quel que soit le modèle conventionnel choisi pour une tâche, y compris les modèles qui tournent sur notre propre serveur à GPU NVIDIA. Les gains restent donc acquis à mesure que les modèles évoluent, sans repartir de zéro à chaque nouvelle génération.
C’est ce travail qui soutient l’ensemble de nos services d’IA pour les entreprises, et c’est là que va l’essentiel de notre effort de recherche. Pour en savoir plus sur l’entreprise et ses principes, consultez notre page À propos.
Comment l’optimisation des entrées améliore-t-elle les réponses d’un LLM?
Une réponse ne vaut jamais mieux que la requête qui l’a produite. Avant tout envoi, notre algorithme retient le contexte utile, écarte les doublons et le bruit, classe les consignes par priorité et fait tenir le tout dans un budget de jetons adapté au travail. L’ingénierie des requêtes (prompt engineering) et l’ingénierie du contexte se font automatiquement à chaque requête, et non une seule fois dans un gabarit figé.
- Contexte pertinent : les faits, les documents et l’historique des conversations sont choisis en fonction de la tâche, au lieu d’être collés en bloc.
- Priorités claires : les règles les plus importantes sont énoncées une seule fois, simplement, là où elles ne risquent pas de se perdre dans une longue requête.
- Budget par tâche : un appel en direct, une modification de code et une synthèse de recherche reçoivent chacun un budget de contexte adapté.
- Tests continus : les formats de requête sont mesurés sur des résultats réels et remplacés dès qu’une meilleure version fait ses preuves.
Exemple illustratif. Une patiente demande à l’agent réceptionniste d’une clinique de Sherbrooke s’il y a des frais d’annulation. Sans optimisation, le modèle pourrait recevoir tout le manuel des politiques, l’infolettre du mois dernier et trois conversations sans rapport. Avec l’optimisation, il voit la grille de frais en vigueur, le rendez-vous de la patiente et une seule consigne sur le ton. La réponse revient plus courte, moins coûteuse et exacte.
On sous-estime facilement cet effet. Un modèle qui lit dix paragraphes pertinents fait généralement un meilleur travail que le même modèle enseveli sous deux cents. L’ingénierie du contexte n’a rien de décoratif. C’est elle qui distingue une réponse adaptée à votre entreprise d’une réponse qui a seulement l’air juste.
Que devient la réponse d’un modèle avant qu’on s’y fie?
Elle est vérifiée, complétée et enrichie. Notre système s’assure que la réponse est bel et bien terminée, que ses affirmations remontent à une source et que le code fait ce qu’il annonce. Il ajoute ensuite ce dont une personne a besoin pour agir : références, structure, prochaines étapes et incertitudes signalées. Un LLM conventionnel rédige la première ébauche. Notre système en fait un travail fiable.
- Réponses complètes : une réponse qui s’arrête au milieu d’une phrase ou d’un fichier est détectée et terminée, jamais livrée à moitié.
- Ancrage dans les sources : l’algorithme de vérification d’EluxAI Labs retire ou signale les affirmations qu’il ne peut pas rattacher à vos sources.
- Enrichissement : les réponses gagnent des références, une mise en forme claire et les détails dont un réviseur a besoin pour les approuver rapidement.
- Limites assumées : quand les preuves sont minces, la réponse le dit franchement et la décision revient à une personne.
Les hallucinations de l’IA sont un risque documenté. Une étude publiée en 2023 dans Scientific Reports a révélé qu’un modèle d’agent conversationnel très répandu avait inventé plus de la moitié des références produites pour des revues de littérature. L’optimisation des sorties existe pour que ce genre d’erreur soit détecté d’abord par un logiciel, et non par vos clients.

Pourquoi l’optimisation des jetons compte-t-elle pour les coûts et la qualité?
Les jetons (tokens) mesurent le travail d’un modèle, et chacun coûte du temps, de l’énergie et de l’argent. Envoyer moins de jetons, mais mieux choisis, améliore souvent les résultats, car le modèle n’est pas distrait par du texte inutile. Nos ingénieurs optimisent les jetons en continu, pour que chaque tâche consomme le strict nécessaire. Les économies varient selon la charge de travail : nous les mesurons sur vos tâches réelles.
- Coût : des requêtes et des réponses plus sobres réduisent les frais d’exploitation de chaque agent, mois après mois.
- Rapidité : une requête plus courte obtient sa réponse plus vite, ce qui compte surtout pendant un appel en direct.
- Qualité : une requête ciblée garde l’attention du modèle sur les faits qui déterminent la réponse.
- Capacité : un usage efficace du temps de calcul permet d’exécuter plus de travail sur le même matériel NVIDIA.
Viser moins de jetons, c’est aussi savoir quand ne pas appeler de modèle du tout. Les consultations de routine, la mise en forme et bien des vérifications s’exécutent comme des logiciels ordinaires, plus rapides et sans consommer un seul jeton. Le modèle est réservé aux parties d’une tâche qui exigent vraiment la compréhension du langage.
L’optimisation des jetons est un travail continu, pas un réglage qu’on fait une fois pour toutes. Les modèles changent, vos documents s’accumulent et de nouvelles tâches apparaissent. Les budgets et les formats de requête sont révisés au fil de ces changements, pour que l’efficacité ne s’effrite pas en silence.
À quoi ressemble une sortie enrichie, des articles de recherche aux bases de code?
Une sortie enrichie est plus utile que ce que le modèle a écrit seul. Un article de recherche devient une synthèse accompagnée des passages qui appuient chaque point. Une modification de code arrive avec ses tests, une explication claire et la liste des fichiers touchés. Une question sur une politique renvoie la clause exacte. La même couche d’optimisation fait ce travail pour tous les types de tâches.
- Recherche : les nouveaux articles et les nouvelles normes deviennent des synthèses citées grâce à notre service de veille technologique IA.
- Savoir de l’entreprise : les politiques et les manuels fournissent des réponses qui nomment leur source.
- Code : les modifications sont proposées avec leurs tests et révisées avant qu’une personne les fusionne.
- Conversations avec la clientèle : les appels, les textos et les courriels reçoivent des réponses ancrées dans vos propres renseignements approuvés.
C’est dans les secteurs où une mauvaise réponse coûte cher que la différence se voit le plus : recherche clinique, banques, fabrication, assurance et marketing. Dans chacun, le but reste le même. Il s’agit de remettre aux gens un résultat qu’ils peuvent vérifier rapidement et auquel ils peuvent se fier.
Dans quels langages de programmation le système peut-il coder?
Nos agents de développement détectent et utilisent 20 langages de programmation : TypeScript, JavaScript, PHP, Python, Go, Rust, Ruby, Java, Kotlin, C#, Swift, Dart avec Flutter, Elixir, Scala, Clojure, Haskell, Zig, Lua, Perl et scripts shell, en plus de SQL, HTML et CSS. Ils reconnaissent aussi plus de 150 cadriciels (frameworks), bases de données et outils de construction, d’Astro et de Next.js à Django, Spring Boot et Ruby on Rails.
Connaître la syntaxe d’un langage, c’est la partie facile. Écrire du code qui s’intègre à un projet existant est plus exigeant. Il faut le bon contexte : les fichiers voisins, les conventions de nommage, la suite de tests et les raisons des décisions antérieures. L’optimisation des entrées fournit exactement cela, dans un budget défini, pour que les grands dépôts de code restent gérables.
Quand l’IA code dans un projet, elle doit en respecter les habitudes. Chaque projet est donc analysé avant le début du travail. Les agents suivent les outils qu’il utilise déjà, comme PHPUnit, pytest, Jest ou Playwright, et chaque modification est testée avec ces outils avant d’être proposée.
Les équipes qui bâtissent des produits peuvent mettre cette capacité à profit grâce au développement d’applications par IA. Un assistant de programmation IA y planifie, écrit, révise et teste les modifications, tandis que vos développeurs gardent le dernier mot.
Comment fonctionne la traduction instantanée d’une langue à l’autre?
Au téléphone, les agents parlent et comprennent 25 langues : anglais, français, espagnol, portugais, allemand, italien, néerlandais, suédois, polonais, grec, russe, ukrainien, turc, arabe, farsi, hindi, pendjabi, tamoul, mandarin, cantonais, japonais, coréen, vietnamien, thaï et tagalog. L’appelant peut changer de langue en cours d’appel. Les textos, les courriels et le clavardage suivent la langue dans laquelle la personne écrit, et votre équipe reçoit des notes de chaque échange.
Pour une entreprise canadienne, tout commence par le français et l’anglais, avec, en option, un accueil qui commence en français pour les appels provenant de numéros du Québec. La couverture s’étend ensuite aux langues très parlées dans les communautés locales, comme le pendjabi, le mandarin, le cantonais, le tagalog, l’arabe et l’espagnol.
La couche d’optimisation joue ici aussi un rôle. Elle transmet tels quels les noms, les prix et les termes des politiques d’une langue à l’autre, là où un traducteur IA trop littéral trébuche souvent. Le texte original est toujours conservé à côté de la traduction.
La traduction instantanée fait fonctionner les agents vocaux, de textos et de courriel, dont la réceptionniste virtuelle IA. La qualité varie selon la langue et le sujet. C’est pourquoi nous testons les langues de votre clientèle avant toute mise en service.

Technologie NVIDIA : l’optimisation à la vitesse du GPU
Optimiser chaque requête et chaque réponse ajoute du travail, et ce travail doit se faire en quelques millisecondes. Notre système fonctionne sur notre propre serveur à GPU NVIDIA, où tournent les modèles de langage, de vision, de voix et de plongements vectoriels, et où nous affinons des modèles. Les vérifications supplémentaires ne ralentissent donc jamais une conversation en direct.
L’économie des jetons évolue vite, et NVIDIA donne le ton. Avec sa plateforme Vera Rubin, NVIDIA affirme offrir jusqu’à 10 fois plus de débit d’inférence par watt, pour un dixième du coût par jeton, par rapport à Blackwell. Notre optimisation des jetons est conçue pour démultiplier ce genre de gains plutôt que de les gaspiller.
