Passer au contenu principal

Drapeau du CanadaPropriété et exploitation canadiennes

289 800‑1722
EluxAI

Agents qui gèrent et protègent

La surveillance réseau confiée à des agents qui réparent ce qu’ils trouvent

Les outils de surveillance réseau savent sonner l’alarme, mais pas régler le problème. EluxAI va plus loin. Notre orchestrateur d’IA dirige des agents entièrement autonomes qui apprennent le comportement normal de chaque système et lisent les journaux dès qu’un écart apparaît. Ils appliquent seuls les réparations sûres, puis ouvrent, traitent et ferment les billets, et une personne approuve tout correctif de code. C’est de l’AIOps conçu par une entreprise d’IA qui fait tourner le même moteur sur sa propre plateforme.

Propriété canadienne. Fonctionne sur des GPU NVIDIA.

Centre des opérations, Harbourline LogisticsSurveillance de nuit

La nuit dernière, de 2 h 40 à 3 h 10

  • 2 h 41

    Disque de la base de données à 91 %

    Réglé

    Anciens journaux archivés. Disque revenu à 63 %.

  • 2 h 43

    Hausse des erreurs du portail de suivi des envois

    Billet

    Billet ouvert pour l’agent de garde.

  • 2 h 52

    Tâche d’envoi des factures bloquée

    Réglé

    Tâche relancée et terminée.

  • 3 h 06

    Correctif de code pour le portail

    À approuver

    Testé dans une copie isolée.

Résumé du matin

Deux pannes réglées et vérifiées pendant la nuit. Une modification de code attend votre approbation, et chaque action figure au journal d’audit.

Illustration de la surveillance réseau et des systèmes par IA pour une entreprise de transport fictive à Halifax. Les systèmes et les événements sont fictifs.
Ce qu’elle surveille
Serveurs, applications, tâches et dépendances, avec des sondes réseau en développement
Comment elle décide
Une base de référence apprise pour chaque mesure, plus des vérifications strictes pour les disques, la mémoire et les tâches bloquées
Ce qu’elle fait
D’abord des réparations automatiques sûres, puis des billets traités par les agents de garde
Qui garde le contrôle
Une personne approuve les correctifs de code, et chaque intervention peut faire l’objet d’un retour arrière
Sur cette page

Que fait concrètement la surveillance réseau et des systèmes par IA?

La surveillance réseau et des systèmes par IA observe vos serveurs, vos applications et vos tâches de fond, remarque quand quelque chose s’écarte de la normale et agit. Les agents lisent les journaux pour trouver la cause, appliquent les réparations qu’on peut annuler sans risque et ouvrent un billet quand une réparation ne tient pas. Un agent de garde traite ensuite le billet, et une personne approuve tout ce qui modifie le code.

Exemple illustratif. Harbourline Logistics, une entreprise fictive de transport de marchandises établie à Halifax, exploite son portail de suivi des envois sur deux serveurs. En pleine nuit, à 2 h 41, le disque de la base de données dépasse 90 %, parce que de vieux journaux se sont accumulés. Personne dans l’équipe n’est réveillé.

L’agent de surveillance voit la tendance avant que le disque soit plein, effectue la rotation des journaux trop volumineux et confirme que l’espace est libéré. Peu après, les erreurs du portail commencent à grimper. Cette panne ne peut pas être réparée automatiquement sans risque : un billet s’ouvre et l’agent de garde commence son enquête. Au matin, l’équipe trouve un court résumé et une seule modification qui attend son approbation.

Une surveillance réseau traditionnelle aurait envoyé deux alertes, puis attendu. C’est entre le moment où l’on constate un problème et celui où l’on agit que les pannes prennent de l’ampleur. Voilà pourquoi ce service rejoint nos autres services d’IA pour entreprises, au lieu de devenir un tableau de bord de plus.

Comment la détection d’anomalies repère-t-elle les problèmes avant vos utilisateurs?

Au lieu de seuils fixes, le système apprend ce qui est normal pour chaque signal suivi, comme la charge du processeur, la mémoire, l’espace disque et le trafic réseau. Chaque nouvelle mesure est évaluée en écarts-types par rapport à cette base de référence apprise. Un pic inhabituel ressort, même sous une limite d’alarme classique. Des vérifications strictes couvrent les pannes qu’une base de référence peut manquer, comme un disque sur le point d’être plein.

  • Bases de référence apprises : chaque mesure établit son propre profil normal, si bien qu’un serveur tranquille et un serveur très sollicité sont jugés équitablement.
  • Des limites strictes là où elles comptent : disques et descripteurs de fichiers qui s’épuisent, mémoire en va-et-vient intensif et matériel qui surchauffe.
  • Travail bloqué : les longues tâches qui cessent de progresser sont repérées, même quand rien n’a techniquement échoué.
  • Vérification des dépendances : les services dont vos systèmes dépendent sont testés à quelques minutes d’intervalle, et une alerte se ferme d’elle-même dès que la vérification réussit de nouveau.

Résultat : moins de fausses alertes et des avertissements plus hâtifs. Un seuil trop bas réveille des gens pour rien. Un seuil trop haut reste muet jusqu’à ce que les clients remarquent le problème. Les bases de référence apprises évitent ces deux écueils.

Tableau de surveillance réseau : processeur, mémoire, disque et trafic sortant comparés à leur normale, une anomalie signalée

Comment les agents lisent-ils les journaux pour trouver la cause?

Les journaux racontent l’histoire de chaque panne, mais personne n’a le temps de les lire à 3 h du matin. Nos agents, eux, le font. Ils regroupent les erreurs répétées par signature, relient une hausse d’erreurs au changement ou à l’événement qui l’a précédée et rédigent une courte explication dans le billet. Après une réparation, ils continuent de lire les journaux pour confirmer que l’erreur a vraiment disparu.

  • Signatures d’erreur : des milliers de lignes semblables se résument en un seul problème, avec un décompte et l’heure de la première occurrence.
  • Contexte : l’agent vérifie ce qui a changé juste avant la panne, comme une mise en production, une modification de configuration ou une hausse soudaine du trafic.
  • Explications claires : les billets disent ce qui s’est passé, ce qui a été tenté et ce que montrent les données.
  • Suivi : la même signature reste sous surveillance après une réparation ou un correctif, ce qui permet de repérer tôt une récidive discrète.

Le Centre canadien pour la cybersécurité considère la journalisation et la surveillance comme un élément essentiel de la protection d’un réseau. Aux États-Unis, le guide du NIST sur la gestion des journaux fait le même constat. Recueillir les journaux, c’est la partie facile. Les lire avec constance, voilà où des agents autonomes changent la donne.

Analyse des journaux en 5 signatures d’erreur, syslog des routeurs et pare-feux affiché en développement

Que peut réparer le système seul, et qu’est-ce qui attend une personne?

Les réparations sûres et réversibles s’appliquent automatiquement : redémarrer un processus bloqué, relancer une tâche immobilisée, vider un cache plein ou effectuer la rotation des journaux trop volumineux. Tout ce qui est plus risqué devient un billet. Les correctifs de code sont rédigés dans une copie isolée, testés, puis mis en attente de l’approbation d’une personne. Une fois approuvés, ils restent sous surveillance, avec retour arrière automatique si l’erreur d’origine revient.

  1. Détecter : un capteur ou une vérification de l’état signale le problème.
  2. Réparer sans risque : s’il existe une réparation sûre et réversible, elle est appliquée et consignée.
  3. Vérifier : la même vérification est relancée pour prouver que la réparation tient.
  4. Faire remonter : si la réparation ne tient pas, un billet s’ouvre pour l’agent de garde.
  5. Préparer un correctif : le code est modifié et testé dans une copie isolée, jamais sur le système en production.
  6. Approuver : une personne de votre équipe examine et approuve le correctif.
  7. Surveiller et revenir en arrière : le correctif est surveillé pendant trois jours et annulé automatiquement si l’erreur réapparaît.

La gouvernance est intégrée. Chaque comportement automatique peut être désactivé individuellement. Vous pouvez commencer par la détection et les billets seulement, puis autoriser les réparations sûres quand les résultats vous inspirent confiance. Chaque action est inscrite au journal d’audit, et un interrupteur d’arrêt d’urgence arrête d’un seul geste tous les agents de l’entreprise.

Comment les billets sont-ils ouverts, traités et fermés de façon autonome?

Chaque problème devient un seul billet, et non une avalanche d’alertes en double. L’orchestrateur confie le billet à l’agent de garde pour ce type de problème, qui enquête, applique ce qui est sans risque et documente chaque étape. Quand la réparation tient, le billet se ferme, et la vérification qui l’a déclenché continue de tourner. Les membres de votre équipe peuvent aussi ouvrir des billets, que les agents traitent de la même façon.

  • Aucun doublon : les alertes répétées sur un même problème se rattachent à un seul billet.
  • Rotation de garde : les problèmes d’infrastructure, de code et de qualité vont chacun à l’agent spécialisé approprié.
  • Des preuves, pas des promesses : un billet n’est résolu que lorsque la vérification d’origine réussit de nouveau.
  • Sécurité comprise : un autotest de sécurité quotidien ouvre un billet pour chaque constat.

Cette gestion des incidents s’appuie sur le même centre de billets que nos agents IA sur mesure. Pour tester plus à fond, avec votre autorisation écrite, ce que des attaquants peuvent voir de l’extérieur, jumelez la surveillance à un pentest IA.

Cycle d’un billet AIOps : réparation échouée, analyse des journaux, correctif approuvé, surveillé 72 h, puis fermé

Sondes réseau et ingestion syslog : qu’est-ce qui est en développement?

Deux fonctions sont en développement chez EluxAI Labs. Les sondes réseau vérifieront si vos équipements répondent, mesureront la latence et contrôleront l’état des services sur l’ensemble de votre réseau. L’ingestion syslog permettra aux routeurs, aux pare-feux, aux commutateurs et à d’autres appareils d’envoyer leurs journaux directement aux agents. Les deux prolongeront le moteur de détection, de réparation et de billets décrit ici, et nous confirmons leur disponibilité lors de votre évaluation.

D’ici leur lancement, la surveillance couvre les serveurs, les applications et les services où les agents s’exécutent ou auxquels ils ont accès. Nous présentons notre feuille de route franchement, parce qu’en surveillance, trop promettre cause de vrais dégâts.

Ces fonctions suivent la même règle que le reste de notre recherche. Les idées nouvelles sont mises à l’essai chez EluxAI Labs et à l’Incubateur EluxAI, sur de vraies charges de travail, avant d’atteindre le système d’un client. C’est ainsi qu’une idée révolutionnaire devient une fonction fiable.

Outils de surveillance, infogérance ou agents autonomes : quelle option choisir?

Les outils de surveillance détectent et alertent. L’infogérance ajoute des techniciens qui interviennent, souvent aux heures de bureau seulement. Les agents autonomes détectent, enquêtent, réparent ce qui peut l’être sans risque et traitent les billets jour et nuit, pendant qu’une personne approuve les changements risqués. Ces options se combinent bien. Si vous faites déjà appel à un fournisseur de soutien informatique, les agents peuvent assurer la première intervention et lui transmettre de meilleurs billets.

Quatre façons de garder vos systèmes en bonne santé
OptionDétecte les problèmesLit les journauxRépare seul, sans risqueTraite les billets la nuitProuve que la réparation tient
Outils de surveillance réseauOuiEn partieNonNonNon
Infogérance et soutien informatiqueOuiOui, par des personnesParfoisSelon le contratVariable
Plateformes AIOpsOuiOuiLimitéRarementVariable
Surveillance réseau et systèmes IA d’EluxAIOui, selon des bases de référence apprisesOui, par signature d’erreurOui, réparations réversiblesOui, avec des agents de gardeOui, la vérification est relancée

Verdict : les outils vous signalent une panne. Les agents autonomes vous disent ce qui est tombé en panne, réparent ce qui peut l’être sans risque et vous en montrent la preuve.

Quelles équipes peuvent profiter d’une surveillance autonome?

Toute équipe dont les systèmes ne peuvent être surveillés à toute heure. Les agences Web peuvent garder en ligne les sites et les formulaires de leurs clients. Les développeurs d’applications et les éditeurs de logiciels peuvent repérer les erreurs dès la mise en production. Les cliniques, les gestionnaires immobiliers et les fabricants qui ont leurs propres serveurs peuvent être couverts la nuit sans quart de nuit. Les fournisseurs d’infogérance peuvent confier la première intervention aux agents.

  • Agences : sites, formulaires et comptes d’hébergement des clients sous surveillance, avec des billets prêts avant qu’un client appelle.
  • Développeurs d’applications et éditeurs de logiciels : erreurs regroupées dès qu’une version est mise en production, avec retour arrière quand une modification se comporte mal.
  • Cliniques et cabinets professionnels : serveurs de prise de rendez-vous et de dossiers maintenus en bon état en dehors des heures de bureau.
  • Fabricants et entreprises de logistique : systèmes de planification et d’inventaire surveillés, pour qu’aucune tâche bloquée ne retarde un quart de travail.
  • Fournisseurs d’infogérance et de soutien informatique : première intervention assurée jour et nuit, avec des billets clairs pour vos techniciens.

Les équipes qui conçoivent leurs propres logiciels peuvent relier la surveillance au développement d’applications par IA, pour que les correctifs soient rédigés par les agents mêmes qui ont écrit le code. Pour définir la couverture de vos systèmes, parlez à notre équipe canadienne.

Fonctionne sur des GPU NVIDIA

Technologie NVIDIA : une analyse qui suit chaque signal

La surveillance produit un flot constant de chiffres et de lignes de journal, et le comprendre rapidement exige une sérieuse puissance de calcul. Notre système agentique tourne sur notre propre serveur à GPU NVIDIA. Des modèles de langage et de plongements vectoriels y lisent les journaux, regroupent les erreurs et rédigent les explications, sans envoyer vos données opérationnelles à un service public.

La vitesse compte surtout pendant qu’une panne est en cours. Selon NVIDIA, son système GB200 NVL72 offre une inférence en temps réel des grands modèles de langage jusqu’à 30 fois plus rapide que les systèmes NVIDIA H100. C’est ce rythme d’innovation qui nous a fait choisir NVIDIA comme fondation pour des agents qui doivent garder les idées claires à 3 h du matin.

EluxAI Labs, recherche et développement en Ontario, au Canada

Comment la recherche d’EluxAI Labs empêche-t-elle une réparation automatique d’aggraver la situation?

Une réparation ne compte que si elle tient. Les travaux d’EluxAI Labs, en Ontario, ont façonné l’étape de vérification de nos agents de surveillance : chaque réparation automatique est revérifiée au regard du signal qui l’a déclenchée, et chaque correctif de code approuvé reste sous surveillance après sa mise en production. Si le problème revient, un retour arrière automatique annule le changement et le billet est rouvert. Rien n’est déclaré réglé sur une simple supposition.

Ce que cela pourrait donner dans votre secteur

Recherche clinique
Les portails d’étude et les systèmes de données sont surveillés jour et nuit, et toute modification apportée à un système validé attend une approbation.
Services bancaires
Les services destinés à la clientèle sont vérifiés pour repérer les erreurs et les lenteurs, et chaque réparation est consignée en vue des audits.
Fabrication
Pour les serveurs d’usine et les systèmes de planification, un billet s’ouvre avant qu’une tâche bloquée ne retarde un quart de travail.
Marketing
Les agences peuvent garder en ligne les sites et les formulaires de leurs clients, et les alertes sont traitées avant le lancement d’une campagne.

Questions sur la surveillance réseau et des systèmes par IA

Qu’est-ce que l’AIOps?

L’AIOps désigne l’utilisation de l’intelligence artificielle dans les opérations informatiques : détecter les problèmes dans les systèmes, en trouver la cause et intervenir plus vite qu’une équipe ne pourrait le faire seule. Bien des produits AIOps se limitent à des alertes plus intelligentes. EluxAI va plus loin, avec des agents qui appliquent des réparations sûres, traitent les billets et vérifient les résultats, pendant qu’une personne de votre équipe approuve toute modification de code risquée.

Est-ce que cela remplace nos outils de surveillance actuels?

Pas nécessairement. Vos outils actuels peuvent continuer de recueillir des données et d’envoyer des alertes. Nos agents ajoutent ce qui leur manque habituellement : lire les journaux, décider quoi faire, appliquer des réparations sûres et mener chaque billet jusqu’à un résultat vérifié. Lors de l’évaluation, nous déterminons où les agents apportent une réelle valeur et où votre installation actuelle fonctionne déjà bien.

Les agents peuvent-ils régler des problèmes sans notre approbation?

Seulement les réparations que vous autorisez, et seulement celles qu’on peut annuler sans risque, comme redémarrer un processus bloqué ou vider un cache plein. Chaque comportement automatique a son propre interrupteur. Les correctifs de code attendent toujours l’approbation d’une personne, et chaque action, automatique ou approuvée, est inscrite au journal d’audit, que votre équipe peut consulter en tout temps.

Que se passe-t-il si une réparation aggrave la situation?

Chaque réparation est vérifiée de nouveau après son application, et les correctifs de code approuvés restent sous surveillance pendant trois jours. Si l’erreur d’origine revient, un retour arrière automatique restaure la copie de sauvegarde, et le billet est rouvert avec une note qui demande d’essayer une autre approche. Rien n’est déclaré résolu tant que la vérification qui a signalé le problème ne réussit pas de nouveau.

Le système peut-il lire les messages syslog des routeurs et des pare-feux?

Pas encore. L’ingestion syslog pour les équipements réseau est en développement chez EluxAI Labs, tout comme les sondes réseau qui vérifieront la disponibilité et la latence. Aujourd’hui, la surveillance couvre les serveurs, les applications et les services où les agents s’exécutent ou auxquels ils ont accès. Lors de l’évaluation, nous vous disons franchement quelles parties de votre environnement peuvent être couvertes dès maintenant et lesquelles dépendent de la feuille de route.

Qui s’occupe des problèmes la nuit et la fin de semaine?

Les agents. La surveillance, les réparations sûres et le traitement des billets se poursuivent jour et nuit, et chaque type de problème est confié à l’agent de garde qui en est responsable. Une personne intervient quand une décision exige un jugement humain, comme l’approbation d’un correctif de code. Vous choisissez qui est avisé, à quel moment et par lesquels des canaux que votre équipe utilise déjà.

Nos journaux et nos données de systèmes restent-ils confidentiels?

Oui. Les journaux et les mesures restent dans votre espace de travail privé, et les modèles de langage qui les lisent peuvent tourner sur des GPU NVIDIA que nous exploitons, avec des options de résidence des données. L’accès se fait selon les rôles, vos données opérationnelles ne servent pas à entraîner des modèles pour qui que ce soit d’autre, et chaque action effectuée sur vos systèmes est consignée au journal d’audit.

Combien coûte la surveillance autonome?

Tout dépend du nombre de systèmes surveillés, du volume de journaux qu’ils produisent et des réparations autorisées à s’appliquer automatiquement. Après une évaluation gratuite, vous recevez une soumission écrite à prix fixe, qui distingue les frais de mise en place du coût mensuel. Comparez ce montant au coût d’une seule panne en pleine nuit, ou à celui d’un technicien de soutien informatique affecté au quart de nuit.

Cessez d’apprendre vos pannes de la bouche de vos clients

Chaque heure où une panne passe inaperçue vous coûte des clients et des heures de sommeil. Dites-nous quels systèmes vous empêchent de dormir, et nous tracerons un plan de surveillance autonome lors d’une évaluation gratuite.

  • Une personne de notre équipe examine chaque demande liée au service « Surveillance réseau et systèmes IA » et répond en un jour ouvrable.
  • Votre plan pour le service « Surveillance réseau et systèmes IA » précise les outils de l’agent, ce qu’il gère seul et ce qui attend une approbation.
  • L’évaluation du service « Surveillance réseau et systèmes IA » est gratuite et sans obligation. Vous préférez en parler au téléphone? Appelez le 289 800‑1722.

Équipe canadienne à Aurora, en Ontario