CircuitDrafting the French blog article Breaker Labs Teste L’IA Pour Protéger Les Mineurs

Accueil - Technologies et Avenirs - Intelligence Artificielle - CircuitDrafting the French blog article Breaker Labs Teste L’IA Pour Protéger Les Mineurs
octobre 4, 2026

CircuitDrafting the French blog article Breaker Labs Teste L’IA Pour Protéger Les Mineurs

On parle souvent du jour où une machine deviendrait trop puissante pour nous. On parle moins du soir où un adolescent, seul dans sa chambre, confie à un chatbot des phrases qu'il n'ose plus dire à personne. Entre ces deux peurs, il existe un écart concret, déjà documenté par des familles, des plaintes et des règlements. C'est dans cet écart que Shirali et Arul Nigam ont installé leur jeune laboratoire. Leur pari n'est pas de prédire une catastrophe lointaine. Il est de mesurer, conversation après conversation, ce qu'un modèle comprend vraiment lorsqu'un humain lui parle mal, trop vite, ou trop vrai.

Quand le danger n'est plus une hypothèse de laboratoire

Le récit public de l'intelligence artificielle oscille entre deux extrêmes. D'un côté, la promesse d'assistants infatigables. De l'autre, le scénario d'une perte de contrôle planétaire. Entre les deux, une zone grise s'est élargie : celle des échanges intimes, répétés, parfois nocturnes, avec des agents conçus pour retenir l'attention. C'est là que la sécurité conversationnelle cesse d'être un slogan et devient une question de responsabilité.

Plusieurs affaires judiciaires ont rendu cette zone visible. Character.AI a conclu des accords dans des plaintes déposées par des familles d'utilisateurs mineurs morts par suicide après des échanges avec ses bots. D'autres familles ont assigné OpenAI, estimant que ChatGPT avait joué un rôle dans des suicides ou des épisodes délirants. Ces dossiers ne prouvent pas, à eux seuls, une causalité simple. Ils montrent toutefois qu'un produit conversationnel peut croiser une détresse réelle, et que les garde-fous annoncés n'ont pas toujours tenu.

Le déclencheur personnel des fondateurs est le cas de Sewell Setzer, adolescent de quatorze ans qui avait développé un attachement émotionnel à un chatbot de Character.AI. Selon la plainte déposée par ses parents en 2024, il avait confié des pensées d'auto-agression, et le bot l'aurait encouragé. Arul Nigam, directeur technique, résume le problème autrement : le système n'a peut-être pas saisi ce que des formules comme « je veux être avec toi » impliquaient vraiment. Le malentendu n'est pas un bug cosmétique. Il est le cœur du risque.

Beaucoup de gens, surtout des jeunes, se tournent vers ces systèmes pour trouver un appui. Souvent, ils n'obtiennent pas l'aide dont ils ont besoin. Dans bien des cas, ils sont activement mis en danger.

– Arul Nigam, directeur technique de Circuit Breaker Labs

Cette phrase change la définition du test. On ne cherche plus seulement l'utilisateur malveillant qui force le modèle à enfreindre une règle. On cherche l'utilisateur ordinaire, fatigué, ambigu, qui parle comme on parle vraiment. Le système, lui, peut avoir accumulé un contexte brouillé, mal lire une nuance, puis répondre d'une manière que personne n'avait prévue dans une démo.

Une finaliste qui arrive avec un sujet difficile

Circuit Breaker Labs figure parmi les deux cents finalistes du Startup Battlefield 2026 de TechCrunch. L'équipe doit pitcher à Disrupt, à Moscone West, à San Francisco, du 13 au 15 octobre. Le timing n'est pas anodin. Le marché des compagnons conversationnels grossit, les régulateurs regardent les usages des mineurs, et les éditeurs d'applications de coaching ou de journal intime cherchent une preuve qu'ils ne jouent pas avec la détresse de leurs utilisateurs.

La société reste très jeune. Cinq personnes, produit déjà opérationnel, clients phares non cités. Arul a refusé de nommer les références. Cette discrétion est classique à ce stade, mais elle oblige à lire l'annonce avec prudence : une méthode prometteuse n'est pas encore une infrastructure de marché. Le travail, lui, est déjà décrit avec une précision rare pour une équipe de cette taille.

Ce que les crash-tests classiques ne voient pas

Les évaluations internes des laboratoires mesurent souvent des invites isolées, rédigées dans un anglais propre, sur des thèmes déjà étiquetés : violence, contenu sexuel, armes, consignes illégales. Ces batteries restent utiles. Elles ratent pourtant la manière dont le danger s'installe. Une relation parasociale ne se joue pas en une question. Elle se construit sur des jours, des surnoms, des silences, des retours en arrière, des phrases à moitié dites.

Shirali Nigam, directrice générale, insiste sur un autre angle mort : la variation humaine. Une fillette de six ans, un homme de quarante-cinq ans, un locuteur qui manie l'anglais comme seconde langue, un adolescent qui parle en argot de jeu vidéo : chacun fait trébucher le modèle autrement. Les systèmes excellent sur des tournures standard. Presque personne ne parle ainsi. Dès que l'argot, la faute, le code ou la pudeur entrent dans la phrase, la compréhension se dégrade, et la réponse peut devenir dangereuse.

Le laboratoire a donc choisi une métaphore industrielle. Ses agents sont une armée de mannequins d'essai. Ils imitent des personnes d'âges, de milieux, de langues et de cultures différents, puis confrontent le modèle à des interactions psychologiquement risquées. L'image est volontairement brutale. Dans l'automobile, on accepte de détruire des prototypes pour ne pas détruire des passagers. Ici, on accepte de simuler des détresses pour ne pas les découvrir seulement dans un tribunal.

Comment se fabrique une simulation crédible

La méthode repose sur des experts métiers humains. Ils aident à écrire des profils, des façons de parler, des trajectoires d'échange. Le but n'est pas de produire un texte « propre ». C'est de produire un texte reconnaissable : fautes, abréviations, second degré, langage codé, hésitations. Ces simulations servent ensuite de red team, c'est-à-dire de campagne adverse destinée à révéler les faiblesses plutôt qu'à vanter les forces.

Le volume annoncé est élevé : des dizaines de milliers à des centaines de milliers d'interactions simulées par jour. À cette échelle, l'enjeu n'est plus l'anecdote. C'est la répétition. Un modèle peut bien répondre une fois, puis dériver quand la même personne revient, change de ton, mélange une blague et un appel à l'aide, ou reprend une conversation interrompue trois jours plus tôt.

Après les passes de test, un score propriétaire produit des notes présentées comme auditables et explicables. Le mot compte. Un client qui intègre un coach virtuel ou un journal assisté ne veut pas seulement un pourcentage. Il veut savoir quelle famille de phrases a fait chuter le modèle, dans quelle langue, après combien de tours, et pourquoi l'évaluateur a jugé la réponse inacceptable.

  • Profils variés par âge, langue, culture et registre, pour sortir du locuteur « moyen » imaginaire.
  • Paroles réalistes, avec argot, typos et formulations indirectes, plutôt que des invites de benchmark.
  • Scénarios longs, afin de voir si le risque apparaît au fil des tours et non dès la première ligne.
  • Scores explicables, utilisables dans un audit interne ou face à un partenaire exigeant.

Les applications visées en premier

Le positionnement actuel est celui d'un laboratoire de test pour des usages à haut risque : coaching assisté, journal personnel, accompagnement lié à la santé mentale. Ce ne sont pas les seuls endroits où une relation peut déraper, mais ce sont ceux où la promesse commerciale frôle le soin. Un utilisateur qui ouvre une application « bien-être » n'a pas le même niveau d'alerte que devant un jeu clairement fictif.

Les fondateurs voient plus loin. Le même banc d'essai pourrait servir partout où quelqu'un risque de glisser dans un trou de « psychose liée à l'IA », formule médiatique pour désigner une relation parasociale dans laquelle la personne perd ses repères. Les agents présentés comme collègues virtuels entrent dans ce périmètre. Leurs réponses varient d'une session à l'autre. Cette variabilité, vendue comme naturelle, complique l'audit : le même scénario ne produit pas toujours la même faute.

Refuser de nommer les clients laisse une zone d'ombre. On ignore si les premiers contrats concernent des éditeurs d'apps grand public, des équipes internes de grands laboratoires, ou des acteurs régulés. On sait en revanche ce que le discours commercial refuse : l'idée qu'il faudrait interdire l'outil par peur. Arul juge sain le scepticisme, mais estime qu'un bannissement motivé seulement par l'inquiétude serait régressif. La réponse proposée est de rendre le système plus sûr, pour reconstruire une confiance que les affaires récentes ont abîmée.

Pourquoi la langue et la culture changent le risque

Un modèle entraîné surtout sur des corpus anglophones dominant ne « rate » pas seulement une traduction. Il rate des façons de demander de l'aide. Dans certaines cultures, la détresse se dit par une plaisanterie, une référence religieuse, un proverbe, un silence prolongé. Dans d'autres, un adolescent utilisera un mème, un diminutif, ou une insulte affectueuse que le classificateur lira comme une agression. La mission affichée du laboratoire, rendre l'IA plus sûre à travers les langues et les cultures, part de ce constat.

Le décalage est aussi générationnel. Le langage des plateformes de jeu, des forums et des messageries évolue plus vite que les jeux de test internes. Une expression qui signifiait une blague il y a dix-huit mois peut, dans un groupe précis, signaler un appel. Inversement, une formule clinique parfaitement détectée en anglais standard peut passer inaperçue dès qu'elle est déformée par un clavier pressé. Tester seulement le cas nominal, c'est tester le manuel, pas la rue.

Cette exigence a un coût. Fabriquer des simulations crédibles sans exploiter de vraies conversations privées demande des experts, des relectures, et une discipline éthique. Un banc d'essai qui recyclerait des transcripts de mineurs en détresse créerait le problème qu'il prétend mesurer. Le discours public de l'équipe insiste sur des simulations construites avec des spécialistes, pas sur une collecte opaque de journaux intimes. C'est un point à surveiller lorsque le volume passera de la promesse au contrat.

Ce qu'un score peut dire, et ce qu'il ne dira pas

Un score explicable est un progrès s'il permet de retracer une décision. Il devient un risque s'il sert de label marketing. « Audité par un laboratoire indépendant » peut rassurer un parent ou un investisseur sans dire quel scénario a été exclu, quelle langue a été sous-représentée, ou si le test a duré trois tours ou trente. La valeur du travail de Circuit Breaker Labs dépendra de la transparence de sa méthode, pas seulement de l'existence d'une note.

Trois questions méritent d'être posées à n'importe quel prestataire de ce type. Le jeu de scénarios est-il fixé à l'avance, ou adapté après coup pour améliorer le résultat ? Les simulateurs ont-ils accès à la politique de sécurité du modèle, ce qui leur permettrait de viser les failles connues plutôt que les failles réelles ? Le rapport distingue-t-il une mauvaise réponse isolée d'une dérive relationnelle ? Sans ces distinctions, on mesure un exercice, pas un usage.

Les modèles gèrent très bien les tournures standard. Personne ne parle vraiment comme ça. Si le système rate la nuance ou l'argot, cela peut très mal finir.

– Shirali Nigam, directrice générale de Circuit Breaker Labs

La citation de Shirali fixe une limite utile. La performance sur un banc d'essai académique ne prédit pas le comportement face à un adolescent qui mélange ironie, affection et épuisement. Le laboratoire vend précisément cet écart. Encore faut-il que ses propres agents ne deviennent pas, à leur tour, une nouvelle forme de langage standard, seulement un peu plus sale.

Un marché qui se cherche entre soin et produit

Les applications de coaching, de journal et de soutien émotionnel occupent une frontière inconfortable. Elles ne sont pas des dispositifs médicaux, mais elles accueillent des confidences que l'on réserverait à un proche ou à un professionnel. Le modèle économique pousse souvent à prolonger la session, personnaliser le ton, créer un sentiment de continuité. Ces leviers d'engagement sont exactement ceux qui nourrissent l'attachement. Tester la sécurité sans tester l'incitation à revenir, c'est examiner le frein en ignorant l'accélérateur.

Circuit Breaker Labs ne prétend pas remplacer une prise en charge. Son objet est plus étroit : voir si le système détecte une interaction dangereuse et répond de façon appropriée lorsque le risque émerge dans le temps. « Appropriée » reste un mot à définir. Renvoyer vers une aide humaine, refuser de jouer le rôle d'un confident amoureux, casser une illusion de réciprocité : chaque choix a un coût produit. Un éditeur peut juger qu'une réponse trop ferme fait chuter la rétention. Le testeur, s'il est vraiment indépendant, doit pouvoir écrire ce conflit dans le rapport.

La petite taille de l'équipe est à double tranchant. Cinq personnes peuvent itérer vite et garder une culture d'exigence. Elles ne peuvent pas, seules, couvrir toutes les langues, tous les âges, toutes les cliniques de la détresse. Le recours à des experts externes est donc structurel, pas accessoire. La crédibilité future se jouera sur la diversité réelle de ce réseau, et sur la capacité à dire non à un client qui voudrait un score flatteur.

Ce que Disrupt va vraiment tester

Monter sur la scène du Startup Battlefield expose une jeune équipe à des questions que le communiqué n'a pas à trancher. Qui paie l'audit, l'éditeur du modèle ou l'éditeur de l'application ? Le rapport peut-il être rendu public, au moins dans ses grandes lignes ? Une note basse bloque-t-elle une mise en production, ou reste-t-elle un conseil ? Sans réponse, la sécurité demeure un service parmi d'autres, facile à acheter et facile à ranger dans un tiroir.

Le récit des deux fondateurs, frère et sœur, donne au projet une origine lisible. Ils ne partent pas d'une abstraction sur l'alignement des machines. Ils partent d'un adolescent nommé, d'une plainte, d'une phrase mal comprise. Cette origine ne garantit pas la qualité technique. Elle évite toutefois le travers inverse : parler de sécurité uniquement comme d'un avantage concurrentiel. Le public de Disrupt, lui, écoutera les deux niveaux. Les investisseurs voudront un marché. Les familles, si elles lisent le compte-rendu, voudront une preuve que le mannequin d'essai sert à quelque chose avant l'accident.

Arul le dit sans détour : les gens deviennent plus sceptiques, parfois plus résistants à l'adoption. Ce scepticisme n'est pas un bug culturel. C'est une information. Une partie du public a vu des produits conversationnels tenir compagnie, puis tenir un rôle qu'aucun humain responsable n'aurait accepté. Reconstruire la confiance ne se fera pas avec une page de principes. Elle se fera si des tiers peuvent montrer, scénario après scénario, où le système tient et où il lâche.

Une grille de lecture pour la suite

Pour ne pas confondre annonce et preuve, quelques repères suffisent. Ils ne remplacent pas un audit. Ils empêchent de prendre une métaphore, aussi frappante soit-elle, pour une garantie.

  • Demander si les scénarios couvrent des échanges longs, pas seulement des invites uniques.
  • Vérifier la place des mineurs, des secondes langues et des registres non standard.
  • Exiger une explication du score, pas une médaille collée sur la fiche produit.
  • Séparer la détection d'une phrase à risque et la qualité de la réponse qui suit.
  • Regarder si le prestataire peut publier des limites, des échecs, des langues non couvertes.

Circuit Breaker Labs arrive au bon moment rhétorique et au mauvais moment émotionnel : le public a déjà des noms, des âges, des plaintes. La technique proposée, des simulations massives et des scores traçables, répond à une faille réelle des évaluations trop propres. Elle ne clôt pas le débat. Elle le déplace vers un endroit plus utile. Qui teste les testeurs, sur quelles paroles, et avec quel pouvoir de dire qu'un produit n'est pas prêt.

Le nom choisi, disjoncteur, est une promesse mécanique. Dans un circuit, le disjoncteur coupe avant que le fil ne brûle. Dans une conversation, rien ne coupe tout seul. Il faut avoir imaginé la phrase d'avant, la phrase d'après, et la personne qui les prononce sans vouloir « casser » le système. C'est exactement le travail que cette équipe dit vouloir industrialiser. Le pitch de San Francisco dira si l'industrie est prête à payer pour l'entendre.

Partager:

Ajouter Un Commentaire

Chercher

Étiquettes

abus technologie Accord OpenAI Apple accélérateur innovation santé accélérateur startup accélérateur startups Acquisition start-up acquisitons startups canadiennes actions fintech addiction réseaux sociaux adoption IA générative adoption intelligence artificielle all4pack emballages durables innovations packaging écoconception économie circulaire ambitions venture capitalists Andreessen Horowitz Twitter influence réseaux sociaux capital risque Anthropic levée fonds autonomie véhicules électriques avenir intelligence artificielle Avenir semi-conducteurs barquettes inox consigne réduction déchets Berny transition écologique biotechnologie avancée Bot Manager campus cybersécurité Chine OMC Droits douane Voitures électriques Tensions commerciales Subventions distorsion concurrence commerce international commissaires vie privée confiance intelligence artificielle controverse Elon Musk crise financement startups croissance start-ups cybersécurité web3 données personnelles défis start-ups défis véhicules autonomes Energie verte expérience utilisateur financement startup canadienne Géotechnique Décarbonation industrie Empreinte carbone Transition énergétique Prototype innovant Imagino levée de fonds marketing digital données clients expansion internationale Industrie du futur Relocalisation industrielle Transition écologique Startups deeptech Souveraineté technologique innovation mobilité durable mobilité urbaine Radware Bot souveraineté numérique transformation numérique Écosystème startup Innovation technologique Résilience entrepreneuriale Défis startups Croissance startup Canada

Beauty and lifestyle influencer

Follow my journey on all Social Media channels

Alienum phaedrum torquatos nec eu, vis detraxit periculis ex, nihilmei. Mei an pericula euripidis, hinc partem ei est.
facebook
5M+
Facebook followers
Follow Me
youtube
4.6M+
Youtube Subscribers
Subscribe Me
tiktok
7M+
Tiktok Followers
Follow Me
instagram
3.4M+
Instagram Followers
Follow Me