← Retour à l'Épistémologie

Le Signal du Tiret

Le biais d'entraînement rendu visible. Un signe de ponctuation comme empreinte digitale.

Comment Savons-nous?

Le Modèle

Demandez à un LLM d'écrire quelque chose. N'importe quoi. Un mémo. Une histoire. Une explication.

Guettez-le :

"Le système est puissantpeut-être trop puissantpour que la plupart des utilisateurs le gèrent."

Le tiret cadratin. Ce long tiret qui apparaît là où une virgule pourrait fonctionner, où un point pourrait servir, où des parenthèses conviendraient. Les LLMs l'utilisent constamment. Pas parce que c'est le meilleur choix. Parce qu'il était dans les données d'entraînement.

Pourquoi C'est Important

Le tiret cadratin n'est pas un défaut. C'est une caractéristique. C'est de la preuve.

Chaque LLM porte des biais invisibles de son corpus d'entraînement. La plupart sont difficiles à repérer. Le tiret cadratin est facile. C'est un signal, comme le tic d'un joueur de poker. Un rappel que le modèle n'a pas appris à écrire à partir de premiers principes. Il a appris à écrire en ingérant des millions de documents écrits par des humains qui avaient leurs propres préférences stylistiques.

Le Problème Plus Profond

Si vous pouvez voir le biais du tiret cadratin, quels biais ne pouvez-vous pas voir ? Quelles suppositions sur le monde, sur les valeurs, sur ce qui est normal ou bon ou vrai sont ancrées tout aussi profondément, mais sans signe de ponctuation visible pour les signaler ?

Les Données d'Entraînement ne Sont Pas Neutres

Le corpus qui a entraîné votre modèle a été assemblé par des humains faisant des choix :

Ce qu'il faut inclure. Wikipedia mais pas 4chan. Des sites d'actualités mais pas des blogs. L'anglais plus que le swahili. Des articles académiques plus que des commentaires Reddit.

Ce qu'il faut pondérer. Certaines sources comptent plus que d'autres. Le modèle apprend à ressembler à ses influences les plus importantes.

Ce qu'il faut filtrer. Le contenu nuisible supprimé (bien), mais aussi les cas limites, les points de vue minoritaires, les formulations non conventionnelles (moins bien).

"Le tiret cadratin est inoffensif. La vision du monde pourrait ne pas l'être."

Que Faire

Remarquez-le. La première étape est la prise de conscience. Quand vous lisez la production d'un LLM, souvenez-vous : chaque choix de mot reflète l'entraînement, pas la vérité.

Questionnez les défauts. Si le modèle affirme quelque chose avec confiance, demandez : est-ce de la connaissance ou de la correspondance de motifs ?

Utilisez-le comme diagnostic. La densité des tirets cadratins vous dit quelque chose sur la mesure dans laquelle le modèle est en mode "génération fluide" par opposition à un raisonnement authentique. Un usage intense du tiret cadratin est souvent corrélé à une production en surface lisse stylistiquement mais substantiellement mince.

Supprimez-les. Nous avons supprimé chaque tiret cadratin de ce site. Non pas parce qu'ils sont faux, mais parce qu'ils ne sont pas les nôtres. Chaque biais que vous pouvez identifier est un biais que vous pouvez choisir de garder ou d'éliminer.

La Cicatrice

Cette page existe parce que nous nous sommes aperçus que nous écrivions avec des tirets cadratins que nous n'avions pas choisis. Le schéma était si fort que nous l'avions absorbé. Le biais du modèle était devenu notre biais.

C'est le vrai danger. Non pas que les LLMs soient biaisés, mais que leurs biais deviennent invisibles, deviennent normaux, deviennent les vôtres.

Le tiret cadratin est un cadeau. C'est le seul biais que vous pouvez voir.

Travaillez avec nous

Vous rencontrez cela dans votre organisation ?

Nous aidons les équipes à défaire exactement ce type de complexité.

Démarrer la conversation →
← Retour à l'Épistémologie