Tokenisation, quantification ZK et interprétabilité : la représentation décide du résultat

💡 En résumé

Les publications techniques du 30 septembre convergent vers une même leçon, formulée sous vingt formes différentes : ce n’est pas le modèle qui décide de la qualité de la sortie, mais la représentation qu’on lui donne à traiter. Le découpage en tokens d’un texte, la précision choisie pour une preuve cryptographique, la phase d’un chemin de raisonnement, la couche d’un encodeur visuo-langage, le format d’interface d’un agent : chacun de ces choix produit des écarts mesurables qui dépassent souvent ceux séparant deux générations de modèles.

Cette édition technique fait le tour de la question : combien coûtent réellement les frontières de tokens, comment quantifier un LLM pour qu’un auditeur puisse vérifier son inférence, pourquoi les sondes d’interprétabilité classiques se trompent, et comment un modèle de fondation tabulaire prétend remplacer dix ans de gradient boosting.

🔥 Tendances : le coût caché des frontières

Un tokenizer impose des frontières qui n’existent dans aucune langue. Le papier « The Price of Token Boundaries » prend ce coût au sérieux et l’encadre par le bas et par le haut : il calcule une borne inférieure du nombre minimal de tokens via des chemins les plus courts, avec et sans règle de frontière par expression régulière, en maximisant sur l’ensemble des prix non négatifs attribués aux occurrences de tokens — ce qui redonne la relaxation linéaire d’un programme entier, certifié ensuite par un vérificateur indépendant.

Les chiffres, sur Wikipedia anglais :

  • Les frontières augmentent le nombre optimal de tokens de 28,3 à 36,8 %.
  • Le byte pair encoding reste 2,1 % au-dessus de la borne contrainte, mais 10,9 % au-dessus de la borne non contrainte.
  • Compression et prédiction réclament des dictionnaires différents : à 85 M de paramètres hors embeddings et à budget de tokens d’entraînement égal, l’ajustement sans frontières produit de meilleurs bits par octet sur jeu tenu à l’écart dans les 12 langues de l’étude appariée (11 sur 12 en réglage indépendant).
  • Les auteurs introduisent des « licences de frontière » : n’autoriser que 10 % du budget de vocabulaire à traverser les coupures récupère 85,2 % (anglais) et 100,0 % (chinois) de la réduction de tokens obtenue en supprimant toutes les coupures.

Conclusion opérationnelle : la qualité de compression d’un tokenizer et la qualité de prédiction des unités qu’il produit sont deux propriétés distinctes, aujourd’hui écrasées dans un seul indicateur.

L’entraînement peut-il se passer de texte lisible ?

DASA (Desired-Update-Aligned Synthetic Data) attaque frontalement une hypothèse implicite : que les données de fine-tuning doivent être du texte humainement lisible. La méthode utilise le retour du gradient d’activation d’un modèle de référence gelé pour optimiser directement des embeddings d’entrée synthétiques continus, en ciblant les mises à jour utiles plutôt que la reconstruction du texte source ou la fluidité linguistique. Les projections en tokens discrets ne servent qu’à l’inspection qualitative.

Résultat : sur six modèles des familles Llama et Qwen de 1 Md à 32 Md de paramètres et six benchmarks (connaissances, raisonnement mathématique, génération de code, sens commun), en réglage LoRA apparié, DASA atteint une performance comparable aux données en langage naturel et la dépasse dans plusieurs configurations, avec un gain de vitesse de 3,6 à 4,9× sur GRADMM à mémoire GPU comparable. Si cela se généralise, un pan entier de l’ingénierie de données — nettoyage, déduplication, filtrage de qualité textuelle — change de nature.

Un cadran unique pour la mémoire de décodage

SMat-Attention propose de relier attention softmax (quadratique, flexible) et attention linéaire (coût linéaire, état de taille fixe) par une dimension VC explicite : une famille de masques causals à routage longue portée dont le support de ligne a une VC-dimension d. d = 1 redonne le masque causal standard ; augmenter d autorise des routages par sous-ensembles plus riches. Pour une séquence de longueur T, la construction à routage dur coûte O(T^(2−3/d) + T) malgré un masque dense, et le décodage en flux ne coûte qu’un temps constant par token avec O(T^(1−1/d)) états en cache. Les extensions à Mamba-2 et Gated DeltaNet conservent un prefill sous-quadratique et améliorent le rappel dans plusieurs réglages.

Le raisonnement déterministe n’a pas besoin d’un réseau de neurones

Sur un Raspberry Pi 4B (8 Go, sans GPU), un routeur neurosymbolique apprend un automate fini déterministe par inférence grammaticale (algorithme L*), en utilisant le petit modèle de langue comme oracle d’appartenance et des données étiquetées comme oracle d’équivalence, puis dispatche chaque requête vers le solveur correct le moins coûteux. Sur 100 prompts inédits de DeepMind Mathematics, GSM8K et RuleTaker :

  • 100 % d’exactitude de routage et 98,3 % d’exactitude globale à budget de 512 tokens de raisonnement (93,3 % sur les problèmes d’énoncé) ;
  • contre 72,0 % pour le meilleur agent de référence (Program-of-Thought) et 58,7 % pour un agent à appel d’outils disposant des mêmes solveurs ;
  • les requêtes formatées ne touchent jamais le modèle : réponse en 1 à 11 ms, et en configuration 30 tokens, 8,8× plus rapide et 2,8× plus sobre en énergie que Program-of-Thought.

🤖 Nouveaux outils

  • Kumo Tabular (NVIDIA) — modèle de fondation ouvert pour données tabulaires, publié sur Hugging Face : à partir d’un tableau de lignes étiquetées, il prédit les étiquettes de nouvelles lignes en un seul passage avant, sans entraînement, sans réglage, sans ingénierie de caractéristiques, en classification comme en régression. Trois tailles (28 M à 215 M de paramètres), préentraîné uniquement sur des données artificielles, licence OpenMDW-1.1 pour usage commercial, et première place sur TabArena, BeyondArena, TALENT et ScoringBench.
  • ProvenanceGuard — vérification de factualité consciente de la source pour agents MCP. Il cible la « conflation inter-sources » : un énoncé vrai quelque part dans les preuves, mais attribué au mauvais outil. Un vérificateur aveugle à la source le valide, un vérificateur conscient de la source le refuse. Le cas canonique : « selon le relevé de compte, ce plan inclut une fenêtre de remboursement de 30 jours » — la fenêtre existe, mais dans une politique, pas dans le relevé cité.
  • PILLAR — RAG privé par retrieval d’information privé en deux étages : une étape creuse émet un nombre fixe et faible de requêtes PIR sur un index de scores BM25 précalculés (le serveur ne voit jamais les termes de la requête), une étape dense récupère les embeddings des seuls candidats et reclasse localement. Deux variantes : PILLAR-Bin (plus rapide) et PILLAR-Tree (meilleure qualité de retrieval).
  • HyperZip — compression de données par LLM de diffusion avec prédiction multi-token et hyperréseau générant des mises à jour spécifiques aux données, afin d’éviter le fine-tuning coûteux et de desserrer le compromis débit/taux de compression.
  • ARCagent — agent de question-réponse clinique à calibration de retrieval consciente des conflits, sur le ME/CFS, maladie où les recommandations se contredisent ouvertement. Base de 1 706 fragments, 10 sources, registre de conflits inter-recommandations, 95,3 % de réussite, et un protocole d’évaluation par LLM-juge qui évite une sous-estimation systématique de 10,1 points imputable au simple appariement de mots-clés.
  • COFFEE — guidage de diffusion discrète par objectifs compilés, remplaçant l’énumération exponentielle des complétions par un modèle joint sur les positions non résolues.
  • LLM-Guided Graph Pruning (LGP) — correction du désaccord géométrie/sémantique des index de plus proches voisins : l’élagage guidé par LLM remplace les voisins structurellement « de faible valeur » par des alternatives choisies sémantiquement, en préservant parcimonie et navigabilité. Gains sur DiskANN et HNSW, au-delà du simple reranking en temps de requête.

📊 Analyse : ce qui est mesuré n’est pas toujours ce qu’on croit

Quatre papiers de la journée portent sur un même problème de méthode : nos instruments de mesure sont biaisés.

Les sondes d’interprétabilité trichent par question. Le protocole standard attribue à chaque état intermédiaire d’un raisonnement l’étiquette correcte/incorrecte de la réponse finale, puis entraîne des sondes sur des questions hétérogènes. PAIR montre que ce protocole exploite la variation entre questions plutôt que la qualité du chemin, et que des états alignés sur l’indice absolu d’étape correspondent à des phases fonctionnelles différentes. En échantillonnant plusieurs trajectoires par question et en les alignant sur une progression relative normalisée, PAIR améliore le classement intra-question des trajectoires et la sélection Best-of-N, et le pilotage par phase modifie causalement les sorties.

Le raisonnement latent n’est pas contraint par la perte d’entraînement. Quatre défaillances de l’entraînement à la seule entropie croisée sont établies — effondrement des pensées entre questions distinctes, rétention d’information non pertinente, notamment. REST transforme quatre propriétés d’une pensée valide (causalité, minimalité, séparabilité, stabilité) en pertes différentiables ajoutées à l’entropie croisée, sans changement d’architecture ni paramètres supplémentaires à l’inférence : jusqu’à +7,5 points d’exactitude sur 7 benchmarks et +30 % de convergence vers la bonne réponse.

La simplicité représentationnelle ne prédit pas la simplicité causale. Sur un même point de contrôle GPT-2 Small, deux continuations d’entraînement appariées (standard et adversariale) produisent un modèle plus décomposable par autoencodeur parcimonieux, engageant moins de caractéristiques SAE dans l’attribution de tâche — mais la taille du circuit fidèle dépend du régime : à fidélité élevée (90 %, 95 %), le modèle robuste exige substantiellement moins d’arêtes. Décomposabilité et taille de circuit se dissocient selon un seuil.

L’interface de couches d’un VLA est un choix lourd. Sur trois backbones préentraînés et deux benchmarks de manipulation : 47 des 54 configurations de fusion multi-couches font moins bien que la meilleure politique mono-couche. Le meilleur choix de couche varie fortement, et l’utiliser comme proxy InfoNCE réduit le regret moyen de sélection de 17,89 points (choix de la couche la plus profonde) à 3,71 points, pour 9 à 33× moins de calcul GPU qu’un balayage exhaustif — proche des 3,28 à 3,50 points qu’obtiennent des heuristiques optimisées rétrospectivement.

Le support étiqueté peut fuir la cible. Deux papiers formalisent le « support-set target leakage » : des colonnes dérivées de la cible présentes dans le support étiqueté de l’apprentissage en contexte relationnel, mais absentes des requêtes. Sur 20 colonnes pièges et 13 tâches RelBench, la fuite 0-hop (table cible) et la condition « fuite complète » produisent les écarts agrégés les plus forts, les effets 1-hop et 2-hop étant plus faibles ; surtout, les effets sont fortement tâche- et modèle-dépendants et peuvent inverser les conclusions relatives entre variantes de modèles, même quand les changements agrégés restent petits. La suppression guidée par gradients intégrés ne restaure pas systématiquement une évaluation propre : la frontière support/requête est un composant à part entière de la fiabilité d’évaluation.

Deux mesures qui échouent à l’épreuve des faits. Un examen de Jev, modèle décisionnel probabiliste généraliste, sur 1 800 fenêtres d’accéléromètre équilibrées montre un macro-F1 maximal de 0,038, 0,118 et 0,089 selon le jeu de données, contre 0,686 à 0,907 pour trois modèles supervisés — et plus de caractéristiques numériques dégradent la reconnaissance sur les trois jeux. De son côté, OTROPE attaque l’évaluation hors-politique des LLM par correction distributionnelle en espace sémantique via transport optimal, sans modèle de comportement ni estimation de ratio de densité, avec des garanties de convergence lorsque l’une des deux composantes converge ; des ensembles d’évaluateurs plus faibles peuvent alors approcher, voire dépasser, un évaluateur plus fort.

Deux garde-fous qui pourraient tenir leurs promesses. Le Safety Operator montre que l’absorption de tokens de contexte dans les poids d’un transformer peut se lire comme un opérateur multiplicatif dont la valeur propre dominante agit comme un cadran continu sur l’influence de l’instruction de sécurité, permettant des instructions Pareto-améliorées selon un poids de suppression. Persona Dosing spécialise un contrôleur conditionné par description, puis calibre son temps de flot sur l’expression mesurée : la méthode dépasse l’addition d’activation contrastive de 33,2, 18,3 et 17,8 points sur le plancher de cohérence 75 (Llama-3.1-8B, Qwen3-8B, Gemma-3-4B), avec des erreurs de ciblage moyennes de 4,7 à 6,2 points sur 14 à 22 cibles atteignables par modèle. Autrement dit : la plage dans laquelle un contrôleur sait agir reste distincte de la précision des demandes à l’intérieur de cette plage.

Et un résultat qui ne se voit que dans les flux. En traversant le papier de compression par diffusion, la quantification compatible avec la preuve à divulgation nulle mérite l’arrêt : sur neuf modèles, dont Qwen2.5-14B et le MoE Qwen3-30B-A3B, la précision des activations est nettement plus sensible que celle des poids, les approximations de tables de correspondance non linéaires deviennent la première source de dégradation, et les racines carrées inverses de RMSNorm forment un goulot récurrent qu’on répare en augmentant sélectivement la précision à cet endroit. Surtout : réduire la largeur de bits ou la taille des tables ne réduit pas proportionnellement le coût de preuve de bout en bout — les heuristiques de quantification basse précision ne se transposent pas telles quelles.

🎯 À retenir

  1. Les frontières de tokens coûtent 28 à 37 % de tokens en plus — et compression et prédiction veulent des dictionnaires différents. La « licence de frontière » à 10 % récupère l’essentiel du gain.
  2. Le texte lisible n’est peut-être pas nécessaire au fine-tuning : des embeddings continus alignés sur le gradient d’activation atteignent la performance des données naturelles, avec 3,6 à 4,9× de gain de vitesse.
  3. La vérification change de granularité : la preuve à divulgation nulle impose un choix de précision par opérateur, et la factualité MCP impose de vérifier non seulement que l’énoncé est soutenu, mais par quelle source.
  4. Les sondes et les évaluations mentent : entraîner sur la réponse finale mesure la difficulté de la question, pas la qualité du raisonnement ; un support étiqueté fuyant peut inverser le classement de deux modèles.
  5. Le modèle de fondation tabulaire passe enfin l’épreuve du banc : un modèle à 28-215 M de paramètres, préentraîné sur des données artificielles, revendique la première place sur quatre benchmarks face à deux décennies de gradient boosting — le signal le plus disruptif de la journée pour l’industrie de la donnée tabulaire.

A lire aussi