Veille IA — 1er mars 2026
🔬 Recherche
The Trinity of Consistency as a Defining Principle for General World Models
187 upvotes · Jingxuan Wei et al. · Papier
Une tentative ambitieuse de définir un cadre théorique pour les modèles de monde généraux, proposant trois types de cohérence essentiels : modale, spatiale et temporelle. Les auteurs introduisent CoW-Bench, un benchmark pour évaluer les modèles de génération vidéo et les modèles multimodaux unifiés. Cette approche systématique pourrait aider à structurer le développement des futurs modèles de monde comme successeurs de Sora.
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
146 upvotes · Hongrui Jia et al. · Papier
DPE (Diagnostic-driven Progressive Evolution) propose une approche d'entraînement en boucle spirale où le diagnostic guide la génération de données et le renforcement. Contrairement à l'entraînement statique traditionnel, cette méthode identifie dynamiquement les faiblesses du modèle et génère des données ciblées. Les tests sur Qwen3-VL et Qwen2.5-VL montrent des gains stables sur onze benchmarks, suggérant une voie scalable pour l'amélioration continue des LMMs.
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
96 upvotes · Zhiheng Song et al. · Papier
Un benchmark construit à partir de vraies requêtes d'utilisateurs d'Amap (équivalent chinois de Google Maps) pour évaluer les agents de planification d'itinéraires basés sur des LLMs. Le système inclut un sandbox déterministe pour éliminer la variance des services live. Les résultats révèlent que les modèles actuels excellent sur la récupération d'informations basiques mais peinent sur la planification avec contraintes de préférences, pointant les limites des applications de mobilité personnalisées.
🛠 Outils
ruvnet/wifi-densepose — Estimation de pose humaine par WiFi
2152 étoiles/jour · Repo
Un système fascinant qui utilise les signaux WiFi commodité pour l'estimation de pose corporelle en temps réel, la détection de signes vitaux et la présence — sans aucune caméra. En analysant les perturbations CSI (Channel State Information), il reconstruit la position du corps, le rythme respiratoire et cardiaque. Le projet atteint 54K fps en Rust et inclut une détection à travers les murs jusqu'à 5m, avec un conteneur Docker de 132 MB ready-to-use.
obra/superpowers — Framework de compétences agentiques
1323 étoiles/jour · Repo
Une méthodologie complète de développement logiciel pour agents de code qui force une approche structurée : spécification collaborative, plan d'implémentation détaillé, puis développement par sous-agents avec TDD. Le système empêche les agents de se précipiter dans le code et les oblige à comprendre le problème d'abord. Selon l'auteur, Claude peut travailler de manière autonome pendant plusieurs heures sans dévier du plan établi.
moeru-ai/airi — Compagnon IA auto-hébergé style Neuro-sama
1065 étoiles/jour · Repo
Un projet ambitieux visant à recréer Neuro-sama : un "conteneur d'âme" pour personnages virtuels IA avec chat vocal temps réel et capacité à jouer à Minecraft et Factorio. Support Web/macOS/Windows et 19,5K stars totales montrent l'engouement pour les assistants IA personnalisés auto-hébergés. L'approche "waifu" peut paraître niche mais reflète une tendance vers des interactions IA plus personnalisées et contrôlées par l'utilisateur.
📡 Analyse
Interactive explanations
27 février 2026 · Post · tags : explorables, llms, cognitive-debt, ai, generative-ai, ai-assisted-programming, coding-agents, agentic-engineering
Simon Willison introduit le concept de "dette cognitive" : quand on perd la trace du fonctionnement du code écrit par nos agents. Sa solution : construire des explications interactives, comme une visualisation animée d'algorithme de nuage de mots pour comprendre intuitivement le "placement en spirale d'Archimède". Cette approche systématique de la compréhension du code généré par IA pourrait devenir essentielle à mesure que les agents produisent du code plus complexe.
An AI agent coding skeptic tries AI agent coding, in excessive detail
27 février 2026 · Post · tags : python, ai, rust, max-woolf, generative-ai, llms, ai-assisted-programming, coding-agents, agentic-engineering, november-2025-inflection
Simon relaie l'expérience de Max Woolf, ancien sceptique qui a testé les agents de code sur des projets de plus en plus ambitieux, jusqu'à tenter de porter scikit-learn vers Rust. Max témoigne de la frustration d'expliquer à quel point Opus 4.6/Codex 5.3 sont meilleurs sans passer pour un "hype booster", décrivant des modèles qui réalisent correctement des tâches qui lui prendraient des mois. Révélateur de l'inflexion qualitative de novembre 2025 dans le domaine des agents de code.
Please, please, please stop using passkeys for encrypting user data
27 février 2026 · Post · tags : security, usability, passkeys
Un appel pressant contre l'utilisation des passkeys pour chiffrer les données utilisateur. Le problème fondamental : les utilisateurs perdent leurs passkeys constamment et ne comprennent pas toujours que leurs données sont chiffrées de manière irréversible avec ces clés. Cette mise en garde arrive au bon moment alors que l'adoption des passkeys s'accélère, soulignant le trade-off critique entre sécurité et utilisabilité dans l'authentification moderne.
Sources : HuggingFace Papers API, GitHub Trending, simonwillison.net