Veille IA — 2 mars 2026
🔬 Recherche
The Trinity of Consistency as a Defining Principle for General World Models
190 upvotes · Jingxuan Wei et al. · Papier
Un framework théorique pour définir les propriétés essentielles d'un modèle du monde général, basé sur trois consistances : modale (interface sémantique), spatiale (base géométrique) et temporelle (moteur causal). Les auteurs introduisent CoW-Bench pour évaluer les modèles de génération vidéo et les modèles multimodaux unifiés. Cette formalisation théorique répond au besoin urgent de principes directeurs alors que des modèles comme Sora montrent des capacités émergentes de simulation physique.
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
147 upvotes · Hongrui Jia et al. · Papier
Une méthode d'entraînement itératif (DPE) qui diagnostique les faiblesses des modèles multimodaux puis génère des données ciblées pour les corriger. Testée sur Qwen3-VL et Qwen2.5-VL, elle montre des gains stables sur 11 benchmarks. L'approche utilise plusieurs agents pour annoter et contrôler la qualité de données non labellisées, puis ajuste dynamiquement le mélange de données selon les diagnostics de performance.
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
101 upvotes · Zhiheng Song et al. · Papier
Un benchmark construit à partir de vraies requêtes utilisateurs d'Amap pour évaluer les agents de planification d'itinéraires basés sur LLM. Il utilise un sandbox déterministe avec replay d'API pour la reproductibilité et révèle que les modèles actuels peinent sur la planification avec contraintes de préférences. C'est le premier benchmark systématique pour cette application croissante des LLM dans la mobilité urbaine.
🛠 Outils
ruvnet/wifi-densepose — Estimation de pose humaine via signaux WiFi
4539 étoiles/jour · Repo
Transforme les signaux WiFi ordinaires en estimation de pose temps réel, monitoring des signes vitaux et détection de présence, sans caméra ni capteur. En analysant les perturbations CSI causées par les mouvements humains, le système reconstruit position corporelle, rythme respiratoire et cardiaque à 54K fps. Implémenté en Rust avec support ESP32, il fonctionne à travers les murs jusqu'à 5m de profondeur.
alibaba/OpenSandbox — Plateforme sandbox unifiée pour applications IA
1179 étoiles/jour · Repo
Une plateforme sandbox généraliste avec SDKs multi-langages (Python, JS, Java, C#) et APIs unifiées pour agents de code, agents GUI, évaluation d'agents et entraînement RL. Elle gère le cycle de vie des sandboxes via Docker/Kubernetes avec support distribué. Alibaba répond au besoin croissant d'environnements d'exécution sécurisés pour les applications d'IA autonome.
ruvnet/ruflo — Orchestration d'agents multi-Claude
766 étoiles/jour · Repo
Plateforme d'orchestration spécialisée pour Claude permettant de déployer des essaims d'agents intelligents, coordonner des workflows autonomes et construire des systèmes d'IA conversationnelle. Offre une architecture enterprise avec intelligence d'essaim distribuée, intégration RAG et support natif de Claude Code/Codex. L'orientation Claude-native la distingue des orchestrateurs généralistes.
📡 Analyse
Quoting claude.com/import-memory
1er mars · Post · tags : prompt-engineering, llm-memory, anthropic, claude, generative-ai, ai, llms
Simon Willison révèle que la fonction "import your memories" de Claude n'est qu'un prompt sophistiqué demandant d'extraire toutes les mémoires stockées. Le prompt demande explicitement de lister instructions personnalisées, détails personnels, projets, préférences et corrections sans résumer ni omettre. Cette découverte montre la simplicité sous-jacente de fonctionnalités apparemment complexes et soulève des questions sur la portabilité des données conversationnelles.
Interactive explanations
tags : explorables, llms, cognitive-debt, ai, generative-ai, ai-assisted-programming, coding-agents, agentic-engineering
Introduction du concept de "dette cognitive" quand on perd la compréhension du code écrit par nos agents. Willison plaide pour des explications interactives permettant d'explorer et comprendre les décisions des agents plutôt que de simplement accepter leurs outputs. Cette réflexion devient cruciale alors que les agents génèrent de plus en plus de code complexe que les développeurs peinent à maintenir.
Please, please, please stop using passkeys for encrypting user data
27 février · Post · tags : security, usability, passkeys
Willison relaie l'avertissement de Tim Cappalli contre l'utilisation des passkeys pour chiffrer les données utilisateur. Les utilisateurs perdent fréquemment leurs passkeys et ne comprennent pas toujours que leurs données sont irréversiblement chiffrées avec. Cette mise en garde intervient alors que les passkeys se généralisent, rappelant l'importance de l'équilibre sécurité-usabilité.
Sources : HuggingFace Papers API, GitHub Trending, simonwillison.net