← Home

Veille IA — 2026-03-04

🔬 Recherche

From Scale to Speed: Adaptive Test-Time Scaling for Image Editing

121 upvotes · Xiangyan Qu et al. · Papier

ADE-CoT propose un système d'édition d'image adaptatif qui alloue dynamiquement ses ressources selon la difficulté de l'édition demandée. Contrairement aux méthodes Chain-of-Thought classiques qui utilisent un budget fixe, le système ajuste intelligemment le nombre d'échantillons et arrête dès qu'un résultat satisfaisant est trouvé. Les tests sur Step1X-Edit, BAGEL et FLUX.1 Kontext montrent un gain de performance avec une accélération de 2x par rapport aux méthodes existantes.

SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale

49 upvotes · Ibragim Badertdinov et al. · Papier

Une pipeline automatisée pour créer des environnements d'entraînement d'agents de développement logiciel à grande échelle. Le dataset contient 32 000+ tâches couvrant 20 langages de programmation et 3 600+ repositories, avec des environnements Docker reproductibles. L'approche utilise un agent interactif pour synthétiser les procédures d'installation et un ensemble de juges LLM pour filtrer les instances non valides, répondant au manque critique de données d'entraînement pour le RL des agents SWE.

OpenAutoNLU: Open Source AutoML Library for NLU

41 upvotes · Grigory Arshinov et al. · Papier

Une bibliothèque AutoML open-source pour les tâches de compréhension du langage naturel, couvrant classification de texte et reconnaissance d'entités nommées. La particularité est la sélection automatique du régime d'entraînement basée sur les données, sans configuration manuelle requise. Le système intègre des diagnostics de qualité des données, détection d'échantillons hors distribution et fonctionnalités LLM dans une API low-code minimale.


🛠 Outils

ruvnet/RuView — Détection de pose humaine via signaux WiFi

4419/jour · Repo

RuView transforme les signaux WiFi commodity en système de détection de pose humaine temps réel, monitoring des signes vitaux et détection de présence, sans aucune caméra. Le système analyse les perturbations CSI (Channel State Information) causées par le mouvement humain pour reconstruire la position corporelle, le rythme respiratoire et cardiaque. Capable de fonctionner à travers les murs avec une latence sub-milliseconde et 54k fps en traitement Rust, il s'exécute sur ESP32 en mode edge sans connexion internet.

alibaba/OpenSandbox — Plateforme sandbox unifiée pour agents IA

1150/jour · Repo

Une plateforme sandbox généraliste pour applications IA offrant des SDKs multi-langages (Python, Java, JS/TS, C#, Go) et des runtimes Docker/Kubernetes. Conçue pour les agents de code, agents GUI, évaluation d'agents, exécution de code IA et entraînement RL. Le système définit des APIs de cycle de vie et d'exécution standardisées permettant d'étendre facilement des runtimes personnalisés, avec support natif pour l'exécution locale et la planification distribuée à grande échelle.

moeru-ai/airi — Compagnon IA vocal self-hosted

832/jour · Repo

Un compagnon IA self-hosted inspiré de Grok, conçu comme "conteneur d'âmes de waifu" pour créer des êtres cyber vivants. Le système supporte le chat vocal temps réel et peut jouer à Minecraft et Factorio de manière autonome. Compatible Web, macOS et Windows, il vise à atteindre l'altitude de Neuro-sama en tant qu'IA conversationnelle avancée avec personnalité immersive.


📡 Analyse

Quoting Donald Knuth

3rd March 2026 · Post · tags : november-2025-inflection, claude, generative-ai, ai, llms, donald-knuth, llm-reasoning, anthropic

Donald Knuth exprime sa surprise face à Claude Opus 4.6 qui a résolu un problème ouvert sur lequel il travaillait depuis plusieurs semaines. Cette déclaration marque un tournant notable : l'un des informaticiens les plus respectés reconnaît publiquement les capacités de déduction automatique et de résolution créative de problèmes des LLM. Un témoignage significatif de l'évolution des capacités de raisonnement de l'IA générative.

Gemini 3.1 Flash-Lite

3rd March 2026 · Post · tags : google, ai, generative-ai, llms, llm, gemini, llm-pricing, pelican-riding-a-bicycle, llm-release

Google lance Gemini 3.1 Flash-Lite avec un pricing ultra-agressif : $0.25/million de tokens d'entrée et $1.5/million de sortie, soit 1/8e du prix de Gemini 3.1 Pro. Le modèle propose quatre niveaux de "thinking" (minimal, low, medium, high) permettant d'ajuster la profondeur de raisonnement selon les besoins. Cette approche de pricing différencié par niveau de réflexion pourrait redéfinir les standards économiques des LLM.


Sources : HuggingFace Papers API, GitHub Trending, simonwillison.net