← Home

AI Briefing — 2026-06-18

🔬 Research

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

130 upvotes · Jian Yang et al. · Paper

Les Parallel Loop Transformers (PLT) répliquent un même bloc de façon parallèle pour enrichir les représentations sans exploser la latence ni le cache KV. LoopCoder-v2, entraîné from scratch sur 18T tokens, montre qu'exactement deux boucles est le point optimal : le score SWE-bench Verified bondit de 43,0 à 64,4 points, et Multi-SWE de 14,0 à 31,0. Au-delà de deux boucles, les gains régressent nettement — phénomène non-monotone expliqué par un décalage positionnel (CLP) qui finit par dominer. Résultat pratique : la décision d'architecture "combien de boucles ?" a désormais un cadre gain/coût diagnosticable.


Learning from the Self-future: On-policy Self-distillation for dLLMs

67 upvotes · Yifu Luo et al. · Paper

Les méthodes OPSD (auto-distillation on-policy) sont efficaces pour les LLM classiques mais incompatibles avec les Diffusion LLMs (dLLMs), qui génèrent dans un ordre arbitraire et non gauche-droite. d-OPSD corrige cela en deux innovations : conditionner l'enseignant sur un suffixe (la réponse future) plutôt qu'un préfixe, et superviser au niveau des étapes de débruitage plutôt qu'au niveau des tokens. Sur 4 benchmarks de raisonnement, d-OPSD surpasse RLVR et SFT en n'utilisant que ~10 % des étapes d'optimisation de RLVR. Code disponible sur GitHub.


Zone of Proximal Policy Optimization (ZPPO): Teacher in Prompts, Not Gradients

47 upvotes · Byung-Kwan Lee et al. · Paper

ZPPO s'inspire de la zone proximale de développement de Vygotsky : plutôt que d'injecter l'enseignant dans le gradient (ce qui casse l'hypothèse on-policy), le teacher est injecté dans le prompt sous forme de questions reformulées (BCQ/NCQ). Un buffer de replay recircule les questions difficiles jusqu'à ce que l'élève les maîtrise. Évalué sur la famille Qwen3 (0,8B–9B) avec un teacher 27B sur 31 benchmarks (VLM, LLM, Vidéo), ZPPO bat la distillation off/on-policy et GRPO, avec les plus grands gains aux plus petites échelles.


🛠 Tools

mattpocock/skills — Composable agent skills pour ingénieurs sérieux

1 523 stars/jour · Shell · Repo

Publié par Matt Pocock (Total TypeScript), ce repo expose ses propres fichiers .claude sous forme de skills composables installables en une commande (npx skills@latest add mattpocock/skills). L'approche se distingue de GSD ou BMAD : les skills sont petits, adaptables et compatibles avec n'importe quel modèle, sans imposer un processus global. Avec 134 k stars au total et 60 000 abonnés à la newsletter, c'est un signal fort de standardisation de la configuration des agents de code.


Panniantong/Agent-Reach — Internet complet pour vos agents, sans frais d'API

1 161 stars/jour · Python · Repo

Agent-Reach donne à un agent IA la capacité de lire et rechercher sur Twitter, Reddit, YouTube, GitHub, Bilibili et XiaoHongShu — sans API payante, via une installation en une phrase transmise à l'agent lui-même. Le projet résout des problèmes concrets : contournement des 403, extraction de sous-titres YouTube, nettoyage du HTML, etc. MIT License, Python 3.10+, 33 k stars — #1 GitHub Trending du jour selon Trendshift.


obra/superpowers — Méthodologie complète de développement agentique

1 129 stars/jour · Shell · Repo

Superpowers est un framework de skills + méthodologie de développement logiciel pour agents de code (Claude Code, Cursor, Codex, Gemini CLI…). Il impose une séquence structurée : spec → plan d'implémentation → subagent-driven development avec TDD strict et YAGNI, permettant à l'agent de travailler plusieurs heures en autonomie sans dériver. 231 k stars au total — le projet recrute même un community engineer à temps plein, signe d'une adoption significative.


📡 Analysis

⚠️ La source Simon Willison est indisponible aujourd'hui. Pas d'articles d'analyse à relayer.


Sources: HuggingFace Papers API, GitHub Trending, simonwillison.net