Cognition vient de sortir SWE-2, son modèle de code maison le plus avancé à ce jour. L’annonce est tombée ce jeudi 10 septembre 2026, d’abord sur X (@cognition), puis dans le billet officiel. En clair : un modèle entraîné pour Devin qui joue presque à égalité avec la frontier… pour nettement moins cher. La question, c’est la même que d’habitude. Qu’est-ce que ça change vraiment, et face à qui ça tient ?
Ce qui change vraiment avec SWE-2
SWE-2 n’est pas un simple bump cosmétique de SWE-1.7. Cognition dit avoir scalé le reinforcement learning dans le régime multi-trillions de paramètres pour la première fois, à partir de Kimi K3 (environ 2,8 T paramètres), déjà post-entraîné pour le coding agentique. Leur RL trouve encore de la marge : +5 à 6 points sur beaucoup de benches, et un décalage de toute la courbe coût / perf du modèle de base.
Le truc malin du run, c’est d’entraîner tous les niveaux d’effort (medium, high, max) dans un seul passage RL, avec une pénalité de coût adaptée à la pente locale de la frontière de Pareto. Objectif annoncé : pousser toute la courbe, pas juste le score max. Sur FrontierCode 1.1 Main, SWE-2 medium marque déjà plus haut que SWE-1.7 tout en prenant 58 % de tours en moins et en coûtant 81 % de moins en moyenne. Première vraie édition du code : médiane à 18 steps contre 48 pour SWE-1.7. Moins de sur-exploration, plus de jugement sur ce qui compte vraiment dans le dépôt.
Côté comportement, Cognition revendique de meilleurs tests bout-en-bout, plus de débrouillardise quand le chemin évident est bloqué, et une discipline de vérif un peu moins « oui-oui » face aux hypothèses de l’utilisateur. Medium fonce plus vite sur le simple / intermédiaire ; high et max gardent l’avantage sur le dur (plus de plan, plus d’exploration, plus de vérifs).

Les benches : quasi Fable 5.1, loin devant SWE-1.7
Sur FrontierCode 1.1 Main, SWE-2 affiche 50,0 % — à un point de Fable 5.1 (50,9 %) tout en étant annoncé 64 % moins cher. Le tweet parle d’un modèle « on par with recent frontier models » avec jusqu’à 70 % de coût en moins. Face à la génération précédente maison : SWE-1.7 était à 42,0 % sur le même set.
Autres lignes du tableau officiel Cognition :
- DeepSWE 1.1 : SWE-2 à 73,0 % (Kimi K3 68,5 %, Grok 4.6 67,5 %, Fable 5.1 67,4 %, GPT-5.6 Sol 72,7 %, GPT-6 Astra 74,1 %, SWE-1.7 37,7 %).
- Terminal-Bench 2.1 : 92,8 % pour SWE-2, devant Fable 5.1 (91,4 %) et GPT-6 Astra (89,9 %).
- Terminal-Bench 4 : là, ça se calme — 27,3 % pour SWE-2, loin derrière Fable 5.1 (55,8 %) et GPT-6 Astra (57,9 %). Claim vendor à croiser avec vos propres workloads.
En résumé vendor : SWE-2 bat SWE-1.7 et Grok 4.6 en score et en coût, match GPT-5.6 Sol / Fable 5–5.1 pour une fraction du prix, et reste à quelques points de GPT-6 Astra pour environ un quart du coût. Ce sont leurs chiffres, sur leurs benches agentiques — à prendre comme une photo du 10 septembre, pas comme une vérité absolue.
Dispo : Devin Desktop et CLI dès aujourd’hui
SWE-2 est disponible dès maintenant dans Devin Desktop et le CLI. Rollout en cours sur Devin Web et Fusion. Pas d’API publique standalone annoncée dans le billet : le modèle vit dans l’écosystème Devin (et Windsurf côté Cognition), comme la lignée SWE précédente. Pour rappel, Cognition vient aussi d’annoncer une Series E colossale (~2 Md$ levés, valo ~48 Md$) — le timing SWE-2 tombe juste après, mais le sujet du jour, c’est bien le modèle.
Si vous tournez déjà Devin au quotidien, le levier intéressant n’est pas seulement le score max : c’est l’échelle d’effort medium / high / max sur une même famille, avec une courbe coût / perf qui bouge vraiment par rapport à SWE-1.7. À tester sur vos tickets réels, pas seulement sur FrontierCode.
Sources : billet Cognition SWE-2, annonce @cognition.

