Модели починили 81% уязвимостей из нового набора CWE-Bench за четыре попытки

Nazneen Rajani выпустила CWE-Bench v1 — набор из 120 задач на поиск и починку уязвимостей в коде. Задачи закрытые, то есть модели их в обучении не видели.
Набор покрывает 73 типа уязвимостей из классификатора CWE, все категории OWASP Top 10 за 2025 год и восемь языков программирования. Лучший результат — 81% при четырёх попытках на задачу: считается успехом, если хотя бы одна из четырёх попыток дала верную правку.
По словам авторов, за один год результат на таких задачах вырос примерно на 15 процентных пунктов.
Nazneen Rajani@nazneenrajani
Today we’re releasing CWE-Bench v1: 120 held-out audit-and-patch tasks spanning 73 CWEs, all OWASP Top 10 2025 categories, and 8 languages. Highest programmatic Pass@4: 81% (at least one success in four tries). The frontier is climbing fast (about 15% improvements in just one https://t.co/Z7KFEzyeJR
2728 сентября 2026