2Движки llama.cpp и SGLang научились отвечать выбором из вариантов вместо текста5 источников·X 3.9k·TG 17k›
7Одни и те же веса решают 62% задач у одного агента и 33% у другого — замер Hugging Face2 источника·X 514·TG 12k›
10BridgeMind выпустила NerfBench — тесты, которые ловят ослабление модели после релиза1 источник·TG 11k›