Simon Willison выпустил smevals для сравнения моделей и обвязок
Разработчик Simon Willison представил smevals — небольшой инструмент, который прогоняет один и тот же набор проверок по разным моделям, обвязкам и формулировкам запроса. Смысл в том, чтобы отделить вклад модели от вклада всего остального.
В ту же сторону движутся вендоры: PromptLayer добавил подделку ответов инструментов, чтобы тестировать агента целиком без обращений к боевым системам, а LangChain продвигает стандартизацию внутренних проверок через Harbor. Общая линия — проверки перестают быть блокнотом на коленке и становятся системой, которая принадлежит компании.
Simon Willison@simonw
I've been working with Prime Radiant building a new tool for running small eval suites against models, harnesses, and prompts - it's called "smevals", you can try it with "uvx smevals docs", and I wrote about it here: https://t.co/zj3sFgSN03
126 ♡
31 июля 2026