Яндекс.Метрика
← Дайджест от 10 октября 2026

Модели плохо читают неявные социальные сигналы на фото и видео — тест Scale Labs

Scale Labs вместе с Elorian выпустила бенчмарк Humanity's Sixth Sense — набор заданий на то, насколько модель понимает неявные социальные сигналы и расположение предметов на фото и видео. В наборе 522 вопроса по 288 статичным сценам и 234 видеофрагментам.

Спрашивают о вещах, которые человек считывает без раздумий: разъедутся ли два автомобиля в этом проезде, зачем человек так себя ведёт, кто в группе главный. Мультимодальные модели — те, что принимают картинку и видео, а не только текст, — на этих заданиях отстают от людей заметно сильнее, чем на привычных тестах по распознаванию объектов.