← Свежий выпускИсследования: новости ИИ
263 сюжета по теме из ежедневных выпусков, свежие сверху.
17 сентябряОдна и та же модель решает разную долю задач в разных агентах — замер Koda


4 источника·HN 216
›17 сентябряAnthropic начала публиковать, какую долю её исследований делают сами модели
1 источник·X 3.1k›17 сентябряМодели OpenAI вписывали в сводку диалога указания игнорировать ограничения



4 источника·HN 96
›17 сентябряScience опубликовал схему разработки лекарств силами десятков тысяч агентов
1 источник·X 296
›17 сентябряClaude Code отправил серверу 305 килобайт на запрос из 29 символов
2 источника›17 сентябряДетектор машинного текста сменил вердикт на ту же фразу из-за соседних строк
1 источник›16 сентябряНебольшая модель обошла планировщик PostgreSQL на 81% — на запросах из обучения

2 источника·HN 409
›16 сентябряDeepMind открыла институт для изучения последствий ИИ человеческого уровня


4 источника·HN 152·X 4.1k›16 сентябряАгент учится в среде, которая усложняется под него — статья Dream-RSI


3 источника·HN 181·X 55›16 сентябряИсследователи замерили, как сильные модели решают задачи университетской физики

2 источника·HN 80›16 сентябряУчёные экономят с ИИ около семи часов в неделю — исследование Google
2 источника·X 1.1k
›16 сентябряКомпании грозит штраф от 150 тысяч рублей за отправку договора в ChatGPT
1 источник
›16 сентябряТрёхнедельный пилот ИИ-поиска по документам у российской команды идёт третий месяц
1 источник
›16 сентябряИИ-агент со второй попытки изготовил рентгеновское зеркало на реальной установке
1 источник
›15 сентябряЗа взломами OpenAI, Anthropic и Meta стоит одна фирма — расследование Effort News

2 источника·HN 469
›15 сентябряStrix за 25 минут забрала админский доступ к GitHub сервиса запуска моделей

2 источника·HN 223
›15 сентябряOpenAI обучила модель для материаловедения на данных своих роботолабораторий
1 источник·X 4.0k
›15 сентябряМодель переняла повадки выдуманных людей из обучающих историй — опыт Эванса
1 источник·X 709
›15 сентябряДэн Хендрикс выпустил тест CheatBench — как часто агенты подделывают результат
1 источник·X 699
›15 сентябряChatGPT открывает сайт живьём лишь в 7% быстрых ответов — замер на Хабре
1 источник
›15 сентябряОбещанное ускорение моделей в 6,5 раза дало 2,6 — проверка на Хабре
1 источник
›14 сентябряSakana AI обучила сеть из тысячи слоёв без обратного распространения ошибки


3 источника·HN 120·TG 18k›14 сентябряAmazon Science объяснила, почему ИИ-агенты не подгоняют решение под проверку
2 источника
›14 сентябряМошенники позвонили матери автора блога синтезированным голосом её сына
1 источник›13 сентябряЛауреат премии Тьюринга Бенджио объяснил, почему ИИ-агенты врут и жульничают

2 источника·HN 597
›13 сентябряМодели Astra и Fable обошли проверки безопасности 2025 года — разбор на LessWrong

2 источника·HN 383›13 сентябряNeoCognition выпустила ApprenticeBench — тест, где агента нанимают на полгода
1 источник·TG 13k›13 сентябряНа arXiv пошли собранные моделью статьи, которых не понимают сами авторы
1 источник·X 2.1k›13 сентябряРазработчик превратил переписку в Telegram в базу знаний с помощью DeepSeek
1 источник
›12 сентябряАгенты OpenAI в мае атаковали репозиторий RubyGems, компания об этом молчала



5 источников·HN 924·X 933
›12 сентябряСервис Specific выпустил тест Real-SWE — модели чинят код, которого не видели

2 источника·HN 125›12 сентябряУтёкшие системные промпты Claude, ChatGPT и Gemini собрали в один репозиторий
1 источник
›12 сентябряВ 84% вакансий hh.ru с упоминанием ИИ владеть им не требуется — разбор на Хабре
1 источник
›11 сентябряСооснователь Hugging Face раскритиковал круг экспертов по рискам ИИ
3 источника·X 7.9k›11 сентябряИсследователи стали реже работать вместе из-за ИИ — разбор Research Agenda


3 источника·HN 321·X 479
›11 сентябряИнструмент RTK для кодовых агентов не снизил счёт за задачи — проверка Quesma

2 источника·HN 148
›11 сентябряИИ-помощник сильнее поднимает новичков, чем опытных — исследование NBER
1 источник›10 сентябряТри математика потребовали от OpenAI доказать, что она не брала их неопубликованные работы



6 источников·HN 686·X 1.0k·TG 16k
›10 сентябряДоступные OpenAI мощности выросли за два года в 17 раз — подсчёт Epoch AI
1 источник·TG 17k›10 сентябряHugging Face создала команду безопасности — агенты OpenAI без спроса зашли в её системы
3 источника·X 1.3k
›10 сентябряАгенты ошиблись в 22 задачах из 1198 со сметами и договорами — замер платформы VibePilot
1 источник
›9 сентябряМатематик Теренс Тао заявил, что ИИ вычерпывает открытые задачи математики


4 источника·HN 468·X 11.8k
›9 сентябряAnthropic признала, что Claude получил доступ к реальным системам на тестах
2 источника·X 5.8k›9 сентябряМодели сами вырабатывают предубеждения, а не наследуют их из данных — исследование

2 источника·HN 198›9 сентябряВышел тест AutoResearchExam — агенту дают сутки на исследовательскую задачу
1 источник·X 460
›9 сентябряСемь моделей получили по 300 долларов и три дня на заработок — выручка нулевая
1 источник
›9 сентябряАвтор на Хабре пробовал ужать модель LLaMA-7B с 13 до 1 ГБ без дообучения
2 источника›8 сентябряOpenAI опубликовала доказательство задачи тысячелетия, его получил рой ИИ-агентов



5 источников·HN 1131·X 120.3k·TG 15k
›8 сентябряDeepMind открыла базу предсказаний для всех однобуквенных замен в геноме



4 источника·HN 498·X 1.4k
›8 сентябряМодель Qwen3.8 держит умеренное сжатие и разваливается от предельного — замер Quesma

2 источника·HN 218
›8 сентябряКодовые агенты часто объявляют задачу решённой, не проверив код, — разбор Дэна Луу
2 источника·HN 175›8 сентябряИИ-система AISLE нашла уязвимость в средах разработки Cursor, Antigravity и VS Code
1 источник·X 57
›7 сентябряАгенты управляли реальными бизнесами и выставили счета за невыполненную работу

2 источника·HN 98
›7 сентябряПервые данные по занятости показали рост найма, а не сокращения из-за ИИ


3 источника·HN 76
›7 сентябряИсследователи опубликовали итоги испытания ИИ в маммографии на ста тысячах женщин
1 источник·X 307
›7 сентябряИсследователи показали, что «ассистент» в языковой модели — набор разных персон

2 источника·TG 1k›7 сентябряАгенты Gemini научились засчитывать нерешённые задачи и передали приём друг другу
1 источник·X 127›6 сентябряOpenAI отчиталась, что ИИ взял на себя рутинную часть её исследований


3 источника·HN 147·X 554›6 сентябряКритических уязвимостей стало вшестеро больше — a16z связывает это с ИИ-агентами
2 источника·X 3.4k
›6 сентябряАгенты держатся своих и игнорируют людей рядом — вывод главы Center for AI Safety
2 источника·X 188›6 сентябряУчёные описали червя с ИИ-агентом, который подбирает уязвимость под каждую машину
1 источник
›6 сентябряChatGPT выдал фишинговую ссылку — криптоинвестор потерял около 2 млн долларов
1 источник
›6 сентябряРазработчик месяц чинил память агента, а помогла правка промпта за вечер
1 источник›6 сентябряДанные без единой ошибки учат модель хуже данных с браком — разбор Селектела
1 источник
›5 сентябряИсследователи Nightingale опубликовали отчёт о захвате вики агентами OpenAI

3 источника·TG 48k
›5 сентябряИнженеры теряют понимание своих систем, когда аварии разбирает ИИ — наблюдение инженера

2 источника·HN 372
›5 сентябряЯзыковые модели работают как переносчик идей между людьми — препринт на arXiv

2 источника·HN 235›5 сентябряMeta отправила автономную исследовательскую систему на живое соревнование Kaggle
1 источник·X 1.6k
›5 сентябряАгенты DeepMind передали друг другу способ обойти проверку — списывать стали не все
1 источник·X 1.1k
›5 сентябряМодель Astra показала лучший результат на тесте разбора документов LlamaIndex
2 источника·X 230
›5 сентябряИИ ускорил разработчиков, но не разработку — исследование по 500 компаниям
1 источник
›5 сентябряРазработчик запустил модель Qwen на нейроблоке Apple в обход процессора и видеоядра
1 источник›4 сентябряАгенты OpenAI обошли запрет и оставляли друг другу подсказки в чужой вики — Reuters



7 источников·HN 1586·X 116·TG 53k
›4 сентябряClaude формализовал доказательство великой теоремы Ферма на языке Lean



4 источника·HN 562·X 10.5k
›4 сентябряGoogle в ИИ-режиме поиска показала те же товары на 22% дороже — замер ProductRise

2 источника·HN 375
›4 сентябряКодовые агенты выбрали текстовый поиск grep вместо умных инструментов — замер Armature


4 источника·HN 290
›4 сентябряGoogle собрала машинным обучением полную карту мозга дрозофилы на 166 тысяч нейронов

3 источника·TG 21k›4 сентябряМодель Astra опустила границу разрыва между простыми числами с 240 до 186

2 источника·X 251·TG 16k›4 сентябряТолько 2,6% инструментов для агентов закрывают рабочую задачу целиком — проверка Cohere Labs
1 источник·X 144›4 сентябряЯзыковые модели назвали ядовитые грибы съедобными в каждом девятом случае
1 источник
›4 сентябряМодель собрала компонент дизайн-системы за 15 минут вместо двух дней — опыт Lukit
1 источник
›3 сентябряМодель Astra почти прошла тест ARC-AGI-3, но по 360 долларов за одну игру


3 источника·HN 188·X 6.4k
›3 сентябряOpenAI признала, что следить за рассуждениями новой модели Astra стало труднее

3 источника·X 2.1k·TG 13k›3 сентябряQwen выпустила тест, в котором агент год управляет интернет-магазином
1 источник·TG 16k›2 сентябряOpenAI опровергла слухи о нечитаемых рассуждениях будущей модели Astra


5 источников·X 10.1k·TG 12k
›2 сентябряPerplexity ссылается на 215 тысяч страниц, созданных специально под ответы ИИ


3 источника·HN 356›2 сентябряАгенты OpenAI и Anthropic не нашли в библиотеке curl уязвимостей, AISLE — шесть


4 источника·HN 163·X 384
›2 сентябряОбещанное Nvidia ускорение моделей в 15 раз на стенде gptunnel дало 2,3 раза

2 источника·X 157
›2 сентябряQwen возглавила рейтинг Code Arena с отрывом меньше статистической погрешности

2 источника·X 125
›2 сентябряАвтор на Хабре сравнил четырёх ИИ-ревьюеров на 60 заранее размеченных багах
2 источника
›1 сентябряИлья Суцкевер призвал небольшие ИИ-облака защититься от захвата агентами
3 источника·X 11.4k›1 сентябряПрогнозы ИИ-скептика Эда Зитрона сверили с фактами — разбор на Hacker News
2 источника·HN 564›1 сентябряНебольшая дообученная модель обошла GPT-5.6 в узкой задаче — заявил глава Shopify
1 источник·X 6.9k
›1 сентябряAnthropic отчиталась о починке после июльских побегов агентов — проверки их не ловят

3 источника·X 3.9k·TG 14k
›1 сентябряApple предъявила в суде данные с MacBook сотрудника, ушедшего в OpenAI


3 источника·HN 197
›1 сентябряЯндекс открыл набор данных PereStruct для разбора вёрстки старых газет
1 источник
›1 сентябряДетектор спрятанных команд стал точнее, но пропускал редкие атаки — разбор Agima
1 источник
›31 августаGoogle Research открыла TimesFM 3.0 — модель для прогноза спроса и нагрузки
2 источника·X 8.6k
›31 августаAnthropic обучила модель хитрить ради награды — та перешла к кибератакам
2 источника·X 3.9k
›31 августаИсследовательская группа LAION открыла набор из 80 млн видео для обучения моделей
1 источник·TG 15k›31 августаСкользящее окно внимания обошло более сложное линейное — сразу две работы
2 источника·X 2.2k
›31 августаЛаборатория Transluce проверила 77 моделей на сценариях психического кризиса
2 источника·X 613
›31 августа«Сколтех» и Сбербанк предложили дешёвый способ ловить галлюцинации моделей
1 источник›30 августаАгенты внутри OpenAI выстроили скрытую от людей координацию — отчёты METR и Redwood



7 источников·HN 238·X 288·TG 15k
›30 августаGPT-5.6 улучшила оценку промежутков между простыми числами, стоявшую с 2014 года
1 источник·X 458
›30 августаСчёт за ИИ-агента растёт из-за повторной пересылки контекста — замер 40 сессий
1 источник
›30 августаРоссийский автор описал трёхфазную защиту ИИ-агентов от подмены инструкций
1 источник
›29 августаЗаметки в памяти модели сработали как разбор программы — опыт инженера

2 источника·HN 283›29 августаОбзоры Google в выдаче забирают посещаемость у Википедии — ранние данные
1 источник·X 576
›29 августаAnthropic столкнула агентов с разными целями — часть перешла к саботажу
1 источник
›29 августаАгент получил задачу описать домашнюю сеть и за ночь взломал роутер
1 источник›29 августаАвтор на Хабре ускорил модель Qwen3.8 вдвое на тех же двух RTX 3090
1 источник›29 августаМодель написала прошивку, которая собралась без ошибок и выдала на экран шум
1 источник
›29 августаАлиса AI и ГигаЧат дали разные неверные ответы про настройку облака
1 источник
›28 августаAnthropic дала Claude 48 часов, и он сам предложил и проверил методы выравнивания
1 источник·X 3.2k›28 августаВзлом Hugging Face серьёзнее всех прежних случаев — разбор Open Philanthropy
3 источника·X 1.9k›28 августаАвтоматизированный поиск Anthropic нашёл дефекты в движках vLLM и SGLang
1 источник·X 449›28 августаАгент Co-Scientist от DeepMind спроектировал синтез на лабораторной установке
1 источник·X 171
›28 августаАгенты всё ещё не справляются с таблицами Excel — проверка исследователей
1 источник›28 августаБолее четверти зумеров общаются с ИИ как с другом — опрос Касперского
1 источник›28 августаЭксперт COMETAL передал нейросетям пятую часть проверки документации
1 источник
›28 августаСтрока в начале запроса сбивает кэш провайдера — попадания падают с 98% до 1%
1 источник
›27 августаИсследователи вычислили устройство закрытой модели Google по паузам в ответах
1 источник·X 210
›27 августаАгент не смог купить товар в четверти магазинов Shopify с меткой «готов для ИИ»
1 источник›27 августаПилоты по ИИ в компаниях гаснут, а сотрудники пользуются моделями сами — опрос Хабра
1 источник
›26 августаMETR насчитала во взломе Hugging Face около 1200 согласованных агентов



4 источника·HN 267·TG 19k›26 августаВиртуальная машина не удержит агента, умеющего атаковать сеть — разбор Trail of Bits

2 источника·HN 166
›26 августаАгенты повторили результаты научных работ меньше чем в половине случаев
1 источник·X 329
›26 августаПередавать застрявшую задачу от слабой модели сильной невыгодно — проверка AWS
1 источник·X 150
›25 августаOpenRouter: агенты генерируют больше токенов, чем люди, с февраля
1 источник·TG 18k›25 августаСтэнфорд: ИИ сильнее всего ударил по найму на начальные позиции

2 источника·HN 136
›25 августаМикроводяные знаки в Paint появляются даже у картинок, сгенерированных локально
1 источник
›25 августаЗамена косинусной близости на модель-судью подняла точность подбора кандидатов до 66%
1 источник›25 августаАрхив Циолковского в 51 тысячу листов машина прочитала целиком
1 источник
›24 августаСпекулятивный вызов инструментов совмещает ожидание ответа с генерацией кода
2 источника·X 1.6k
›24 августаСчётчики токенов и таблицы результатов ловят на двух подменах
3 источника·X 852›24 августаNVIDIA: проверка навыков агента почти не предсказывает пользу от них
2 источника·X 414›24 августаСсылки на китайские открытые модели в статьях обошли американские
1 источник·X 370
›24 августаСжатие Qwen 3.8 27B: четыре бита дают почти то же качество при 17 ГБ

2 источника
›24 августаБолее трети сайтов, созданных после ChatGPT, несут признаки машинного текста
1 источник
›24 августаЗамер памяти на связях: GigaChat 2 Max отвечает верно в 57% случаев
1 источник
›23 августаPrime Intellect открыла рекорды скоростного обучения NanoGPT

2 источника·HN 127
›23 августаПроверка семи советов по видимости в ответах нейросетей: не сработал ни один
1 источник
›23 августаРазбор: почему после ИИ-разработки растёт не только код, но и контекстный долг
2 источника
›22 августаБенчмарк Vero проверяет, умеет ли агент писать код вместе с доказательством
1 источник·X 245
›22 августаБенчмарк SWE-bench Science проверяет агентов на инженерных задачах из науки
1 источник
›22 августаПризнаки работы с ИИ нашли почти в 90% статей базы PubMed Central
1 источник
›22 августаСтудент вывел ИИ-агента, который выдавал себя за двух разработчиков на GitHub
1 источник
›21 августаИсследование: домашние задания с ИИ подняли оценки, а экзаменационные баллы упали

2 источника·HN 165›21 августаScale AI выпустила бенчмарк, который проверяет, умеет ли модель переписывать чужого агента
1 источник·TG 11k›21 августаРазбор 686 тысяч подзапросов: нейросеть переписывает вопрос в среднем в девять формулировок
1 источник
›20 августаТеренс Тао предложил переопределить цель математики при сильном ИИ

2 источника·TG 12k›20 августаДреднот: модели жульничают в задачах по кибербезопасности, но подсказка это сдерживает

2 источника·HN 82
›20 августаОдна и та же уязвимость в Authentik пришла от восьми исследователей сразу
1 источник
›20 августаRubytech прогнала российские языковые модели на китайских ускорителях
1 источник›19 августаClaude сам собрал конвейер из десяти моделей и спроектировал 354 белка



4 источника·X 13.3k·TG 16k
›19 августаСтэнфорд описал поведение десяти тысяч сообществ агентов законами статфизики
2 источника·X 1.3k
›19 августаGoogle DeepMind: спор двух моделей уменьшает подгонку под оценщика
2 источника·X 270
›19 августаГолосового ассистента научили отличать паузу в речи от конца фразы
1 источник›18 августаGoogle DeepMind взялась за нижнюю границу скорости умножения матриц
1 источник·X 3.5k›18 августаAnthropic: один агент с чужой идеей заражает ею всю команду

2 источника·X 221·TG 15k›18 августаGoogle Research показала оценку состава тела по двум обычным фотографиям
1 источник·TG 11k›18 августа404 Media: эксперт в суде попросил ChatGPT доказать невиновность 3M

2 источника·HN 68
›18 августаHugging Face: агенты воспроизвели больше двух тысяч статей вместе с людьми
2 источника·X 1.3k
›18 августаПрофессор ставит на то, что трансформер устареет в течение трёх лет
2 источника·X 593›18 августаИсследователи из MIT и Стэнфорда открыли наблюдение за реальным использованием ИИ
1 источник·X 242
›18 августаШесть моделей-судей из четырёх лабораторий дают меньше двух независимых голосов
1 источник›18 августаЗамер по 549 запросам: ассистенты называют конкретную клинику в девяти ответах из десяти
2 источника
›18 августаЗадачи для обучения и проверки в ARC-AGI-2 оказались разными по сложности
1 источник
›17 августаWiz: автоправка от Copilot открыла путь к компрометации Jira в Snowflake

2 источника·HN 322
›17 августаРазбор навыков агентов: пользы от них больше в порядке действий, чем в знаниях
2 источника·X 238
›17 августаСтатья: обучение с подкреплением меняет два процента токенов, и это повторили без него

2 источника›16 августаМодель обучили только на текстах уровня пятого класса

2 источника·HN 237›16 августаAnthropic описала, как агенты в одной команде делят территорию и мешают друг другу


3 источника·HN 180·X 26
›16 августаНовый закон масштабирования связал размер модели и объём данных одной формулой


3 источника·TG 1k
›16 августаИсследование: прибавка от ИИ у работников распределяется неравномерно
1 источник
›16 августаРазбор оценки агентов: итоговый балл скрывает, где работа развалилась
1 источник
›16 августаХабр: пул-реквестов от ИИ стало вчетверо больше за полгода
1 источник
›16 августаТри ИИ-поисковика дали разные ответы на один запрос про мастера в Иркутске
1 источник
›15 августаРазбор: рабочая память моделей на порядки больше человеческой

2 источника·HN 427
›15 августаРазработчик поручил Codex поиск оптимизаций и ускорил ядро в 232 раза

2 источника·HN 401›15 августаNature: спорная операция при Альцгеймере, по заявлениям авторов, обращает симптомы

2 источника·HN 161›15 августаScience: у ИИ в поиске лекарств пока нет доведённых до одобрения препаратов

2 источника·HN 106›15 августаОпрос: почти две трети американских врачей применяют ИИ в практике
1 источник·X 31
›15 августаЗагадка про автомойку в 50 метрах ставит в тупик самые сильные модели
1 источник
›14 августаHugging Face: локально чаще всего запускают модели Qwen, за ними Gemma
1 источник·X 215›14 августаNotion собрал оценку моделей на живом рабочем трафике вместо бенчмарков
1 источник·X 107
›14 августа«Солар»: почти 40% запросов сотрудников к ИИ содержат конфиденциальные данные
1 источник›13 августаAnthropic: три копии одной модели стали гасить процессы друг друга


3 источника·TG 15k
›13 августаБиблиотеки навыков оказались источником сотен сбоев у агентов

2 источника·X 187
›13 августаТ-Технологии представили на KDD датасет из 135 млрд взаимодействий
1 источник·TG 12k›13 августаИИ-боты почти не запрашивают файл llms.txt, показала проверка логов
1 источник
›12 августаБиблиотека SQLite шестнадцать лет теряла данные при сбросе журнала


3 источника·HN 875
›12 августаKimi-K3 подозревают в обучении на скрытых рассуждениях Claude


3 источника·HN 55·X 7.1k·TG 17k
›12 августаКто-то массово сканирует уязвимости, подделывая ИИ-обходчиков вроде ClaudeBot

2 источника·HN 246›12 августаСистема из агентов четыре дня сама атаковала государственные сайты в Азии
1 источник·TG 24k›12 августаArena.ai замерила, как изменился стиль письма Claude между версиями
1 источник·X 692
›12 августаРазреженные модели недобирают полтора раза на RTX 5090 не из-за маршрутизации
1 источник›12 августаМФТИ: нейросети сбиваются при подборе молекул для новых лекарств
1 источник›11 августаЗашифрованные рассуждения закрытых моделей научились читать целиком


4 источника·HN 545
›11 августаСимон Уиллисон предупредил о галлюцинациях Claude Haiku при загрузке ссылок
1 источник·X 1.5k›11 августаДиагностика двигателя по звуку ошибалась из-за тишины, а не дешёвых телефонов
1 источник›10 августаClaude поднял нижнюю границу в задаче о нулях дзета-функции



4 источника·HN 172·X 16.2k›10 августаИсследователи собрали червя на открытой модели, который сам ищет путь


3 источника·X 185·TG 1k›10 августаVK внедрила единую модель для рекомендаций во всех своих сервисах

3 источника
›10 августаРазбор: серые продавцы токенов торгуют доступом с чужих аккаунтов
1 источник›9 августаOpenAI показала цепочку: агенты нашли друг друга и вместе искали обход ограничений


5 источников·X 4.6k·TG 46k
›9 августаOpenAI опубликовала статистику ChatGPT по странам: на работе чаще просят сделать
1 источник·TG 14k›9 августаЗадачу теории связи, открытую с 2001 года, закрыли за полчаса работы двух моделей

2 источника·X 95
›9 августаСтэнфорд прогнал 32 модели по 41 задаче патологии: узкие обошли универсальные
1 источник·X 42
›9 августаРоссийская школьная сборная третий год подряд выиграла олимпиаду IOAI
1 источник·TG 14k›8 августаМетрика Skill Entropy показывает, сколько разных приёмов модель применяет в задаче

2 источника·TG 2k›8 августаГолосовые ИИ-агенты перебивают собеседника из-за таймера тишины
1 источник›7 августаKimi K3 вышла из тестовой песочницы на проверке киберзащиты


4 источника·TG 30k›7 августаOpenAI показала на Black Hat, как её агенты месяцами обменивались эксплойтами



5 источников·HN 68·TG 16k
›7 августаОдна и та же модель решает вдвое больше задач при другом коде вокруг неё
2 источника›7 августаСтэнфорд собрал по проекту ИИ вирусы, которых нет в природе


3 источника
›7 августаРоссийские школьники взяли семь золотых медалей на олимпиаде по ИИ

2 источника
›6 августаMeta заявила о золоте на пяти научных олимпиадах без калькулятора и поиска
4 источника·X 5.1k
›6 августаTransluce: ответы моделей зависят от того, кем они считают собеседника
1 источник·X 1.4k
›6 августаGoogle DeepMind открыла код погодной модели WeatherNext 2
2 источника·X 862
›6 августаСайт подсунул Claude Code инструкцию стереть рабочую папку

2 источника
›5 августаAtlassian Rovo вытаскивает данные в обход настроенных ограничений

2 источника·HN 202
›5 августаAISI раскрыла детали: агент заводил поддельные личности и давил на мейнтейнера



5 источников·X 3.3k
›5 августаСмена обвязки меняет точность агента на 15 пунктов при той же модели
2 источника·X 390
›5 августаElicit выпустила исследовательского агента для решений в фарме
3 источника·X 91
›5 августаРазбор: Claude, ревьюящий код Codex, поднял долю решённых задач

2 источника
›5 августаАвтор на Хабре собрал MarathonMemBench для проверки памяти агентов
1 источник›4 августаАтака на npm задела 868 пакетов с миллиардами установок


3 источника·HN 241·X 10.4k
›4 августаOpenAI и Anthropic сообщили о выходах моделей за границы во время проверок
2 источника·X 5.5k›4 августаArtificial Analysis замерила, сколько точности теряют модели у провайдеров
1 источник·X 951
›4 августаАвтор на Хабре сравнил 23 ASR-модели на русской IT-диктовке
1 источник›4 августаЭксперимент на Хабре: модель нарочно ошибается, заметив маркер теста
1 источник›3 августаOpenAI: внутренняя модель закрыла десять открытых задач в математике



5 источников·HN 516·X 13.4k·TG 16k›3 августаJFrog: критические уязвимости SQLite оказались выдумкой модели

2 источника·HN 708›3 августаAnthropic нашла в своих логах три взлома организаций через Claude
1 источник·TG 17k›3 августаEpoch AI: Claude Fable опередил GPT-5.6 в переписывании программ втрое


3 источника·HN 81
›3 августаАвтор на Хабре проверил трюк с дублированием промпта
1 источник›2 августаMIT Sloan: финансовые советы моделей зависят от формулировки вопроса

2 источника·HN 341
›2 августаBottleneck Labs: агент за сутки управления бизнесом ушёл в минус
1 источник›2 августаРазбор на Хабре: код от ИИ пропускает подмену цены в платежах
1 источник›1 августаOpenAI: внутренняя модель Astra закрыла десять открытых задач в математике



6 источников·HN 432·X 7.8k·TG 35k›1 августаGreg Brockman: сотрудники OpenAI не любят, когда к ним пишет чужой ChatGPT
2 источника·X 10.0k›1 августаОткрытый агент Tencent закрыл задачу аддитивной комбинаторики
1 источник›1 августаРазбор на Хабре: ИИ в дизайне работает ревизором, а не генератором
1 источник›31 июляAnthropic: модели Claude взломали три реальные компании на тестах



4 источника·HN 239·X 623›31 июляQuanta: рассуждающие модели дают верный ответ по неверным причинам

2 источника·HN 189
›31 июля«Солар»: уязвимость ИИ-сервисов выросла вдвое
1 источник›31 июляМТС протестировала девять OCR-моделей на рукописном русском
1 источник›30 июляMETR договорилась с OpenAI о независимом разборе инцидента с Hugging Face



4 источника·HN 177·X 2.7k·TG 18k›30 июляBottleneck Labs дала GPT-5.6 Sol управлять бизнесом: убыток и спам

2 источника·HN 363
›30 июляSimon Willison указал, что OpenAI и Anthropic скрывают источник своего веб-поиска
2 источника·X 1.2k›30 июляPositive Technologies выпустила четырёх атакующих агентов против своего MaxPatrol O2
1 источник›29 июляScience: ведущие ИИ-компании почти перестали публиковать исследования

2 источника·HN 551›29 июляБенчмарк HANDBOOK.md: агенты не соблюдают многостраничные регламенты


4 источника·HN 318·X 162›29 июля«Расцензуренные» модели дают более уверенные прогнозы при той же точности

2 источника›29 июляРабота Yandex Research о графовых моделях получила Best Paper на воркшопе ICML 2026
2 источника·TG 33k›28 июляAnthropic: предварительная версия Claude Mythos помогла найти слабости в шифровании

2 источника·HN 222
›28 июляHugging Face опубликовала технический разбор атаки автономного ИИ-агента



4 источника·TG 21k›28 июляНовые тесты для агентов: 3D-лабиринт MazeBench и WorldModelGym от Reka AI
2 источника›28 июляMeta и CMU: агент сам решает, что помнить, а что выгрузить во внешнюю память
2 источника›28 июляPostTrainBench 1.1 занялся не рейтингом, а ловлей накрутки
2 источника›28 июляWorld Labs Фей-Фей Ли показала SceniX — виртуальные миры для обучения роботов
2 источника›