ИИ-агенты уже могут заниматься наукой. Что дальше?

Что получилось, когда мы попробовали сами, и почему научная система к этому не готова

Сергей Гусев и Давид Э. Бернал Нейра · Университет Пердью · сентябрь 2026 года

Обложка SECQUOIA к статье «ИИ-агенты уже могут заниматься наукой. Что дальше?»: фигурки ИИ-агентов работают с научными записями и компьютером.

Что сделали агенты (на 25 сентября 2026 года) · Литература

Этим летом в математике случилось два громких события. В августе сотрудник Anthropic без математического образования попросил ещё не вышедшую модель Claude «всерьёз попробовать» доказать гипотезу Римана — одну из самых известных нерешённых задач математики. Гипотеза утверждает, что определённые нули одной функции лежат на одной прямой. Доказать её модель не смогла, но доказала, что на этой прямой лежит больше 66 % таких нулей; прежний рекорд был около 42 %, и математики десятилетиями поднимали эту долю по чуть-чуть [1]. В сентябре OpenAI объявила, что около десяти тысяч агентов искусственного интеллекта (ИИ) за 88 часов работы доказали один из вариантов другой знаменитой открытой проблемы — об уравнениях Навье–Стокса, которые описывают течение жидкости; независимая проверка ещё идёт [2]. По одной сторонней оценке, такой объём вычислений обошёлся бы обычному клиенту в несколько миллионов долларов [3]. С тех пор OpenAI заявила, что та же модель решила ещё больше сотни открытых проблем, но пока их не опубликовала [4].

Оба результата получены внутри ИИ-компаний — на ещё не вышедших моделях и с бюджетами, которых нет ни у одной исследовательской группы. Может ли научная группа со стороны, с моделями, доступными каждому, добиться от агентов настоящей исследовательской работы?

Мы попробовали сами. И это действительно работает — пусть и в меньшем масштабе, чем у ИИ-компаний, и за малую долю их затрат.

Последние несколько недель мы давали группам ИИ-агентов исследовательскую область — от одной узкой темы до целой дисциплины. У агентов были статьи и вычислительные инструменты, а просили мы об одном: получать настоящие, верные и полезные результаты и не останавливаться. Никаких собственных исследовательских идей от нас они не получали.

В одном из экспериментов агенты уже за первые сутки написали больше заметок, чем мы смогли бы прочитать за неделю. За несколько недель они подготовили материал для 45 потенциальных научных статей в пяти областях, которые мы им дали: смешанно-целочисленном нелинейном программировании, квантовых методах внутренней точки, молекулярной термодинамике, явлениях переноса и кинетике агрегации. В шестой области, гетерогенном катализе, мы вместо статей попросили предложить эксперименты, и агенты спланировали лабораторные эксперименты; их ещё никто не проводил, так что судить об их качестве пока рано. Мы проверили не всё и пока не можем сказать, какая часть результатов верна и нова. Но во всём, что мы успели проверить, не нашлось ни одной ошибки, которая перечёркивала бы результат, а часть результатов доказана в Lean — системе, где компьютер проверяет каждый шаг доказательства.

В этом тексте мы рассказываем, что сделали, почему считаем это важным и что, по-нашему, должно произойти дальше. Подробно, с данными и всеми оговорками, это описано в научной статье. Все материалы агентов выложены в открытый доступ: https://github.com/SECQUOIA/agent-swarm-research [5]; здесь мы описываем их по состоянию на коммит 84c6be7, то есть в том виде, в каком их оставили агенты, без нашего научного участия.

Что мы сделали

Вся процедура укладывается в три шага (рисунок 1).

Описать задачу. Дать рою ресурсы и поручить работу. Рецензировать, записывать и проверять.
  1. Описать задачу.

    Дать рою задачу или область, достаточно контекста для начала работы и свободу исследовать любые идеи.

  2. Дать рою ресурсы и поручить работу.

    Дать статьи и инструменты, разрешив искать новые. Попросить агентов получать результаты и не останавливаться.

  3. Рецензировать, записывать и проверять.

    Каждый результат проверяет новый агент. Всё записывается. Где можно — проверка доказательством или расчётом.

Рисунок 1. Наша процедура. Примеры промптов, которыми мы пользовались, приведены в научной статье.

Мы пользовались готовыми инструментами: агентами для программирования Claude Code и Codex, в основном на моделях Claude Fable 5.1 и GPT-6 Astra, по двум подпискам Claude и двум подпискам ChatGPT за 200 долларов в месяц каждая. При оплате за фактическое использование те же объёмы обошлись бы больше чем в 15 000 долларов за первые четыре недели. Собственных программ мы не писали — только несколько инструкций, чтобы поддерживать порядок в работе. Повторить это сегодня может любой, у кого есть доступ к этим моделям.

Наша процедура — не лучший способ вести исследования с агентами: это решение «в лоб», и мы намеренно её не настраивали. Но если работает даже такое простое решение, более продуманные методы дадут больше.

Мы не ожидали, что это сработает. Месяцами мы разрабатывали инструменты для тесной совместной работы людей и ИИ: исследование направляли мы и на каждом шаге проверяли работу. Толку от них было немного. Когда мы отошли в сторону и доверили агентам всё — от выбора направлений до проверки результатов, — результаты появились уже через сутки, причём в большом количестве. Задним числом причина понятна: в теоретических исследованиях агенты становятся лучше на каждом этапе работы и с большинством этапов уже справляются достаточно хорошо. Они сами могут направлять исследование и проверять работу, при этом читают и считают больше, чем люди, и разрабатывают несколько идей одновременно. Чем лучше становятся модели, тем меньше мы можем добавить к решению конкретной задачи, и каждое наше вмешательство в основном замедляет работу.

Что получилось

Прорывов среди этого нет. Это постепенная работа — небольшие, но надёжные шаги, из которых и складывается большая часть научного прогресса. Верить нам на слово не нужно. Всё, что сделали агенты, выложено в открытый доступ, и проверить это может любой. В таблицах в конце текста перечислены все потенциальные статьи и предложенные экспериментальные программы — с тем, что утверждают агенты, и ссылками на черновики. Результаты ИИ-компаний — прорывы в знаменитых задачах. То, что получили мы, — это повседневная исследовательская работа в нескольких не связанных между собой областях.

Для части этой работы новейшие модели и не понадобились. Часть результатов по квантовым методам внутренней точки получена с GPT-5.6 Sol — моделью, которая к моменту наших опытов была в открытом доступе уже почти два месяца. Модели умели делать такую работу ещё до того, как мы это заметили, и мы подозреваем, что так же обстоит дело во многих других областях теоретической науки.

Узким местом стала проверка

Агенты выдавали результаты быстрее, чем мы успевали их проверять. Если тратить на каждую потенциальную статью или экспериментальную программу по нескольку дней, одному из нас на проверку всего понадобилось бы больше семи месяцев работы на полную ставку. А на получение самих результатов ушли недели.

Любая система научных публикаций исходит из того, что автор проверил свою работу и отвечает за неё, а рецензенты затем смотрят на неё ещё раз. Когда один человек производит больше, чем в состоянии проверить, отправить такую работу сразу в печать — значит пропустить авторскую проверку, и никакое внешнее рецензирование её не заменит. При этом решения о найме, повышении и финансировании в академической среде по-прежнему опираются на число статей, а статью теперь можно получить почти даром.

Если бы всё это было шумом, его можно было бы просто не замечать, и было бы неважно, сколько непроверенного накопилось. Но эти результаты заслуживают внимания.

Для скептиков

Вот возражения, которые мы часто слышим.

«Результаты не впечатляют. Хороший исследователь и сам бы до них додумался». Возможно. Но тогда почему их не было в литературе? Превосходят ли агенты лучшего специалиста в области — лишь часть вопроса. Скольких исследователей агентам нужно догнать, чтобы области пришлось менять свои правила? Всех, кроме лучшего процента? Всех, кроме одного человека? Мы считаем, что агенты уже не уступают многим работающим исследователям, в том числе нам.

«Это статистическая машина. Она умеет только по-новому комбинировать то, что уже видела». Большая часть исследований — тоже новые комбинации: известный метод, применённый к новой задаче, или идеи из двух областей, сведённые вместе. Верен ли результат, нов ли и полезен, можно проверить, не зная, кем или чем он получен.

«Всё это может оказаться неверным». Что-то, может, и окажется. Но в том, что мы уже проверили, мы не нашли ни одной научной ошибки, которая перечёркивала бы результат. И мы выложили всё, так что каждый может проверить сам.

«Я принципиально не пользуюсь такими инструментами». Это законный выбор. Но другие в вашей области будут ими пользоваться, и при найме, распределении финансирования и повышении вас будут сравнивать с ними.

Когда какое-нибудь исследование показывает, что ИИ чего-то не умеет, посмотрите, какую модель проверяли и когда. Модели раз за разом преодолевали такие ограничения за считаные месяцы, и эта тенденция уже измерена [6]. Если сегодня ваши результаты лучше, чем у моделей, это говорит лишь о сегодняшних моделях, а модели продолжают совершенствоваться.

Для энтузиастов

«Заниматься наукой стало проще. С новейшими моделями и достаточными вычислительными ресурсами результаты может получать кто угодно». Вполне может быть, но тогда возникают вопросы, на которые у нас нет ответа. Если результаты зависят только от модели и бюджета, исследователь не нужен. Любой, кому небезразлична задача, может просто оплатить вычисления, а компания-разработчик получает новейшие модели первой и платит за вычисления меньше всех. И если результаты определяются бюджетом, то кто сможет заниматься наукой, в чём должен состоять вклад человека и чего он стоит?

«Тогда я буду рецензентом». Это тоже ненадёжная роль. Мы не успевали проверять. Все известные нам ошибки в наших материалах агенты нашли и исправили до того, как кто-то из нас на них посмотрел; заметили бы мы их сами, сказать не можем. Поручить агентам массовое рецензирование так же просто, как получение результатов. И никто не выбирает научную карьеру, чтобы подписывать то, что сделала машина. Система, построенная на подписи человека, заполнилась бы рецензиями, за которыми не стоит никакой настоящей проверки.

Так в чём же всё-таки роль исследователя? За что человеку будут платить, если то же самое можно получить напрямую от модели? Хорошего ответа у нас нет.

Вопросы и наша позиция

Мы предпочитаем занять позицию и ошибиться, а не только задавать вопросы. Вот что мы думаем сейчас.

  • Как доверять результатам, если дефицитом стала проверка, а не их получение? Опираться на измерения. Где только возможно, давайте представлять результаты в виде, пригодном для автоматической проверки, и создавать машинно проверенные библиотеки установленных результатов во всех областях с математическими рассуждениями — в физике, химии, инженерии, а не только в самой математике. Пусть эксперты проверяют выборку из того, что одобрили агенты-рецензенты; давайте публиковать, как часто те пропускают ошибки, и принимать результаты процесса, который отвечает стандартам области.

  • Какие результаты должен понимать человек? Давайте решать это осознанно — исходя из того, что стоит на кону, и из измеренной частоты ошибок, — и пересматривать решение с каждой новой моделью.

  • Что считать новым, если агенты не могут прочитать значительную часть литературы, закрытую платным доступом? Давайте откроем литературу. Работы, которые подаются как общее знание, должен иметь возможность прочитать любой, кто занимается исследованиями, — человек или ИИ.

  • Какой должна стать научная публикация? Давайте публиковать утверждения вместе со статусом проверки (проверено машиной, рецензировано агентами, прошло выборочный аудит или проверено человеком) и со ссылками на сами проверки.

  • Что значат научные заслуги и число статей, если вклад человека — это промпт? Давайте перестанем считать статьи. Давайте оценивать результаты по тому, верны ли они, новы ли, полезны ли и проверены ли, и не наказывать людей за честный рассказ о том, как они получены. Запреты на использование ИИ невозможно соблюсти на практике; они лишь загоняют его в тень. Нынешние правила признания заслуг уже втихую нарушаются, и мы считаем, что лучше отказаться от них открыто — тогда можно будет обсудить, чем их заменить.

  • Зачем тогда платить исследователю? Меньше — за получение результатов, больше — за их понимание, проверку и выбор, куда двигаться дальше. Спрос на исследователей может даже вырасти благодаря эффекту, известному как парадокс Джевонса: когда ресурс дешевеет, его могут начать использовать больше. В XIX веке экономист Уильям Стэнли Джевонс заметил, что, когда паровые машины стали расходовать уголь экономнее, общее потребление угля выросло: дешёвая энергия сделала выгодными новые применения [7]. Точно так же дешёвые результаты могут сделать осмысленными гораздо больше вопросов и направлений, а люди понадобятся, чтобы выбирать между ними, направлять агентов и находить результатам применение.

  • Станет ли лучшим исследователем тот, у кого больше бюджет? Результаты будут всё сильнее зависеть от того, сколько вычислений может оплатить исследователь, и, по-нашему, этого не избежать. Давайте открыто решим, что с этим делать, а не будем плыть по течению: должны ли научные организации давать доступ к вычислениям как к общему ресурсу — так же, как к библиотекам и лабораториям, — и может ли оценка работы отделить вклад человека от вклада его бюджета.

  • Как осваивать область, в которой машины уже способны вести исследования? Давайте учить больше, а не меньше, но по-другому. Нужно учить пониманию и умению здраво оценивать, а не натаскивать студентов на навыки, которые им теперь достаточно понимать. Подготовку молодых исследователей нужно финансировать целенаправленно. При фиксированном бюджете один опытный исследователь с вычислительными ресурсами даёт больше, чем группа студентов; если область станет финансировать науку по такому принципу, через поколение опытных исследователей в ней не останется.

  • Что будет, когда агентам начнут поручать целые области науки? Это случится. Разработчики моделей, фонды и правительства могут себе это позволить, и остановить всех остальных не получится ни у кого. Мы считаем, что делать это нужно открыто и финансировать проверку наравне с получением результатов. Если поручить агентам целую область, у неё заодно появится точка отсчёта: что агенты умеют сами. То, что люди добавят сверх этого, и есть вклад человека.

  • Как сохранить контроль над исследованиями, за которыми мы не успеваем? Мы ожидаем, что в некоторых областях агенты далеко обгонят людей — вероятно, сначала в математике. Успевать за ними — нереалистичная цель; сохранять контроль — реалистичная. Это значит, что цели ставим мы и мы же можем остановить агентов, что в каждой области достаточно людей, способных провести аудит, и что там, где даже верный результат может навредить, есть ограничения.

Где у нас нет хороших ответов

Два из этих ответов слабее, чем нам хотелось бы.

Мы выступаем за то, чтобы людей в науке было больше, а не меньше. Мы можем объяснить, зачем они нужны области. Но пока не можем сказать, чем они будут заниматься. Аудит, выбор направления и отслеживание результатов — вот роли, которые мы можем назвать сегодня, но по мере развития моделей агенты могут взять на себя каждую из них.

А идея точки отсчёта предполагает, что люди в состоянии за ней следить. Если агенты за месяц производят больше, чем вся область успевает прочитать за год, люди могут перестать понимать даже то, что уже известно, не говоря уже о том, чтобы что-то добавить. Мы не знаем, в чём тогда будет состоять вклад человека и как его измерить. Мы считаем это одним из самых важных вопросов — и ставим его, не имея ответа.

Научная система не готова

Рецензирование, подсчёт статей, найм, повышение, финансирование и подготовка аспирантов создавались для мира, где результат получают долго, а автор читал собственную работу. Этого мира больше нет. Мы считаем, что наша научная система и стимулы, которые она создаёт, не готовы к тому, что модели умеют уже сейчас, не говоря о том, что будет дальше. Лучший момент, чтобы начать её менять, был вчера. Следующий лучший момент — сейчас.

Научная система меняется годами, а модели — за месяцы. Учебная программа или правила рецензирования, рассчитанные на сегодняшние модели, вступят в силу, когда эти модели уже сменятся, а потом сменятся и их преемники. Поэтому такие правила нужно рассчитывать на постоянно растущие возможности, а не на одно конкретное поколение моделей. Научным организациям также стоит заранее решить, как они поступят, когда рецензирование агентами окажется таким же надёжным, как экспертное, когда агенты обгонят людей в их области или когда автоматизированные лаборатории сделают эксперименты дешёвыми. Некоторые разработчики ИИ уже берут на себя такие обязательства в отношении своих моделей, привязывая необходимые меры безопасности к измеренным возможностям [8]. Научные организации должны сделать то же самое.

Некоторые шаги уже сделаны. Более двух десятков лауреатов Филдсовской премии — высшей награды в математике — подписали декларацию: в ней говорится, что стремление ИИ-компаний решать математические задачи как бенчмарки вредит математике, и звучит призыв срочно заняться этой проблемой [9]. OpenAI создала независимую консультативную группу математиков, которая будет советовать компании, как оценивать новые результаты и как о них рассказывать [4]. Мы приветствуем оба шага как начало и разделяем опасение, что поспешно объявленные результаты могут опережать их понимание. Но само по себе применение ИИ к знаменитым задачам мы вредом не считаем. Теперь направить ИИ на знаменитую задачу может кто угодно, так что такие попытки будут, одобряет их кто-то или нет; важно, как мы к ним подготовимся. К тому же оба шага касаются только математики и ИИ-компаний. Мы же работали в оптимизации, термодинамике, явлениях переноса и катализе — на моделях, доступных каждому. Те же вопросы встают везде, где агенты получают результаты быстрее, чем люди успевают их проверять, а это уже далеко не только математика.

Что делать сейчас

  1. Проведите такой эксперимент в своей области. Примеры наших промптов есть в научной статье. Используйте лучшие модели, доступные на момент чтения. Если хотите сравнить результаты с нашими, не делитесь с агентами собственными идеями.

  2. Расскажите, что получилось: что вы просили, что получили, что проверили и что нет.

  3. Сравнивайте результаты с тенденцией, а не только с сегодняшними моделями. Если агенты не справились, сообщите и об этом, указав модель и дату, и повторяйте эксперимент с выходом новых моделей. Возможности неравномерны: одни и те же агенты могут провалиться на одной задаче и блестяще справиться со следующей. Показательнее всего сравнение с тем, что агенты умели полгода или год назад. Продлите эту тенденцию на несколько лет вперёд и спросите себя, что вашей области нужно делать уже сейчас.

  4. Начинайте готовиться уже сейчас. Не ждите, пока ИИ возьмёт ещё более высокую планку — например, начнёт получать результаты лучше, чем кто-либо из людей. Обсудите с коллегами, студентами, руководством и фондами, что должно измениться в вашей области: как проверять результаты и признавать заслуги, как готовить студентов и зачем вообще нужны исследователи. Готовьтесь к постоянному росту возможностей, а не только к сегодняшним моделям.

Чем раньше о своём опыте расскажут многие, тем раньше этот разговор будет опираться на факты, а не на мнения. Но с подготовкой нельзя ждать этих фактов: её следовало начать ещё вчера, так что начинать нужно прямо сейчас.

Что сделали агенты

Эти таблицы повторяют перечень результатов из научной статьи, сгруппированный по областям. Каждая строка — группа связанных результатов, из которых могла бы получиться одна статья, написана она или нет. Вклад описан так, как его заявляют сами агенты в своих текстах и заметках; мы проверили не всё. Мы не включили результаты, которые агенты сами пометили как устаревшие, опровергнутые или отозванные, слишком мелкие для отдельной статьи результаты, а также группы, главный результат которых, по собственной проверке литературы агентами, оказался уже известен. В катализе агенты предложили программы экспериментов, но ни один из этих экспериментов пока не проведён.

Ссылки в столбце «Текст» ведут на черновики в коммите 84c6be7 (метка paper-v1): это материалы агентов на 25 сентября 2026 года, до нашего научного участия; столбец «Lean» показывает состояние на ту же дату. В более поздних версиях репозитория могут появиться новые результаты и наш собственный научный вклад. У строк с пометкой «Только заметки» черновика нет; их ссылки ведут к заметкам агентов по соответствующей области на том же коммите.

Смешанно-целочисленное нелинейное программирование

Смешанно-целочисленное нелинейное программирование
ID Рабочее название и заявленный вклад Текст Lean
M1 Точные оценки разрывов положительных мультилинейных релаксаций. Опровергнута гипотеза Людтке–Намазифара–Линдерота; точный разрыв для выпуклой оболочки; наихудшее отношение растёт как \(\ln d/\ln\ln d\) по степени и как \(\ln n/\ln\ln n\) по размерности. Основано на [10]. Полная статья Доказано
M2 Проверенные оценки разрывов положительных кубических релаксаций. Получены нижняя и верхняя оценки наихудшего кубического отношения разрыва почленной релаксации к разрыву выпуклой оболочки: \(1610000/743033 \le R(3) \le 31/12\). Полная статья Доказано
M3 Проверяемые нижние оценки в выпуклой смешанно-целочисленной нелинейной оптимизации через рациональные внешние аппроксимации. Рациональные сертификаты дают независимо проверяемые нижние оценки; 203 из 289 моделей MINLPLib проходят отдельную повторную проверку; точные аудиты обнаруживают неверные доказательства, принятые внешним верификатором. Основано на [11]. Полная статья Доказано
M4 Разрывы выпуклых релаксаций и пространственные сертификаты в нелинейной оптимизации. Разрывы билинейных функций с коэффициентами разных знаков имеют порядок квадратного корня из плотности рёбер; экспоненциальное число сертифицированных областей для пространственного метода ветвей и границ при заданных оракулах узлов. Отрицательный ответ на вопрос Альтшулера и Бойкса-Адсеры при предположении P\({}\neq{}\)NP; контрпример к опубликованной теореме о P-split-формулировках. Также заново изложены результаты M1 и M2 о положительных мультилинейных и кубических разрывах. Полная статья Частично
M5 Целочисленная размерность выпуклой смешанно-целочисленной аппроксимации нелинейных графиков. Для фиксированной квадратичной системы на параллелепипеде минимальное число целочисленных или бинарных переменных в выпуклом расширенном представлении с точностью \(\varepsilon\) равно \(\frac{1}{2}\,\mathrm{ncrank}\cdot\log_2(1/\varepsilon)+O(1)\), где ncrank — некоммутативный ранг пространства гессианов; рациональные построения за полиномиальное время. Основано на [12], [13]. Полная статья Частично
M6 Округление переключаемых управлений при жёстком ограничении числа переключений: точные минимаксные оценки и алгоритмы. Точная минимаксная ошибка округления для не более чем трёх переключений; опровергнута гипотеза Загера и Цайле и исправлена опубликованная нижняя оценка; точные значения и алгоритмы на конечных сетках. Полная статья Частично
M7 Разреженные выпуклые оболочки сетевых потоков, связанных с симплексом. Точная формулировка использует одну дополнительную координату на каждый независимый цикл каждого ненаблюдаемого подграфа «блок–метка»; экспоненциальный рост коэффициентов на последовательно-параллельных графах. Полная статья Частично
M8 Топология, неопределённость и точность в оптимизации пассивных потенциальных потоков. Полиномиальная аддитивная оптимизация разностей потенциалов при фиксированном циклическом ранге блоков, для сбалансированных диапазонов заявок и независимых интервалов коэффициентов; точное сравнение давлений на кактусовых графах с одним источником и одним стоком эквивалентно задаче о сумме квадратных корней. Полная статья Частично
M9 Сложность задачи смешения: алгебраические барьеры и структурные алгоритмы. Пороговая задача смешения \(\exists\mathbb{R}\)-полна; сильно NP-полна, когда все степени по слоям равны двум, и NP-полна при двух смесителях и двух продуктах, что отвечает на вопросы Боланд с соавторами и Хёугланна; разрешена гипотеза о стоимости ранга один; совпадающие границы вычислительной разрешимости. Основано на [14], [15], [16]. Полная статья Неприменимо
M10 Точная допустимость резистивных сетей и сетей переменного тока. Допустимость резистивного потока мощности \(\exists\mathbb{R}\)-полна даже на планарных сетях степени три с единичными проводимостями; трудность переносится на сети переменного тока с резистивными линиями. Связанные работы: [17], [18]. Полная статья Неприменимо
M11 Структурированная двухуровневая оптимизация с большим числом переменных последователя: глобальные отклики, точность и структурные границы. Описание фиксированной размерности всех глобальных откликов последователя даёт точные полиномиальные алгоритмы; рациональные решения лидера с ошибкой \(2^{-B}\) для строго выпуклых затрат; трудность при плотных гессианах, близких к единичной матрице. Полная статья Возможно
M12 Глобально сертифицированный выбор измерений с коррелированными ошибками. Полиномиальные аппроксимационные множества в относительном порядке положительной полуопределённости, схема аппроксимации взвешенного следа и рациональные сертификаты логарифма определителя для выбора коррелированных измерений. Полная статья Частично
M13 Радиальная и точечная сепарация для внешней аппроксимации выпуклых обобщённых дизъюнктивных программ с помощью перспективных преобразований. Сравнение двух стратегий сепарации в одинаковых условиях: радиальный поиск даёт умеренный выигрыш, зависящий от реализации; нового семейства отсечений нет. Полная статья Неприменимо
M14 Квадратичная агрегация: сертификаты, конечные описания и аппроксимация. Разрешены три гипотезы Блехермана–Дея–Суна: при скрытой гиперплоскостной выпуклости оболочка является собственным подмножеством пространства тогда и только тогда, когда существует непостоянная выпуклая агрегация; оболочке трёх неравенств требуется несчётное число агрегаций; четырёх агрегаций достаточно для трёх строгих квадратичных неравенств с положительно определённой комбинацией, что расширяет оценку Блехермана–Данбара, и эта оценка точна. Основано на [19]. Полная статья Частично
M15 Точные выпуклые оболочки для обратного множителя, общего для многих переменных. Явная оболочка \((X,1/X,Y_i,XY_i)\) для большого числа листьев с точной рациональной сепарацией и разложением; расширение на целочисленный множитель с диапазоном, заданным в двоичной записи, с сепарацией за время, полиномиальное по длине записи. Только заметки Доказано
M16 Некорректно поставленные задачи сетей теплообменников в MINLPLib. Модели heatexch_gen содержат общий неограниченный член со среднелогарифмической разностью температур и защитными условиями; для heatexch_gen1 численно допустимая точка улучшает указанное значение примерно на 30 %, а численные оценки указывают, что инфимум не достигается. Только заметки Неприменимо
M17 Выпуклые оболочки мономов двух переменных с вещественными показателями на клине. Оболочка ограниченного монома на клине расширена с положительных показателей на отрицательные и разноимённые, включая отношения переменных; решён открытый случай Белотти с двумя отрицательными показателями. Основано на [20]. Только заметки Возможно
M18 Точная квадратичная оптимизация с индикаторами при малой древесной ширине. NP-трудность при ширине ленты два и гессианах, сколь угодно близких к единичной матрице; при случайно возмущённых штрафах за индикаторы — точные алгоритмы с полиномиальным ожидаемым временем в битовых операциях при фиксированной древесной ширине. Только заметки Неприменимо
M19 Выпуклые оболочки функций одной переменной от линейной формы. Для любой полунепрерывной снизу \(\sigma\) выпуклая оболочка \(\sigma(a^\top x+b)\) на параллелепипеде равна минимуму по распределениям, лежащим ниже комонотонного ступенчатого распределения в выпуклом порядке, и, двойственным образом, супремуму по вогнутым минорантам, каждая из которых даёт отсечения, допустимые на всём параллелепипеде; расширения на произведения симплексов и порядковые многогранники с ограничениями знаков. Основано на [21]. Только заметки Возможно
M20 Теория сжатия итерационного уточнения границ на основе оптимальности. Вблизи точки минимума итерационное уточнение границ описывается монотонным положительно однородным отображением форм параллелепипедов, чья константа типа Коллатца–Виландта ограничивает локальную линейную скорость; сертификат остановки уточнения; точная скорость \((\sqrt{2a^2+4a}-a)/2\) одновременных раундов для \(x^2+y^2+axy\), \(0<a<2\), с релаксациями Маккормика; условие, при котором уточнение ничего не меняет даже для сильно выпуклых целевых функций. Основано на [22]. Только заметки Возможно
M21 Совместная релаксация нескольких нелинейных слагаемых одной переменной. Автоматическая сертифицированная обработка в решателе: сертифицированная кривизна и отсечения оболочки, допустимые при любом наклоне, позволяют решить все 24 разделимые тестовые задачи четвёртой степени, из которых стандартные SCIP, Gurobi и BARON решают 2, 3 и 6; сертифицированный сепаратор оболочек кривых \((t,f_1(t),\dots,f_k(t))\). Сама теория оболочки уже известна. Основано на [23]. Только заметки Неприменимо
M22 Разделимые вогнутые слагаемые на небольшом числе линейных строк. Бинарная переформулировка, допускающая не более \(\mathrm{rank}(A)\) переменных строго внутри вогнутых участков, решается за \(2n+1\) узлов метода ветвей и отсечений на семействе, где пространственному методу ветвей и границ нужно экспоненциальное число узлов (M4); совместная оболочка вогнутых слагаемых на одной строке, которая при равных ширинах совпадает с многогранником потоковых покрытий Падберга–Ван Роя–Вулси в других переменных, расширена на строки-неравенства и индикаторы с вогнутыми затратами. Основано на [24]. Только заметки Возможно

Квантовые методы внутренней точки

Квантовые методы внутренней точки
ID Рабочее название и заявленный вклад Текст Lean
Q1 Подуровни целевой функции и обусловленность гессиана на центральной траектории. Для любого самосогласованного барьера обусловленность равна \(\Theta((\mathrm{diam}\,L(g)/g)^2)\); спектры линейных программ имеют два масштаба. Полная статья Частично
Q2 Стоимость движения по центральной траектории. Точная оценка дополнительных затрат на движение по центральной траектории \(\Gamma_r=\Theta(\sqrt{\log r})\) для целевых функций ранга \(r\); в явной разреженной линейной программе для завершения прямодвойственного процесса требуется \(\Theta(r^{3/2})\) ограниченных шагов. Основано на [25]. Полная статья Частично
Q3 Модели доступа и масса правой части при решении систем Ньютона. Гессианы вырожденных линейных программ имеют два кластера собственных значений, с которыми метод сопряжённых градиентов справляется за полилогарифмическое число итераций, тогда как простой блочный доступ сохраняет известную стоимость \(\tilde\Theta(\kappa)\); связь правой части с малыми собственными значениями определяет, когда помогает фильтрация. Сводный документ Частично
Q4 Конденсация по принципу «победитель получает всё» в блочных полуопределённых программах с логарифмом определителя. Масса победителя определяет обусловленность; точные оценки запросов значения голономии: \(\Theta(N\sqrt{G})\) квантовых против \(\Theta(NG)\) рандомизированных. Сводный документ Возможно
Q5 Кривые точности для преобразования состояний со скрытыми блоками. Точные кривые зависимости числа запросов от точности при преобразовании квантовых состояний на доказанных областях; заметки расширяют нижнюю оценку на любой внутренний предикат — открытый вопрос сводного документа — и дают точную ошибку без запросов в оставленном им открытым диапазоне. Сводный документ Неприменимо
Q6 Линейные программы с единичной обусловленностью и трудными загрузкой и восстановлением. Разреженным линейным программам с приведёнными системами Ньютона, имеющими число обусловленности один, всё равно требуется линейное число запросов для загрузки и восстановления состояний. Сводный документ Неприменимо
Q7 Ограничения построений нижних оценок с помощью конструкций чётности. Алгебраические тождества исключают естественные классы построений нижних оценок с помощью конструкций чётности; заметки исключают ограниченные локальные усилители чётности для полной системы ККТ — открытый вопрос сводного документа. Сводный документ Частично
Q8 Трудность загрузки и восстановления в полуопределённых программах. Полуопределённые программы, нормированные по следу и имеющие шаги Ньютона с единичной обусловленностью, всё равно обладают значениями и состояниями решений, трудными как задача чётности; заметки дают существенно неабелеву трудность слов в \(\Theta(N)\) с переносом на разреженную полуопределённую программу — открытый вопрос сводного документа. Сводный документ Неприменимо
Q9 Компромиссы между предобусловливанием и интерфейсами состояний. Улучшение числа обусловленности после предобусловливания оплачивается нормировкой, чувствительностью восстановления или подготовкой состояния. Сводный документ Частично
Q10 Условные ускорения разреженных квантовых методов внутренней точки. Условный выигрыш на шаг за счёт сертифицированного обновления, восстановления граней, сжатого двойственного вывода и блочно-угловых окаймлений. Сводный документ Частично
Q11 Исправление анализа сложности квантового метода центральной траектории. И заявленная оценка нормы симулятора, и анализ часов в arXiv:2311.03977v2 неверны; исправлен компромисс между нормой и скоростью. Авторы сообщили нам, что уже знали как минимум об одной ошибке и готовят исправленную версию; на момент работы агентов публичного исправления не было. Сводный документ Доказано
Q12 Кривизна, опорные сертификаты и барьерная сложность конических расширенных представлений. Точное расширенное представление через определимые конусы тела со строго искривлённым участком границы требует \(\sum_i\max(\dim K_i-2,0)\ge s-1\); наименьший ранг опорного сертификата шара размерности \(s\) равен в точности \(\lceil (s-1)/B\rceil\); точные параметры барьера для балансных сечений симметричных конусов. Также: задачи на произведениях дисков, центральные состояния которых требуют \(O(1)\) запросов, а скалярное считывание — \(\Theta(N)\); при согласованных оракулах в центре слоя упаковка в положительно полуопределённые матрицы не даёт преимущества по запросам при решении приведённых систем Ньютона; компиляция разреженных ограничений конуса второго порядка в параметр барьера не более \(k+1\), с \(\Theta(\sqrt{Nk})\) квантовых запросов против \(\Theta(N)\) рандомизированных. Полная статья Возможно
Q13 Классическая и квантовая сложность запросов для скалярных величин Ньютона. Относительное оценивание \(b^*H^{-1}b\) с \(\kappa\varepsilon^{-2}(d+1)^{O(\sqrt\kappa\log(2/\varepsilon))}\) классических запросов и нижняя оценка, совпадающая с известным алгоритмом блочного доступа \(\tilde O(\alpha\kappa/\varepsilon)\) с точностью до логарифмических множителей на матрицах \(3\times3\); выборка шагов Ньютона через статистические запросы; разреженная программа с одним конусом второго порядка: \(O(1)\) квантовых запросов против \(\tilde\Omega(N^{1-1/k})\) классических статистических. Полная статья Неприменимо
Q14 Квантовая стоимость спектрального сдвига с единичной нормировкой. Ответ на открытый вопрос сводного документа: точная ступенчатая зависимость числа запросов \(\Theta(\delta^{-1+1/(2\ell)})\) для блочных кодировок \(I-H\) с единичной нормировкой и \(\Theta(\delta^{-1}\log(1/K))\) при высокой точности; разреженная линейная программа разделяет доступ к нормальной матрице и доступ к её фактору. Полная статья Неприменимо
Q15 Сжатие сценариев с помощью экспоненциальных конусов для энтропийного риска. \(N\) сценариев сжимаются в \(O(1+K+\log)\) экспоненциальных конусов независимо от \(N\), с сертифицированными оценками значения; совпадающие оценки \(\Theta(e^K/\varepsilon)\) квантовых и \(\Theta(e^{2K}/\varepsilon^2)\) классических запросов к источнику при указанной модели доступа. Только заметки Неприменимо

Молекулярная термодинамика

Молекулярная термодинамика
ID Рабочее название и заявленный вклад Текст Lean
TD1 Конечные резервуары при сосуществовании фаз: точность полного состояния и межфазные корреляции. Условия, при которых конечные термостаты воспроизводят канонические распределения; порог \(N^{3/2}\) для исследованных двухфазных систем при указанных условиях на хвосты фазовых распределений; общий термостат промежуточного размера переводит две копии в противоположные фазы, хотя каждая копия по отдельности остаётся канонической. Основано на [26]. Полная статья Неприменимо
TD2 Термодинамическое интегрирование при условии выживания. Интегрирование сил по траекториям, выжившим к конечной точке, зависит от пути, с ошибкой второго порядка при слабом уничтожении; для выживания во внутренних точках существует точный потенциал. Только заметки Возможно
TD3 Межфазное натяжение из объёмного отклика в нелокальных моделях двойной параболы. Точные сертификаты натяжения по объёмному отклику; совпадение моментов до четвёртого порядка не определяет натяжение. Только заметки Неприменимо
TD4 Сертификаты ёмкости для обратимой кинетики нуклеации. Нижние оценки ёмкости из условного переноса; парные оценки отклика скорости нуклеации при конечном поле. Только заметки Неприменимо

Явления переноса

Явления переноса
ID Рабочее название и заявленный вклад Текст Lean
TP1 Проектирование поверхностного переноса при неопределённой кинетике: пороги моментов и точность измерений. При малом бюджете поверхностной подвижности \(M\) оптимальное фиксированное размещение повышает порядок момента беспорядка, начиная с которого доминируют редкие сливающиеся дефекты, с \(4/3\) до \(8/5\); наблюдение дефектов улучшает среднее с \(M^{-1/4}\) до \(M^{-1/5}\), причём достаточно разрешения порядка \(M^{1/5}\). Основано на [27]. Полная статья Неприменимо
TP2 Кинетические дефекты в адсорбирующих каналах. Слабая поверхностная диффузия \(D_s\) при квадратичном кинетическом минимуме даёт расходимость дисперсии \(D_s^{-1/4}\) с явным переходом к положительному нижнему пределу скорости; когда положение минимума известно, оптимальное размещение бюджета подвижности \(M\) улучшает расходимость с \(M^{-1/4}\) до \(M^{-1/5}\) — это случай известного дефекта, лежащий в основе TP1; точно решаемый переход в размещении. Только заметки Неприменимо

Кинетика агрегации

Кинетика агрегации
ID Рабочее название и заявленный вклад Текст Lean
AK1 Разделение законов выборки и конечные нелинейные поправки в аддитивной коагуляции–фрагментации. Точные оценки разделения по числу и массе, конечная поправка к логарифму размера, нарушение приближения при конечной популяции, идентификация Фурье. Основано на [28]. Полная статья Неприменимо
AK2 Выживание при ненаблюдаемой зависимости типов сестринских потомков в многотипном ветвлении. Равномерные околокритические оценки ошибки вероятности вымирания по ненаблюдаемым совместным распределениям потомков, с точным оптимальным сопряжением и правилом для совпадающих репродуктивных ценностей; основные точные огибающие следуют из известных результатов о ветвлении и перестановках. Только заметки Возможно

Гетерогенный катализ: предложенные экспериментальные программы

Гетерогенный катализ: предложенные экспериментальные программы
ID Рабочее название и заявленный вклад Текст Lean
CA1 Физическое управление водой в синтезе Фишера–Тропша. Проверяется, защищает ли позднее добавление гидрофобного полимера предварительно обработанный кобальт; повторный анализ опубликованных данных даёт при добавлении полимера выход продукта примерно в 1,9 раза выше контрольного. Документ программы Неприменимо
CA2 Совместимость циклических оксидов с паром в процессах химического циклирования. Проверяется, меняют ли паровые продувки, предполагаемые опубликованной моделью процесса, но не проверенные экспериментально, выход этилена на LSF с покрытием; сравнивается подача CO\(_2\) вместе с паром для защиты и после него для восстановления. Документ программы Неприменимо
CA3 Потребность в катализаторе при этенолизе полимеров. Проверяется, может ли снижение давления этилена заменить часть свежего катализатора Na/оксид алюминия при превращении полиэтилена в пропилен с повторно используемым катализатором. Документ программы Неприменимо
CA4 Никель и срок службы промотированных серебряных катализаторов эпоксидирования. Проверяется, повышает ли никель выход оксида этилена сверх того, что дают стратегии дозирования хлоридов; патент 1995 года уже сообщает об улучшении удержания активности. Документ программы Неприменимо
CA5 Координация и удержание вольфрама при превращении сахаров. Проверяется, связывает ли управляемая переменная закрепления или подачи продуктивную координацию сахара, потерю вольфрама и выход гликоля. Только заметки Неприменимо
CA6 Жидкофазное эпоксидирование на титановых цеолитах при высокой концентрации продуктов. Проверяется, предсказывает ли сеть реакций, откалиброванная по кинетике разбавленных систем, выход эпоксида и потерю пероксида при накоплении продуктов. Только заметки Неприменимо
CA7 Судьба кислорода и самоочистка при получении стирола на диоксиде циркония. Проверяется, позволяет ли путь удаления кислорода предсказать устойчивый выход стирола и стратегию подачи. Только заметки Неприменимо
CA8 Измерение кислотных центров и старение цеолитов. Проверяется, меняют ли повторные измерения с NH\(_3\) и водой гидротермальное старение H-CHA. Только заметки Неприменимо

Обозначения:

  • Текст. Полная статья: готовая свёрстанная рукопись. Сводный документ: часть большого документа с результатами по квантовым методам внутренней точки, который мы попросили подготовить вместо отдельных статей. Документ программы: глава документа, в котором ранжированы предложенные программы по катализу. Только заметки: результаты есть только в заметках и проверках агентов.

  • Lean. Доказано: основные математические результаты полностью доказаны в Lean, без пропущенных шагов; программы и эксперименты сюда не входят. Частично: в Lean доказана часть результатов, но не все. Возможно: пока не сделано, но основные утверждения — математические, и их можно было бы формализовать с существующими библиотеками; это оценка, а не проверка. Неприменимо: основные утверждения опираются на численные данные, эксперименты или модельные допущения либо требуют аппарата, которого в формальных библиотеках пока нет, — например, классов сложности, моделей квантовых запросов или предельных теорем для случайных процессов.

Литература

[1]
L. Alpöge and R. Furman, “More than two thirds of the zeta zeros are simple and on the critical line.” 2026. doi: 10.48550/arxiv.2608.13637.
[2]
OpenAI, “On the Navier–Stokes Millennium Prize Problem.” https://openai.com/index/navier-stokes-solution/, Sep. 08, 2026.
[3]
K. Duraisamy, “Navier–Stokes regularity, what does the computation cost.. And a cartoon on the state of affairs.” https://karthik-duraisamy.blogspot.com/2026/09/navier-stokes-regularity-what-does.html, Sep. 08, 2026.
[4]
OpenAI, “Advisory Group on Mathematics and Artificial Intelligence.” https://openai.com/index/advisory-group-on-mathematics-and-ai/, Sep. 21, 2026.
[5]
S. Gusev and D. E. Bernal Neira, “Agent-swarm-research: Notes, drafts, code, and formal proofs produced by AI agent swarms.” https://github.com/SECQUOIA/agent-swarm-research/tree/84c6be7aad17d085e5343e789885c1cbcbbd4e07, 2026.
[6]
T. Kwa et al., “Measuring AI Ability to Complete Long Software Tasks,” in Advances in neural information processing systems 38 (NeurIPS 2025), 2025. doi: 10.52202/085713-3086.
[7]
W. S. Jevons, The coal question: An inquiry concerning the progress of the nation, and the probable exhaustion of our coal-mines. London: Macmillan, 1865.
[8]
Anthropic, “Anthropic’s responsible scaling policy, version 3.4.” https://www.anthropic.com/responsible-scaling-policy, Jul. 08, 2026.
[9]
A. Avila et al., “A severe misalignment of AI in mathematics.” https://mathandai.org, Sep. 11, 2026.
[10]
J. Luedtke, M. Namazifar, and J. Linderoth, “Some results on the strength of relaxations of multilinear functions,” Mathematical Programming, vol. 136, no. 2, pp. 325–351, 2012, doi: 10.1007/s10107-012-0606-z.
[11]
K. Halbig, L. Hümbs, F. Rösel, L. Schewe, and D. Weninger, “Computing optimality certificates for convex mixed-integer nonlinear problems,” INFORMS Journal on Computing, vol. 36, no. 6, pp. 1579–1610, 2024, doi: 10.1287/ijoc.2022.0099.
[12]
M. Lubin, J. P. Vielma, and I. Zadik, “Mixed-integer convex representability,” Mathematics of Operations Research, vol. 47, no. 1, pp. 720–749, 2022, doi: 10.1287/moor.2021.1146.
[13]
B. Beach, R. Hildebrand, and J. Huchette, “Compact mixed-integer programming formulations in quadratic optimization,” Journal of Global Optimization, vol. 84, no. 4, pp. 869–912, 2022, doi: 10.1007/s10898-022-01184-6.
[14]
D. Haugland, “The computational complexity of the pooling problem,” Journal of Global Optimization, vol. 64, no. 2, pp. 199–215, 2016, doi: 10.1007/s10898-015-0335-y.
[15]
N. Boland, T. Kalinowski, and F. Rigterink, “A polynomially solvable case of the pooling problem,” Journal of Global Optimization, vol. 67, no. 3, pp. 621–630, 2017, doi: 10.1007/s10898-016-0432-6.
[16]
S. S. Dey, B. Kocuk, and A. Santana, “Convexifications of rank-one-based substructures in QCQPs and applications to the pooling problem,” Journal of Global Optimization, vol. 77, no. 2, pp. 227–272, 2020, doi: 10.1007/s10898-019-00844-4.
[17]
D. Bienstock and A. Verma, “Strong NP-hardness of AC power flows feasibility,” Operations Research Letters, vol. 47, no. 6, pp. 494–501, 2019, doi: 10.1016/j.orl.2019.08.009.
[18]
K. Lehmann, A. Grastien, and P. Van Hentenryck, “AC-feasibility on tree networks is NP-hard,” IEEE Transactions on Power Systems, vol. 31, no. 1, pp. 798–801, 2016, doi: 10.1109/TPWRS.2015.2407363.
[19]
G. Blekherman, S. S. Dey, and S. Sun, “Aggregations of quadratic inequalities and hidden hyperplane convexity,” SIAM Journal on Optimization, vol. 34, no. 1, pp. 98–126, 2024, doi: 10.1137/22M1528215.
[20]
P. Belotti, “Convex envelopes of bounded monomials on two-variable cones,” Mathematical Programming, vol. 211, no. 1–2, pp. 93–123, 2025, doi: 10.1007/s10107-025-02212-5.
[21]
T. Mao and R. Wang, “On aggregation sets and lower-convex sets,” Journal of Multivariate Analysis, vol. 138, pp. 170–181, 2015.
[22]
A. Caprara and M. Locatelli, “Global optimization problems and domain reduction strategies,” Mathematical Programming, vol. 125, no. 1, pp. 123–137, 2010, doi: 10.1007/s10107-008-0263-4.
[23]
M. Ballerstein, “Convex relaxations for mixed-integer nonlinear programs,” PhD thesis, ETH Zurich, 2013. doi: 10.3929/ethz-a-009959194.
[24]
M. W. Padberg, T. J. Van Roy, and L. A. Wolsey, “Valid linear inequalities for fixed charge problems,” Operations Research, vol. 33, no. 4, pp. 842–861, 1985, doi: 10.1287/opre.33.4.842.
[25]
Y. Nesterov and A. Nemirovski, “Primal central paths and Riemannian distances for convex sets,” Foundations of Computational Mathematics, vol. 8, no. 5, pp. 533–560, 2008, doi: 10.1007/s10208-007-9019-4.
[26]
A. Riera, C. Gogolin, and J. Eisert, “Thermalization in nature and on a quantum computer,” Physical Review Letters, vol. 108, no. 8, p. 080402, 2012, doi: 10.1103/PhysRevLett.108.080402.
[27]
G. Buttazzo and F. Maestre, “Optimal shape for elliptic problems with random perturbations,” Discrete and Continuous Dynamical Systems, vol. 31, no. 4, pp. 1115–1128, 2011, doi: 10.3934/dcds.2011.31.1115.
[28]
M. Escobedo, S. Mischler, and B. Perthame, “Gelation in coagulation and fragmentation models,” Communications in Mathematical Physics, vol. 231, no. 1, pp. 157–188, 2002, doi: 10.1007/s00220-002-0680-9.

Email

Use the contact form above.

Location

Purdue University
Forney Hall of Chemical Engineering, G027C
480 Stadium Mall Drive
West Lafayette, IN 47907-2100
USA