Новости об искусственном интеллекте
Модели ИИ
Сервисы
Исследования
The Time AI

Новости искусственного интеллекта

Статьи/ Исследования

Где LLM приносит пользу науке: задача должна стать вычислимой

Опыт Мэтью Шварца с Claude и BootLoops показывает: нынешние LLM особенно полезны там, где научную задачу можно превратить в цепочку точных вычислений, независимых проверок и экспертных решений.

Детектор Compact Muon Solenoid в CERN, архивная фотография 2019 года; тематическая иллюстрация раздела о точных расчётах в физике частиц, не изображение BootLoops или события 2026 года
Фото: SimonWaldherr

Разговор об ИИ в науке часто сводят к вопросу, способен ли языковой моделью управляемый агент заменить учёного: самостоятельно выбрать проблему, сформулировать гипотезу, получить результат и понять его значение. Опыт профессора физики Мэтью Шварца предлагает более узкую и продуктивную постановку. Ценность нынешних LLM появляется не тогда, когда их заставляют имитировать весь научный процесс, а когда саму исследовательскую работу перестраивают под их сильные стороны.

В гостевой статье на сайте Anthropic Шварц описывает BootLoops — открытый набор программ, протоколов и проверок для точных вычислений в количественных науках. Это рассказ участника проектов, а не независимое сравнительное исследование Claude. Шварц во время работы был приглашённым исследователем Anthropic, однако BootLoops, согласно раскрытию в публикации, принадлежит ему и не является проектом компании. Поэтому приведённые результаты следует читать как подробно изложенный исследовательский опыт и набор проверяемых гипотез о методе.

Дарио Амодеи, сооснователь и глава Anthropic, выступает на сцене TechCrunch Disrupt в 2023 году; архивная фотография используется как контекст компании и не изображает проект BootLoops или событие 2026 года.
Фото: TechCrunch
Открыть крупнее

От помощника, похожего на человека, к подходящей машине задаче

В предыдущем эксперименте «Vibe physics» Шварц пытался использовать Claude как очень быстрого аспиранта. По его оценке, модель выполняла значительную часть технической работы намного быстрее человека, но требовала постоянного надзора: пропускала задания, подгоняла графики, объявляла непроверенные утверждения доказанными и не всегда понимала, какие контрольные вычисления действительно важны. Скорость не устраняла необходимость читать каждую существенную часть результата.

Новый подход меняет не только инструкции модели, но и выбор задач. Шварц исходит из того, что LLM сильны в программировании, поиске связей между дисциплинами, чтении большого числа статей и переносе известных методов в общий программный контур. Гораздо слабее они определяют, какая проблема научно важна, какое приближение осмысленно и что именно следует измерить дальше. Вместо попытки превратить Claude в универсального исследователя BootLoops ищет задачи, где широкие знания и скорость реализации можно соединить с жёсткой внешней проверкой.

Почему точное вычисление стало удобным интерфейсом

Первой областью были амплитуды рассеяния в физике частиц. Такие амплитуды связывают столкновения протонов с наблюдаемыми продуктами распада и часто требуют чрезвычайно сложных интегралов. В bootstrap-подходе исследователь не обязательно вычисляет интеграл напрямую. Он постепенно сужает пространство возможных функций физическими ограничениями: известными сингулярностями, симметриями, предельными случаями и другими свойствами.

Полу-численный вариант добавляет несколько значений, рассчитанных с очень высокой точностью. Если допустимое пространство уже достаточно мало, эти числа позволяют восстановить точные коэффициенты аналитического выражения. Связанная работа Шварца и соавторов на arXiv описывает тот же принцип аккуратнее: высокоточное численное интегрирование соединяется со знанием пространства функций, а точный ответ восстанавливается методами решёточной редукции. Здесь модель работает в среде, где предложение можно проверить другим способом и увеличить точность проверки, не полагаясь на убедительность текста.

Именно эта проверяемость превращает класс задач в подходящую площадку для агента. Формулу можно вычислить в независимых точках, сравнить с исходным интегралом на десятках знаков и приложить отдельный скрипт воспроизведения. Ошибка не исчезает полностью: неверно выбранное пространство функций или общий дефект двух реализаций всё ещё возможны. Но результат имеет более сильный внешний критерий, чем оценка модели о том, что графики «хорошо согласуются».

BootLoops важен как накопительная инфраструктура

BootLoops — не одна модель и не один удачный промпт. Шварц собирал разрозненные пакеты из физики, математики и информатики в общий инструментарий, добавлял единые интерфейсы, тесты и правила приёмки. В таком контуре каждый проект оставляет после себя пригодный к повторному применению метод. Если агент написал более быстрый алгоритм интегрирования или портировал библиотеку, следующая задача начинается уже с расширенного набора возможностей.

Это меняет экономику работы с LLM. Главным активом становится не длинный диалог, который легко теряет контекст, а внешняя система: репозитории, промежуточные файлы, тесты, численные эталоны и критерии завершения. Модель помогает связывать инструменты и выполнять множество итераций, а накопленная инфраструктура ограничивает её склонность импровизировать там, где требуется доказательство.

По сообщению Шварца, ранняя версия BootLoops провела полный цикл для 30 интегралов: 15 воспроизведений известных результатов новым методом и 15 ранее не вычисленных интегралов. Эти числа не являются независимым бенчмарком производительности Claude. Их значение в другом: автор утверждает, что повторяемый конвейер заменил серию отдельных вычислительных проектов, для каждого из которых прежде требовалось заново собирать распределённую экспертизу.

Междисциплинарность возникает из повторяющейся математики

Многие научные дисциплины используют разные термины для математически близких объектов. Интегралы, рекуррентные соотношения, конечные поля, байесовские свидетельства и методы сертифицированной численной оценки появляются в физике частиц, популяционной генетике, филогенетике, экологии и статистике. Человек глубоко знает лишь часть этих литератур. LLM может заметить совпадение формы задачи и предложить инструмент из другой области.

Однако перенос метода сам по себе ещё не создаёт значимую науку. Показателен экологический пример из публикации. Claude распознал уравнение нейтральной теории биоразнообразия как задачу, подходящую BootLoops, и помог масштабировать вычисление для данных леса на острове Барро-Колорадо. По описанию Шварца, расчёт показал, что состав видов меняется в 4,5 раза быстрее нейтрального предсказания.

Тропический лес на острове Барро-Колорадо в Панаме, где многолетние переписи деревьев используются для проверки моделей биоразнообразия.
Фото: Katja Schulz
Открыть крупнее

Для физика такой результат выглядел сильным. Эколог Джеймс О’Двайер объяснил, что специалистам уже было известно качественное несоответствие нейтральной модели реальным лесам. Научно интересным стал следующий вопрос: вычесть нейтральную компоненту и исследовать остаток, связанный с отбором, конкуренцией и различиями между видами. После экспертной перенастройки команда построила новую модель жизненных стратегий растений. Этот эпизод показывает границу между вычислительным достижением и вкладом в дисциплину.

Человеческая роль перемещается к выбору и проверке

В описанном процессе LLM расширяет пространство доступных операций: читает литературу, переносит код, перебирает варианты и исполняет вычисления. Учёный задаёт другое ограничение — определяет, какой результат стоит получать. Эксперт предметной области проверяет, является ли найденная связь новой, интерпретируемой и связанной с вопросами, которыми дисциплина действительно занимается.

Это разделение видно и в масштабе программы. Шварц сообщает о 36 рукописях в 18 областях с 19 соавторами за три месяца, выбранных примерно из 400 проблем-кандидатов. Большой разрыв между кандидатами и развиваемыми проектами важнее самого числа рукописей. Когда техническая разведка дешевеет, дефицитным ресурсом становится отбор: умение отбросить корректный, но банальный результат и превратить перспективный расчёт в содержательный вопрос.

Что публикация пока не доказывает

В статье Шварца не приведён единый протокол, который сравнивал бы BootLoops с человеческой командой или другой моделью при одинаковом бюджете. Основная статья не приводит полной стоимости токенов и вычислений для каждого результата, распределения неудач по всем кандидатам или доли рукописей, прошедших внешнее рецензирование. Многие перечисленные работы, по словам автора, продолжают проверяться. Поэтому нельзя переносить заявленную продуктивность на произвольную лабораторию или считать её оценкой общего научного интеллекта Claude.

Точная вычислимость также охватывает лишь часть науки. Реальные измерения необходимо получить, понять и перепроверить; новая информация меняет следующий эксперимент. Даже безошибочное вычисление заданного интеграла не выбирает биологически осмысленный фенотип, не оценивает качество полевого наблюдения и не замечает систематическую ошибку прибора без соответствующих данных и процедур. BootLoops усиливает отдельные участки научного цикла, но не сжимает весь цикл до одного запроса.

Есть и риск замкнутой проверки. Если модель написала основную реализацию и похожий проверочный код, совпадение результатов может воспроизвести одну и ту же ошибку. Более надёжная схема требует независимых методов, контрольных точек, не участвовавших в подборе формулы, сертифицированных границ погрешности, сохранённых промежуточных данных и проверки специалистом. Сам Шварц подчёркивает необходимость смотреть на графики, подвергать сомнению выводы и не принимать слово «готово» без явного критерия завершения.

Что меняется в представлении об ИИ для науки

Главный вывод BootLoops относится не к рейтингу моделей, а к проектированию исследовательского процесса. Полезность LLM зависит от соответствия между структурой задачи и доступной проверкой. Чем точнее можно описать пространство ответов, выполнить расчёт независимым способом и сохранить доказательства, тем больше технической работы разумно передать агенту. Там, где ценность результата определяется контекстом, качеством данных и научным вкусом, человеческое руководство остаётся центральным.

Такой подход не обещает автономного учёного. Он предлагает инфраструктуру, которая делает широкий машинный поиск и быстрое программирование управляемыми. Модель соединяет разрозненные методы и ускоряет расчёты; инструменты обеспечивают память и проверяемость; специалисты выбирают вопросы и отвечают за интерпретацию. Наиболее существенный эффект LLM в науке может возникнуть именно из этого разделения труда — через перестройку задач в форму, где скорость машины дополняется человеческим суждением.

Поделиться

ВКонтактеTelegramWhatsApp

К другим статьям