Проверка на память и логику: способен ли ИИ понимать химические законы, а не просто заучивать базу данных

Проверка на память и логику: способен ли ИИ понимать химические законы, а не просто заучивать базу данных

Ученые Института общей и неорганической химии им. Н.С. Курнакова РАН разработали SoluBench — бенчмарк для проверки способности больших языковых моделей решать практические задачи, связанные с растворимостью органических соединений. Он включает 9806 вопросов четырех типов, составленных на основе экспериментальных данных BigSolDB 2.0 и MixtureSolDB. С помощью SoluBench исследователи протестировали более 20 открытых и проприетарных языковых моделей. Результаты работы опубликованы в журнале Journal of Chemical Information and Modeling.

Растворимость — одно из важнейших свойств вещества. От нее зависит выбор растворителя в органическом синтезе, разработке лекарств и различных технологических процессах. Для ее прогнозирования применяют методы машинного обучения, но они обычно требуют специальных данных, программного обеспечения и навыков работы с такими системами.

Большие языковые модели (Large Language Models, LLM) проще в использовании: химик может задать вопрос обычным языком и получить прогноз. Однако было неясно, действительно ли LLM способны учитывать химические закономерности или лишь воспроизводят сведения, встречавшиеся им во время обучения.

Чтобы это проверить, исследователи создали SoluBench на основе задач, близких к практической химии. Моделям предлагалось определить, в каком из двух растворителей вещество растворяется лучше; выбрать лучший растворитель из нескольких; предсказать, как добавление второго растворителя повлияет на растворимость; а также сравнить растворимость двух разных соединений в одном растворителе.

При этом вопросы были составлены так, чтобы снизить вероятность простого воспроизведения запомненных данных. От LLM не требовали называть точные значения растворимости, а предлагали провести качественное сравнение. Молекулы в большинстве экспериментов задавались в виде SMILES-строк — текстовых записей их структуры.

Лучший результат показала Gemini 3 Flash. В задаче выбора лучшего из двух растворителей ее точность составила 90,6%, при выборе одного растворителя из нескольких — 66,2%, а при прогнозировании влияния второго растворителя — 86,4%.

Исследователи обнаружили, что точность моделей закономерно зависела от сложности задачи. Чем сильнее различалась растворимость в сравниваемых растворителях, тем чаще LLM отвечали правильно. При небольших различиях, когда требовалось учитывать более тонкие химические эффекты, качество ответов снижалось. Это плохо согласуется с предположением, что модели просто извлекают готовые ответы из памяти.

Дополнительная проверка показала высокую воспроизводимость результатов. Gemini 3 Flash пять раз предъявили первые 1000 заданий на выбор одного из двух растворителей. Точность во всех запусках составляла 90,5–91%, а в 98,2% случаев ответы совпадали во всех пяти попытках.

Затем ученые изменили способ записи молекул. Одно и то же соединение можно представить разными SMILES-строками, поэтому порядок записи атомов был изменен при сохранении исходной молекулярной структуры. Точность Gemini 3 Flash осталась прежней — 90,6%, а ответы для двух способов записи совпали в 96,5% случаев. Это указывает на то, что модель, по крайней мере в этой задаче, способна извлекать информацию о структуре молекулы, а не просто распознавать знакомую последовательность символов.

«SoluBench показывает, что современные передовые модели уже способны на качественном уровне оценивать растворимость соединений. Лучшая из протестированных моделей, Gemini 3 Flash, достигла точности 90,6%, 66,2% и 86,4% на первых трех задачах. При этом вопросы намеренно строились как качественные сравнения, а не как запрос точных числовых значений, а молекулы представлялись в виде SMILES-строк — это снижает риск того, что модель просто “вспоминает” данные из обучающего набора, а не рассуждает», — отметил один из авторов работы, младший научный сотрудник Лаборатории кристаллохимии и Центра цвета ИОНХ РАН Лев Краснов.

При этом исследование выявило и ограничения LLM. Модели хуже справлялись с крупными молекулами, полярными апротонными растворителями и особенно с задачей, где требовалось напрямую сравнить два разных соединения. Это показывает, что полноценный анализ сложной молекулярной структуры пока остается для языковых моделей трудной задачей.

Для дополнительной проверки ученые сравнили LLM со специализированной моделью машинного обучения LightGBM. В трех из четырех типов заданий лучшие языковые модели не уступали ей или показывали более высокую точность. Однако при непосредственном сравнении двух молекул преимущество осталось за специально обученной моделью.

В совокупности результаты указывают, что успех современных LLM в химических задачах нельзя объяснить только запоминанием отдельных фактов. Зависимость точности от сложности, устойчивость к изменению SMILES-записей и характер ошибок согласуются с тем, что модели в некоторой степени используют обобщенные химические закономерности. При этом полностью исключить влияние данных, которые могли присутствовать в их обучающих наборах, невозможно.

SoluBench позволит сравнивать новые поколения языковых моделей и отслеживать, насколько улучшается их способность работать с химическими задачами. Уже сейчас LLM могут применяться как вспомогательный инструмент для качественной оценки растворимости, однако сложные случаи по-прежнему требуют специализированных методов и дополнительной проверки.

Данные SoluBench и программный код опубликованы в открытом доступе и могут использоваться другими исследовательскими группами для тестирования и развития ИИ-моделей для химии.

Исследование выполнено сотрудниками Института общей и неорганической химии им. Н.С. Курнакова РАН Львом Красновым, Сергеем Татариным и Станиславом Беззубовым в рамках Программы фундаментальных научных исследований ИОНХ РАН.

Иллюстрация: общая схема исследования (Автор рисунка: Лев Краснов)

Источник: ИОНХ РАН

Розовая метка апокалипсиса: как донные отложения в озере раскрыли тайну падения метеорита 12,8 тысяч лет назад
Следующий пост не найден