Модели мышления, основанные на искусственном интеллекте (ИИ), не так умны, как их принято считать. На самом деле, они полностью разрушаются, когда задачи становятся слишком сложными, выяснили исследователи из компании Apple.

Логические модели, такие как Claude от Meta, o3 от OpenAI и R1 от DeepSeek, представляют собой специализированные большие языковые модели (LLM), которые тратят больше времени и вычислительных мощностей на получение более точных ответов, чем их традиционные предшественники.

Однако новое исследование, результаты которого опубликованы на сайте Apple Machine Learning Research, нанесло серьезный удар по конкурентам компании. Модели мышления не просто не демонстрируют обобщенных рассуждений, говорят ученые в своем исследовании, их рассуждения разваливаются, когда задачи превышают критический порог.

«Благодаря обширным экспериментам с различными головоломками мы показали, что при определенных сложностях точность frontier LRM полностью снижается, - пишут ученые. - Более того, они демонстрируют противоречащий интуиции предел масштабирования: их логические усилия увеличиваются с усложнением задачи до определенного момента, а затем снижаются, несмотря на наличие адекватного бюджета токенов».

Lms растут и обучаются, усваивая обучающие данные из огромного количества результатов работы человека. Использование этих данных позволяет моделям генерировать вероятностные модели из своих нейронных сетей, передавая их дальше по запросу.

Логические модели - это попытка еще больше повысить точность ИИ, используя процесс, известный как «цепочка размышлений». Он работает, отслеживая закономерности в этих данных с помощью многоэтапных ответов, имитируя то, как люди могут использовать логику, чтобы прийти к выводу.

Это дает чат-ботам возможность переоценивать свои рассуждения, что позволяет им решать более сложные задачи с большей точностью. В процессе разработки модели излагают свою логику простым языком для каждого шага, который они предпринимают, чтобы за их действиями можно было легко наблюдать.

Однако, поскольку этот процесс основан на статистических догадках, а не на каком—либо реальном понимании, чат-боты имеют выраженную склонность к «галлюцинациям» - выдают ошибочные ответы, лгут, когда в их данных нет ответов, и раздают странные, а иногда и вредные советы пользователям.