Новое исследование выявило набор задач, с которыми большинство людей могут справиться с легкостью, но с которыми искусственный интеллект (ИИ) не справляется — считывание показаний аналоговых часов или определение дня, на который выпадает та или иная дата.

Искусственный интеллект может писать код, генерировать реалистичные изображения, создавать текст, похожий на человеческий, и даже сдавать экзамены (с разной степенью успеха), но он обычно неправильно интерпретирует положение стрелок на повседневных часах и не справляется с элементарными арифметическими действиями, необходимыми для определения календарных дат. Исследователи выявили эти неожиданные недостатки в презентации на Международной конференции по обучению репрезентации (ICLR) 2025 года. Они также опубликовали свои выводы  на сервере препринтов arXiv, поэтому они еще не прошли экспертную оценку.

Чтобы исследовать возможности искусственного интеллекта в области хронометража, исследователи загрузили пользовательский набор данных с изображениями часов и календаря в различные мультимодальные модели большого языка (MLLM), которые могут обрабатывать как визуальную, так и текстовую информацию. В исследовании использовались такие модели, как Llama 3.2-Vision от Meta, Sonnet от Anthropic Claude-3.5, Gemini 2.0 от Google и GPT-4o от OpenAI. И результаты оказались неудовлетворительными: модели более чем в половине случаев не могли определить правильное время по изображению часов или день недели для выборочной даты.

Однако у исследователей есть объяснение удивительно слабым способностям ИИ считывать время. «Ранние системы обучались на основе примеров с надписями. Считывание времени требует чего—то другого - пространственного мышления, - отметили ученые. - Модель должна распознавать перекрывающиеся стрелки, измерять углы и ориентироваться в различных рисунках, таких как римские цифры или стилизованные циферблаты. ИИ распознает, что «это часы», проще, чем на самом деле их считывает».

С датами оказалось не менее сложно. При решении задачи типа «Какой день будет 153-м в году?» процент провалов оказалсятаким же высоким: системы искусственного интеллекта правильно считывали часы только в 38,7% случаев, а календари - только в 26,3%.

Исследование также выявило проблему, с которой сталкивается искусственный интеллект, когда он обучается на основе ограниченных данных — в данном случае это сравнительно редкие явления, такие как високосные годы или неясные календарные расчеты.