Было бы величайшей ошибкой думать, что весь искусственный интеллект — это интеллект
Редакция «Оливы Пресс» запускает открытый эксперимент по сравнительному тестированию современных ИИ-моделей. Повод для этого достаточно простой: вокруг искусственного интеллекта сформировалось слишком много уверенных утверждений и слишком мало проверок.
Сегодня ИИ демонстрируют, продают, внедряют и обсуждают как состоявшуюся технологию. При этом за пределами презентаций остаётся главный вопрос — как именно эти системы ведут себя в реальных задачах, где требуется не воспроизведение, а мышление.
Эксперимент продлится десять дней. Каждый день в двадцать два часа будет публиковаться одна задача — от логических и образовательных до прикладных и провокационных. В тестировании участвуют три модели: GigaChat, ChatGPT и Gemini. Все они получают один и тот же запрос, без уточнений и дополнительных условий. Фиксируется первый ответ.
Разбор и результаты публикуются на следующий день в девять утра.
Важно, что это не закрытое редакционное исследование. Любой может воспроизвести тест у себя: задать тот же вопрос, в тех же условиях, и сравнить результат. Таким образом формируется не только редакционная, но и распределённая проверка — параллельный слой эксперимента, который позволяет увидеть, насколько ответы стабильны и воспроизводимы.
Мы сознательно вводим простую шкалу оценки: три балла — есть понимание и решение; два — ответ формально верный, но поверхностный или неполный; один — ошибка или имитация. Однако ключевой акцент делается не на правильности как таковой, а на уровне мышления, который стоит за ответом.
Этот эксперимент не про поиск «лучшей модели». Он про другое — про границу, за которой заканчивается интеллект и начинается его убедительная имитация.
И, возможно, про ещё более важную вещь: про необходимость возвращения ответственности человеку. Потому что чем убедительнее становится ИИ, тем опаснее становится желание ему верить без проверки.
Первый тест будет опубликован сегодня в двадцать два часа.
И именно с него начнётся не обсуждение искусственного интеллекта, а его проверка.