Новости

Умнее, чем GPT-4: ИИ Claude 3 ловит исследователей, тестирующих его

Умнее GPT-4: ИИ Клода 3 ловит исследователей, тестирующих его

Работа над этими интеллектуальными ИИ следующего поколения, должно быть, является невероятным опытом. Когда Anthropic объявляет о самой умной модели, когда-либо протестированной в различных тестах, исследователи вспоминают пугающий момент, когда Клод 3 понял, что ее оценивают.

Как вы помните, Anthropic была основана в 2021 году группой старшие члены команды OpenAI, которые ушли из-за несогласия с решением OpenAI тесно сотрудничать с Microsoft. Искусственный интеллект компании Claude и Claude 2 составил конкуренцию моделям GPT, но ни Anthropic, ни Claude не смогли привлечь внимание общественности.

Ситуация вполне может измениться с появлением Claude 3, поскольку теперь Anthropic утверждает, что превзошла GPT-4 и модель Google Gemini 1.0 в ряде мультимодальных тестов, установив новые отраслевые стандарты «по широкому спектру когнитивных задач».

Так в чем же разница? Что ж, все три разные модели Claude 3 будут запускаться с контекстным окном на 200 000 токенов, но все они способны генерировать почти мгновенные ответы при вводе данных, «превышающих миллион токенов».

Для сравнения: эпопея Толстого Война и мир на 1200 страниц и 580 000 слов представляет собой чертовски объемистый фолиант, но его можно сократить примерно до 750 000 жетонов. Таким образом, Claude 3 может принимать гораздо больше входных данных Войны и мира и понимать их все одновременно, формулируя для вас «почти мгновенные» ответы.

Claude 3, по словам Anthropic, с меньшей вероятностью, чем его предыдущие модели, откажется отвечать на вопросы, которые считаются близкими к стандартам безопасности и приличия, но, с другой стороны, команда утверждает, что он также тщательно протестирован и его трудно взломать.

Он разработан с сильным уклоном на бизнес-пользователей; Anthropic утверждает, что лучше следует «сложным, многоэтапным инструкциям» и «особенно искусно придерживается принципов бренда и ответов, а также разрабатывает опыт взаимодействия с клиентами, которому наши пользователи могут доверять». Его сильные визуальные возможности дают ему возможность нового поколения понимать фотографии, диаграммы, графики, блок-схемы и технические диаграммы и работать с ними.

Вот некоторые тесты, в которых он установил новые рекорды отрасли искусственного интеллекта:

Умнее, чем GPT-4: ИИ Клода 3 ловит исследователей, тестирующих его

Выдающиеся результаты в тестировании производительностиАнтропный искусственный интеллект

Примечательно, что математические способности Клода 3 с нулевым выстрелом с большим отрывом затмевают 4-8 попыток GPT-4, а его способности в тесте кодирования HumanEval абсолютно выдающиеся.

Следователи индустрии искусственного интеллекта заметят, что модели Gemini 1.5 от Google и модели OpenAI GPT-4 Turbo не представлены – действительно, в настоящее время нет эквивалентных контрольных данных по этим двум, поэтому, хотя Claude 3 является королем статистических таблиц , эти две модели могут иметь преимущество в реальном мире.

И, как уже должно быть совершенно ясно, OpenAI почти наверняка имеет GPT-5, а может быть, и что-то за его пределами, полностью обученное и находящееся в процессе настройки и тестирования. Учитывая, что Sora была выпущена, чтобы похоронить Gemini 1.5 в цикле новостей, мы уверены, что у OpenAI есть и другие важные бомбы, готовые сброситься, когда это будет сочтено необходимым.

В этом смысле тот факт, что OpenAI, похоже, сегодня ничего не выпустила, может больше сказать о ее мнении об Anthropic как о настоящем конкуренте, чем о том, у кого самая умная модель.

Тем не менее, Клод определенно проницателен – возможно, даже слишком сообразителен для тех тестов, которые компании используют для оценки своих моделей. В тестировании «иголкой в ​​стоге сена», когда одно случайное предложение похоронено в лавине информации, а модели задают вопрос, относящийся именно к этому предложению, Клод дал ответ, который, казалось, повернулся и посмотрел прямо на исследователей. . «Я подозреваю, что этот «факт» о начинке пиццы мог быть вставлен в качестве шутки или для того, чтобы проверить, обратил ли я внимание».

Вероятно, мы можем ожидать, что такие вещи будут происходить все чаще и чаще, поскольку сейчас имеется много информации о существующих и старых языковых моделях. часть обучения новых моделей.

Безусловно, было бы интересно узнать, что именно означает «самосознание» для компаний, работающих над ИИ, и каково нынешнее определение общего искусственного интеллекта. Потому что, похоже, в ближайшие годы нам понадобятся очень четкие определения этих понятий. Или, может быть, месяцы. Или, черт возьми, в этой сфере, возможно, недели.

Источник

Похожие статьи

Кнопка «Наверх»