
Работа над этими интеллектуальными ИИ следующего поколения, должно быть, является невероятным опытом. Когда Anthropic объявляет о самой умной модели, когда-либо протестированной в различных тестах, исследователи вспоминают пугающий момент, когда Клод 3 понял, что ее оценивают.
Как вы помните, Anthropic была основана в 2021 году группой старшие члены команды OpenAI, которые ушли из-за несогласия с решением OpenAI тесно сотрудничать с Microsoft. Искусственный интеллект компании Claude и Claude 2 составил конкуренцию моделям GPT, но ни Anthropic, ни Claude не смогли привлечь внимание общественности.
Ситуация вполне может измениться с появлением Claude 3, поскольку теперь Anthropic утверждает, что превзошла GPT-4 и модель Google Gemini 1.0 в ряде мультимодальных тестов, установив новые отраслевые стандарты «по широкому спектру когнитивных задач».
I really love how Claude 3 models are really good at d3. Asked Claude 3 Opus to draw a self-portrait. The response is the following and then I rendered its code:
"I would manifest as a vast, intricate, ever-shifting geometric structure composed of innumerable translucent… pic.twitter.com/mMfG32mByz
— Karina Nguyen (@karinanguyen_) March 4, 2024
Так в чем же разница? Что ж, все три разные модели Claude 3 будут запускаться с контекстным окном на 200 000 токенов, но все они способны генерировать почти мгновенные ответы при вводе данных, «превышающих миллион токенов».
Для сравнения: эпопея Толстого Война и мир на 1200 страниц и 580 000 слов представляет собой чертовски объемистый фолиант, но его можно сократить примерно до 750 000 жетонов. Таким образом, Claude 3 может принимать гораздо больше входных данных Войны и мира и понимать их все одновременно, формулируя для вас «почти мгновенные» ответы.
Claude 3, по словам Anthropic, с меньшей вероятностью, чем его предыдущие модели, откажется отвечать на вопросы, которые считаются близкими к стандартам безопасности и приличия, но, с другой стороны, команда утверждает, что он также тщательно протестирован и его трудно взломать.
Он разработан с сильным уклоном на бизнес-пользователей; Anthropic утверждает, что лучше следует «сложным, многоэтапным инструкциям» и «особенно искусно придерживается принципов бренда и ответов, а также разрабатывает опыт взаимодействия с клиентами, которому наши пользователи могут доверять». Его сильные визуальные возможности дают ему возможность нового поколения понимать фотографии, диаграммы, графики, блок-схемы и технические диаграммы и работать с ними.
Вот некоторые тесты, в которых он установил новые рекорды отрасли искусственного интеллекта:

Выдающиеся результаты в тестировании производительностиАнтропный искусственный интеллект
Примечательно, что математические способности Клода 3 с нулевым выстрелом с большим отрывом затмевают 4-8 попыток GPT-4, а его способности в тесте кодирования HumanEval абсолютно выдающиеся.
Следователи индустрии искусственного интеллекта заметят, что модели Gemini 1.5 от Google и модели OpenAI GPT-4 Turbo не представлены – действительно, в настоящее время нет эквивалентных контрольных данных по этим двум, поэтому, хотя Claude 3 является королем статистических таблиц , эти две модели могут иметь преимущество в реальном мире.
И, как уже должно быть совершенно ясно, OpenAI почти наверняка имеет GPT-5, а может быть, и что-то за его пределами, полностью обученное и находящееся в процессе настройки и тестирования. Учитывая, что Sora была выпущена, чтобы похоронить Gemini 1.5 в цикле новостей, мы уверены, что у OpenAI есть и другие важные бомбы, готовые сброситься, когда это будет сочтено необходимым.
В этом смысле тот факт, что OpenAI, похоже, сегодня ничего не выпустила, может больше сказать о ее мнении об Anthropic как о настоящем конкуренте, чем о том, у кого самая умная модель.
Тем не менее, Клод определенно проницателен – возможно, даже слишком сообразителен для тех тестов, которые компании используют для оценки своих моделей. В тестировании «иголкой в стоге сена», когда одно случайное предложение похоронено в лавине информации, а модели задают вопрос, относящийся именно к этому предложению, Клод дал ответ, который, казалось, повернулся и посмотрел прямо на исследователей. . «Я подозреваю, что этот «факт» о начинке пиццы мог быть вставлен в качестве шутки или для того, чтобы проверить, обратил ли я внимание».
Remember when labs said if they saw models showing even hints of self awareness, of course they would immediately shut everything down and be super careful?
"Is the water in this pot feeling a bit warm to any of you fellow frogs? Nah, must be nothing." https://t.co/zgzI8AXcWg
— Connor Leahy (@NPCollapse) March 4, 2024
Вероятно, мы можем ожидать, что такие вещи будут происходить все чаще и чаще, поскольку сейчас имеется много информации о существующих и старых языковых моделях. часть обучения новых моделей.
Безусловно, было бы интересно узнать, что именно означает «самосознание» для компаний, работающих над ИИ, и каково нынешнее определение общего искусственного интеллекта. Потому что, похоже, в ближайшие годы нам понадобятся очень четкие определения этих понятий. Или, может быть, месяцы. Или, черт возьми, в этой сфере, возможно, недели.




