🤚 CLAUDE OPUS 4.8
Как вы знаете, мы пристально следим за релизами крутых нейронок и с каждым выходом проверяем может ли ИИ заменить улучшить работу арбитражника. Итак, вот что тут нового и интересного мы нашли:
😁 Ключевое, что разработчики из Antropic постарались улучшить - это надежность в агентных задачах, так что модель чаще задает уточняющие вопросы, не настаивает на неправильных решениях и старается заметить какие-то неточности. Это довольно позитивное изменение (особенно для тех, кто льет/планирует лить трафик через ИИ-агентов).
😁Кроме этого, модель специально натренировали в 4 раза реже допускать ошибки при работе с кодом. Сейчас Opus 4.8 по кодингу еще сильнее оторвался от GPT-5.5: по бенчмарку SWE-Bench Pro 69,2% у Opus против 58,6% у последней версии ChatGPT.
😁Еще один важный бенчмарк - GDPval - работа с документами (например, собрать отчет по заливу), презентациями, аналитическими записками и так далее. В нем Opus 4.8 также превосходит GPT-5.5 (1890 баллов против 1769). Еще, если кто-то использует Claude для deep research, то тут тоже зафиксирован ощутимый прирост.
😁Цены на токены, кстати, остались на том же уровне, что и для прошлой версии модели: $5 за 1 млн входных и $25 за 1 млн выходных токенов. За Fast mode (скорость работы x2,5) соответственно, придется платить x2.
В общем, прошел месяц с релиза GPT-5.5, в которой OpenAI догнала конкурента, но Antropic с этим апдейтом уверенно вырывается вперед в гонке LLM-ок. Интересно будет посмотреть, чем ответят конкуренты.
➖➖➖➖➖➖➖➖➖➖➖
🏆🏆🏆🏆🏆 Подписка ❕ Чат
Как вы знаете, мы пристально следим за релизами крутых нейронок и с каждым выходом проверяем может ли ИИ заменить улучшить работу арбитражника. Итак, вот что тут нового и интересного мы нашли:
😁 Ключевое, что разработчики из Antropic постарались улучшить - это надежность в агентных задачах, так что модель чаще задает уточняющие вопросы, не настаивает на неправильных решениях и старается заметить какие-то неточности. Это довольно позитивное изменение (особенно для тех, кто льет/планирует лить трафик через ИИ-агентов).
😁Кроме этого, модель специально натренировали в 4 раза реже допускать ошибки при работе с кодом. Сейчас Opus 4.8 по кодингу еще сильнее оторвался от GPT-5.5: по бенчмарку SWE-Bench Pro 69,2% у Opus против 58,6% у последней версии ChatGPT.
😁Еще один важный бенчмарк - GDPval - работа с документами (например, собрать отчет по заливу), презентациями, аналитическими записками и так далее. В нем Opus 4.8 также превосходит GPT-5.5 (1890 баллов против 1769). Еще, если кто-то использует Claude для deep research, то тут тоже зафиксирован ощутимый прирост.
😁Цены на токены, кстати, остались на том же уровне, что и для прошлой версии модели: $5 за 1 млн входных и $25 за 1 млн выходных токенов. За Fast mode (скорость работы x2,5) соответственно, придется платить x2.
В общем, прошел месяц с релиза GPT-5.5, в которой OpenAI догнала конкурента, но Antropic с этим апдейтом уверенно вырывается вперед в гонке LLM-ок. Интересно будет посмотреть, чем ответят конкуренты.
➖➖➖➖➖➖➖➖➖➖➖
🏆🏆🏆🏆🏆 Подписка ❕ Чат