ИИ-новости за июль: модели делят работу, голос оживает, а роботы учатся исправлять ошибки

11 авг 2026 Новости


Июль оказался не столько месяцем новых чат-ботов, сколько новых способов довести задачу до результата. Модели распределяют работу между несколькими агентами, голосовые помощники слушают и говорят одновременно, творческие программы открывают свои проекты внешним помощникам, а роботы учатся следить за собственным прогрессом.

Обещаний, как обычно, больше, чем готовых сценариев. Но общий вектор уже заметен: ценность ИИ всё чаще измеряют не красотой ответа, а тем, смог ли он выполнить цепочку действий, проверить себя и отдать результат, который не нужно переделывать.



GPT-5.6: OpenAI собирает из одной модели целую рабочую команду


OpenAI выпустила семейство GPT-5.6 из трёх моделей: Sol для наиболее сложных задач, Terra для повседневной работы и Luna для массовых и экономичных сценариев. Но интереснее самих названий то, как компания теперь описывает флагман: не как более умного собеседника, а как исполнителя, способного параллельно вести несколько направлений работы.


Источник видео

Что нового

В режиме Ultra GPT-5.6 Sol может распределять сложную задачу между несколькими агентами, которые работают параллельно, а затем сводить их результаты. Через API модель также умеет программно выстраивать обращения к инструментам и обрабатывать промежуточные данные, не превращая каждый шаг в отдельный длинный диалог.

Отдельный акцент OpenAI делает на документах, презентациях и таблицах. GPT-5.6 должна точнее считывать структуру исходного шаблона, соблюдать иерархию, отступы и повторяющиеся элементы, а не просто заполнять слайд текстом. В тесте по работе с CAD компания также заявляет заметный прирост по сравнению с GPT-5.5. В день релиза модель появилась и в Figma Make, где её используют для сборки интерактивных прототипов и исправления ошибок в коде.

Почему это важно

Пользователю всё меньше интересны рассуждения в текстах. Гораздо важнее, может ли модель разобрать исходные материалы, сохранить оформление, собрать файл, проверить его и вернуть не заготовку, а версию, которую можно стразу взять в работу. GPT-5.6 показывает, что борьба крупнейших компаний постепенно переходит именно в эту плоскость.

Правда, режим с несколькими агентами пока доступен не всем и расходует больше вычислительных ресурсов, поэтому реальная польза будет зависеть не только от качества, но и от цены одной законченной задачи.



Claude Opus 5 делает ставку на самопроверку и профессиональные задачи


Anthropic представила Claude Opus 5 — новую старшую модель линейки. Компания называет её более вдумчивой и инициативной, но в практическом плане важнее другое: модель должна реже останавливаться на первом правдоподобном ответе и чаще проверять логику своей работы до выдачи результата.

Claude Opus 5
Источник фото

Что нового

Opus 5 доступна во всех основных продуктах Anthropic и стоит столько же, сколько Opus 4.8: 5 долларов за миллион входящих токенов и 25 долларов за миллион исходящих. Есть ускоренный режим, который работает примерно в 2,5 раза быстрее, но обходится вдвое дороже.

В примерах Anthropic модель не только пишет код, но и ищет корень ошибки, перепроверяет решение и меняет план, если первый подход не сработал. Показательный пример для инженерной работы: Opus 5 получила изображение детали и задачу восстановить её в FreeCAD. Не имея готового инструмента для просмотра исходника, модель сама собрала обработку изображения, извлекла геометрию и написала код для трёхмерной модели.

Почему это важно

Изменилась сама роль модели: она не просто выполняет данную инструкцию, а ищет способ добраться до цели. Для разработки, анализа документов, финансовых моделей и инженерных прототипов такая настойчивость может оказаться важнее небольшого прироста в качестве обычных ответов.



Творческие программы становятся открытыми для ИИ-агентов


На SIGGRAPH 2026 NVIDIA показала, как стандартный протокол подключения инструментов MCP постепенно проникает в графические и трёхмерные программы. Смысл простой: агент получает доступ к сцене, объектам, материалам, временной шкале, документации и командам конкретного приложения.


Источник видео

Что нового

Подключения через MCP появились или готовятся для Affinity, Blender, Boris FX Silhouette, Foundry Griptape, Houdini 22 и Unreal Editor. В зависимости от программы агент может искать потерянные текстуры, проверять цветовые настройки, собирать варианты экспорта, создавать узлы, править ключевые кадры, готовить предварительные просмотры или сверять сцену с правилами производственного процесса.

Параллельно NVIDIA показала развитие нейронного рендеринга и физических моделей: управление внешним видом через трёхмерную сцену, устойчивость результата между кадрами, вывод 4K в реальном времени, а также ускоренные расчёты для аэродинамики и теплового проектирования. Часть таких систем можно запускать локально на профессиональных рабочих станциях, не отправляя исходные материалы во внешнее облако.

Почему это важно

Главная новость здесь не в том, что модели научилась нажимать кнопки в Blender. Важно появление стандартного слоя доступа, через который разные помощники могут работать с разными профессиональными программами.

Если он приживётся, студии смогут менять модель, не перестраивая весь процесс заново, а рутинные проверки и пакетные операции отдавать локальным агентам, оставляя творческие решения человеку.



Google учит роботов понимать, закончена ли работа


Google DeepMind выпустила Gemini Robotics ER 2 — модель, которая выступает «старшим мозгом» для робота. Она не управляет каждым движением напрямую, а понимает задачу, следит за происходящим через видео, разбивает работу на этапы и вызывает нужные системы управления.


Источник видео

Что нового

Модель постоянно анализирует видеопоток и оценивает прогресс. Если действие не удалось, робот может повторить отдельный шаг, а не начинать всю задачу заново. Система также учится определять точный момент завершения операции: например, когда ёмкость наполнена или предмет установлен на место.

Ещё одна функция — совместная работа нескольких роботов. Gemini Robotics ER 2 может распределить части процесса между машинами с разными возможностями и организовать передачу задачи. Модель уже доступна разработчикам через Gemini API и Google AI Studio, хотя полноценные системы управления роботами по-прежнему нужно подключать отдельно.

Почему это важно

В цифровых задачах агенту сравнительно легко проверить файл, тест или таблицу. В физическом мире ошибка может означать повреждённую деталь, остановку линии или угрозу безопасности. Поэтому способность не просто дать команду, а наблюдать за исполнением, распознавать сбой и корректировать план — необходимое условие для реального применения ИИ в производстве, логистике и обслуживании.



Runway собирает генерацию изображений, видео и звука в одну систему


Runway запустила платформу Runway Dev для разработчиков и корпоративных команд. Вместо отдельного подключения каждого сервиса она предлагает один программный интерфейс для моделей изображений, видео, звука и интерактивных персонажей — как собственных, так и сторонних.

Runway Dev
Источник фото

Что нового

В каталоге собраны Gen-4.5, Aleph 2.0, Act-Two, Seedance, GPT Image 2, ElevenLabs и другие модели. Менять их можно без полной переделки интеграции, а расходы по разным поставщикам отображаются в одной панели.

Главная функция — Media Router. Пользователь задаёт приоритет: качество, скорость или стоимость, ограничивает допустимые модели и устанавливает максимальную цену. После этого система сама выбирает подходящий генератор для каждого запроса и объясняет, почему использовала именно его. Можно заранее проверить выбор без запуска генерации и без списания средств.

Почему это важно

Лидеры по качеству меняются, цены скачут, одна модель лучше делает людей, другая — движение камеры, третья — озвучку. Runway пытается превратить этот процесс в инфраструктуру: команда описывает требования к результату, а подбор конкретного движка уходит внутрь системы. Это полезно для массового производства контента.



Что ещё интересного в мире ИИ



Немного новостей одной строкой:

GPT-Live делает голосовой разговор двусторонним. Новая голосовая модель OpenAI может слушать и говорить одновременно, нормально переносит перебивания и паузы, а для сложного поиска обращается к старшей модели в фоне, не обрывая разговор.

Google выпустила Gemini 3.6 Flash и две специализированные версии. Основная модель стала экономнее расходовать токены, Flash-Lite рассчитана на быстрые массовые операции, а Flash Cyber работает вместе с агентом CodeMender для поиска и исправления уязвимостей в коде.

Figma Make получила панель свойств и аннотации. Теперь отдельный элемент прототипа можно выбрать мышью, изменить его отступы, типографику или расположение привычными контролами, а сложную правку описать агенту прямо рядом с нужной областью.

MiniMax запустила видеомодель H3. Модель одновременно понимает текст, изображения, видео и звук, создаёт ролики длительностью до 15 секунд в разрешении до 2K и сразу генерирует стереозвук.

Google обновила генерацию музыки до Lyria 3.5. Модель в Flow Music получила более естественные вокал и тексты, лучшее развитие композиции и дополнительные способы управлять результатом.


Июль продолжает тренд последних месяцев — ИИ перестаёт быть отдельным генератором текста, картинки или кода. Модели получают инструменты, учатся распределять работу, наблюдать за исполнением и выбирать подходящий движок под конкретную задачу.

На этом всё, увидимся в следующем месяце.


Автор: Гамза Иван

Руководитель IT направления Лаб 20/50

Другие материалы

Читать все