Google опубликовала сводку заметных ИИ-анонсов за июль: компания выделила новые модели Gemini для агентных сценариев, развитие Gemini Robotics и инструменты для создания медиаконтента. В одном списке оказались разработки для разработчиков, прикладные функции для пользователей и исследования, связанные с роботами.
Агенты: от чата к последовательности действий
Главный тренд — модели всё чаще позиционируются как основа для агентов, которые не только отвечают на вопрос, но и планируют несколько шагов, используют подключённые сервисы и готовят результат. Это удобно для повторяющихся операций: исследования, подготовки черновиков, классификации обращений и работы с документами.
Однако чем больше у агента инструментов, тем важнее чётко ограничить его права. Хороший старт — узкий сценарий, тестовые данные и понятная точка, где финальное действие подтверждает человек.
Робототехника и мультимодальность
В сообщении также упоминается Gemini Robotics ER 2 — направление, в котором модели должны лучше рассуждать, взаимодействовать и решать задачи в физической среде. Такие системы особенно зависят от качества датчиков, безопасности действий и надёжности оценки результата: ошибка в тексте обычно обратима, ошибка робота — не всегда.
Что пригодится на практике уже сейчас
- использовать ИИ для черновиков, поиска закономерностей и подготовки вариантов, а не как единственный источник фактов;
- дробить сложный процесс на проверяемые шаги;
- подключать рабочие сервисы только после проверки разрешений и политики данных;
- измерять экономию времени на конкретной задаче, а не по демонстрации;
- сохранять возможность выполнить ключевое действие вручную.
На что смотреть дальше
В ближайших обновлениях полезнее всего следить не за количеством заявленных возможностей, а за качеством интеграций: какие инструменты агент может вызывать, как работает контроль действий, какие данные передаются и можно ли воспроизвести результат. Именно эти детали определяют, будет ли ИИ помощником или источником лишней операционной сложности.