Forklog
April 17, 2026 11:15 AM UTC

Новые релизы Google: ИИ-модели для озвучки текста, роботов и Gemini на macOS

Корпорация Google выпустила Gemini 3.1 Flash TTS — обновленную модель синтеза речи на базе поколения Gemini 3. Она отличается улучшенным качеством звука, выразительностью и более точным управлением, а также поддерживает более 70 языков. Нейросеть позволяет разработчикам, компаниям и рядовым пользователям создавать приложения с голосовым ИИ-интерфейсом.  Gemini 3.1 Flash TTS уже доступна: для разработчиков — в режиме предварительного доступа через Gemini API и Google AI Studio; для предприятий — в Vertex AI; для пользователей Workspace — через сервис Google Vids. Улучшенное качество речи и управляемость Модель набрала 1211 баллов в рейтинге Artificial Analysis TTS. Этот показатель сформирован на основе предпочтений тысяч респондентов, принимавших участие в слепом тестировании качества аудио. Источник: Google. Компания Artificial Analysis отнесла модель к группе наиболее привлекательных решений благодаря сочетанию высококачественного синтеза речи и низкой стоимости. LLM выделяется способностью генерировать естественные диалоги с участием нескольких спикеров. Новые аудио-теги В версии 3.1 Flash TTS появились аудио-теги — инструмент для управления стилем, темпом и манерой речи. «Первые разработчики и корпоративные тестировщики уже видят результаты работы 3.1 Flash TTS, отмечая ее впечатляющую управляемость и выразительность. Они рассказали нам, как аудио-теги обеспечивают новый уровень творческой точности, превращая простой текст в высококачественное голосовое исполнение», — говорится в блоге компании. ИИ-модель для робототехники Параллельно с Gemini 3.1 Flash TTS корпорация представила Gemini Robotics-ER 1.6. Эта ИИ-модель призвана обеспечить роботов возможностью выполнять сложные задачи в реальных условиях за счет улучшенных когнитивных функций и «воплощенного» мышления. Нейросеть специализируется на пространственном восприятии, планировании действий и оценке их успешности. Она демонстрирует заметные улучшения по сравнению со своей предшественницей и Gemini 3.0 Flash при выполнении заданий, связанных с пространственным и физическим мышлением. Gemini Robotics-ER 1.6 может интерпретировать данные со сложных измерительных приборов и наблюдать показатели через смотровые стекла. Эту возможность специалисты Google DeepMind разработали совместно с Boston Dynamics для нужд промышленного сектора. «Такие возможности позволяют автономно видеть, понимать и реагировать на реальные вызовы», — прокомментировал вице-президент проекта Spot в Boston Dynamics Марко да Сильва. В тестах на выявление угроз безопасности новинка превзошла Gemini 3.0 Flash на 6% в текстовых сценариях и на 10% при анализе видео. Интеграция LLM в реальные рабочие процессы уже началось: Boston Dynamics интегрировала Gemini и Gemini Robotics-ER 1.6 в собственную платформу Orbit AIVI-Learning. Gemini на macOS Кроме того, Google выпустила нативное приложение Gemini для macOS. Оно доступно по нажатию Option + Пробел. Среди функционала — возможность поделиться окном для мгновенной передачи контекста. Приложение поддерживает генерацию изображений с помощью Nano Banana, создание видео с Veo и другие привычные инструменты. Напомним, в апреле Google представила Gemma 4 — новое семейство открытых ИИ-моделей для продвинутых рассуждений и агентных рабочих процессов.

ChartModo Newsletter
면책 조항 읽기 : 본 웹 사이트, 하이퍼 링크 사이트, 관련 응용 프로그램, 포럼, 블로그, 소셜 미디어 계정 및 기타 플랫폼 (이하 "사이트")에 제공된 모든 콘텐츠는 제 3 자 출처에서 구입 한 일반적인 정보 용입니다. 우리는 정확성과 업데이트 성을 포함하여 우리의 콘텐츠와 관련하여 어떠한 종류의 보증도하지 않습니다. 우리가 제공하는 컨텐츠의 어떤 부분도 금융 조언, 법률 자문 또는 기타 용도에 대한 귀하의 특정 신뢰를위한 다른 형태의 조언을 구성하지 않습니다. 당사 콘텐츠의 사용 또는 의존은 전적으로 귀하의 책임과 재량에 달려 있습니다. 당신은 그들에게 의존하기 전에 우리 자신의 연구를 수행하고, 검토하고, 분석하고, 검증해야합니다. 거래는 큰 손실로 이어질 수있는 매우 위험한 활동이므로 결정을 내리기 전에 재무 고문에게 문의하십시오. 본 사이트의 어떠한 콘텐츠도 모집 또는 제공을 목적으로하지 않습니다.