OpenAI анонсировала GPT-4o — модель, в которой текст, изображения и звук обрабатываются одной нейросетью. В официальной публикации компания объяснила, что прежний голосовой режим объединял распознавание речи, языковую модель и синтез голоса. Новый подход должен был лучше сохранять интонацию и другие детали разговора.
Публичный запуск проходил поэтапно. В ChatGPT и API сначала появились работа с текстом и понимание изображений, а обновленный голосовой режим компания собиралась открыть позднее. Возможности GPT-4o начали распространять и на бесплатный тариф ChatGPT, сохранив более высокие лимиты для подписчиков. Демонстрации аудио и видео описывали потенциал модели, но не означали одновременную доступность всех показанных функций каждому пользователю.