4 Вещи, Которые нужно знать о Minimax H3
Китайская компания Minimax представила H3, новую модель генерации видео с искусственным интеллектом, создающую видео в формате 2K продолжительностью до 15 секунд с поддержкой звука. H3 может похвастаться мультимодальным пониманием, интегрируя текст, изображения, аудио и видео с помощью таких компонентов, как контекстное представление Omni, H3-VA и H3-Omni Transformer. Его контекстная регенерация улучшает качество вывода для достижения высокого разрешения. Minimax планирует массовую разработку для улучшения совместимости с сообществом и аппаратным обеспечением. Однако в настоящее время H3 недоступен на основных рынках, включая Великобританию, ЕС, США и Южную Корею, из-за меняющихся правил в области искусственного интеллекта и проблем с авторскими правами на генеративное видео. H3 позиционирует себя как конкурент ведущих инструментов от Google и OpenAI.
В блогосфере появился новый инструмент для создания видео с искусственным интеллектом, который впервые тестируется пользователями и бросает вызов конкурирующим моделям в борьбе за популярность среди креативщиков.
Китайская компания Minimax представила свою модель "Minimax H3", которая может генерировать видео со звуком продолжительностью до 15 секунд с разрешением примерно 2 КБ.
Вот некоторые ключевые компоненты дизайна:
- Контекстуальное всеобъемлющее представление позволяет H3 интегрировать текст, изображения, аудио, видео и другие типы входных данных в единую контекстуальную модель понимания для целей рассуждения.
- H3-VA - это модель визуального языка MiniMax, которая может понимать изображения и текст и использовать их для решения таких задач, как визуальные ответы на вопросы, анализ документов и разговоры, основанные на изображениях.
- H3-Omni Transformer - это мультимодальная трансформаторная архитектура MiniMax, которая обрабатывает и интегрирует текст, изображения и аудио. Это обеспечивает то, что эксперты называют "контекстуальным пониманием", с использованием рассуждений и генерации с использованием различных модальностей или типов ввода.
- Контекстная регенерация - это метод, который позволяет модели повторно просматривать и уточнять части своих результатов, используя окружающий контекст, улучшая согласованность, фактическую точность, последовательность и общее качество ответов без переобучения модели.
Таким образом, все это обеспечивает надежную возможность использования контекста при создании коротких видеороликов.
Вот еще информация о разработке и выпуске H3.
Открытый исходный код, открытые весаВ некотором смысле, H3 от Minimax продолжает китайскую тенденцию использования дизайна с открытым исходным кодом, предлагая общественности код, лежащий в основе сервиса. Вот часть анонса, непосредственно из пресс-релиза компании от 31 июля:
"Модели с закрытым исходным кодом долгое время доминировали в создании видео, с более медленными итерациями и менее открытой экосистемой, чем в таких областях, как большие языковые модели. Чтобы поддержать сообщество разработчиков с открытым исходным кодом, ускорить совместимость с более широким спектром аппаратных средств искусственного интеллекта и упростить пользователям создание своих собственных пользовательских версий, мы планируем в ближайшие дни открыть доступ к весам моделей в соответствии с применимыми законами и нормативными актами. Совместимость с аппаратным обеспечением была ключевым фактором с самых ранних этапов разработки H3."
That shows some of the rationale behind the decision to open-source this promising new video tool.
Outsourcing ContextAlthough there seems to be no formal acknowledgement of this, reports from the open-source community indicate that H3 may use Qwen3-VL-32B as a text encoder/component, rather than being a model derived from Qwen itself.
"It's just a DiT like most other image/video models," writes Redditor Nextil of the new H3 tool. "The multimodal ‘understanding’ comes from the text encoder, which is just Qwen3-VL-32B, a 10 month old model. There have been many open models released capable of computer use."
Territorial RestrictionsThe third caveat here is that Minimax H3 is actually not available in some pretty big markets, namely:
- The United Kingdom
- The European Union
- The United States
- South Korea
Lest you think that this is just more of the sort of protectionism you see practiced by China and the U.S. in their knock-down, drag-out war for AI dominance, the decision actually has to do more with regulations.
With a little digging, I found this explanation of Minimax’s release strategy on Hugging Face:
"MiniMax-H3 was built with the goal of global availability. The current territory scope is not about excluding specific countries or regions, but about recognizing that video generation models are facing a more complex and rapidly evolving regulatory environment compared with text or code models."
Pointing out that regions such as the EU, UK, South Korea, and the US are currently developing or enforcing AI-related regulations that may have specific implications for generative video models, the writer enumerates a few of them, which I am including verbatim:
- The EU AI Act has started enforcement, while practical requirements for models capable of generating video and likeness-related content are still evolving.
- Similar regulatory uncertainties exist in the UK and South Korea regarding AI-generated content and video generation.
- In the US, AI regulation remains a rapidly changing landscape, and MiniMax is also involved in ongoing copyright-related legal proceedings specifically concerning generative video AI.
The author continues to elaborate:
"For open-weight models, once the weights are released, developers can deploy and modify them independently. This creates different compliance challenges compared with hosted services."
That’s a little bit about what’s behind the regional moratorium. Experts point out that Minimax can still control various aspects of H3 use, for safety, since every request goes through the company’s own servers.
Iterative VideoI also wanted to include the Minimax press release’s explanation of how H3 works by making two passes:
"For H3's 2K output, instead of using a conventional dedicated super-resolution module, we have the H3 base model regenerate its own low-resolution output in-context," spokespersons write. "This brings two advantages: first, the regeneration process maximally reuses the generative capability already built into the H3 base model; second, the in-context approach lets it draw on the original multimodal context again to produce high-resolution output, recovering details that traditional super-resolution can only ‘guess’ at and often can't restore, like small text and fine detail."
Cool.
So now you know more about a generative AI platform to rival Google’s Veo or Synthesia and others. Stay tuned for more.
>
