01핵심 개요
| 항목 | 내용 |
|---|---|
| 형식 | Theoretically Media 채널의 신모델 실사용 첫인상 리뷰 |
| 모델 | 미니맥스 하이루(Hailuo) M3 — 직전 버전 2.3 이후 9개월 만 업데이트 |
| 스펙 | 2K 해상도, 세대당 최대 15초, 프롬프트 최대 7,000자 |
| 멀티모달 | 첫/끝 프레임, 최대 12장 이미지 참조, 비디오·오디오 참조, 다국어 프롬프트 |
| 위치 | 얼리 액세스 단계, 품질은 시댄스 2.0에 근접, 정식 가격 미공개 |
02핵심 내용 구조 — 9개월 만의 컴백과 옴니 멀티모달
미니맥스의 마지막 영상 모델 업데이트(2.3)는 9개월 전이었고, M3는 사실상 새 세대다. 멀티모달 모델로 표준적인 첫 프레임·마지막 프레임 처리에 더해, 최대 12장 이미지 참조가 가능한 옴니(Omni) 참조, 비디오·오디오 참조, 그리고 이 셋을 조합한 생성까지 지원한다. 리뷰어는 트윈픽스 패러디, 마피아 잠입 요원, 일본어를 구사하는 사무라이 등 다양한 텍스트-투-비디오 테스트로 캐릭터 일관성과 다국어 대응을 확인했다.
03기술적 맥락 — 속도보다 일관성을 택한 설계
M3의 전투·액션 장면은 시댄스류의 폭발적 모션보다 다소 느리게 진행되는데, 리뷰어는 이를 일관성과 안정성을 위한 의도적 트레이드오프로 해석한다. 프롬프트는 7,000자까지 허용되며, 지나치게 긴 JSON형 프롬프트는 2단계에서 끊기는 등 한계도 관찰됐다. 다국어는 목표 언어로 프롬프트를 그대로 작성하면 작동한다. GPT 이미지 2에서 만든 스토리보드를 진지하게 반영하는 반면, 시댄스는 자유 해석하는 경향이 있어 하이루는 스토리보드를 신중하게 설계해야 한다.
04핵심 워크플로우 — 옴니 참조와 영상 확장
옴니 모델은 이미지뿐 아니라 비디오를 입력으로 받아 기존 영상을 이어 붙이는 확장(extend) 기능으로 활용할 수 있으며, 최대 3개 비디오 참조를 제공한다. 첫/끝 프레임 사이를 채우는 인페인팅형 생성, 복수 캐릭터를 하나의 장면에 합성하는 레퍼런스 조합도 가능하다. 다만 확장 시 인물 위치가 반대편으로 바뀌는 등 공간적 정합성 문제가 남아 있어 프롬프트를 정교하게 다듬어야 한다.
05활용 시나리오
상업용 수준의 광고·예고편, 다국어 대사 영상, 캐릭터 일관성이 중요한 시리즈 콘텐츠 제작에 적합하다. 영상에서는 스폰서 일레븐랩스(ElevenLabs)의 11 Agents로 캐릭터 목소리를 복제해 실시간 음성 에이전트와 대화하는 응용도 시연했다.
06현황 및 전망
M3는 얼리 액세스 단계로 정식 가격이 미확정이나, 리뷰어는 2K·15초 세대에 약 150크레딧이 소요되는 것을 근거로 시댄스 대비 약 50% 저렴한 가격대를 추정한다. 시댄스, 하이루, 최근 출시된 플럭스(Flux) 3까지 최첨단 영상 모델 선택지가 넓어지는 국면이다.
07용어 사전
| 용어 | 한줄 설명 | 비유/예시 |
|---|---|---|
| 하이루(Hailuo) M3 | 미니맥스의 신규 멀티모달 영상 생성 모델 | 9개월 만에 나온 차세대 카메라 |
| 시댄스(Seedance) | 바이트댄스 계열 대표 영상 생성 모델, M3의 경쟁작 | 이번 라운드의 기준점 |
| 옴니(Omni) 참조 | 최대 12장 이미지·비디오·오디오를 결합해 생성 | 여러 소스를 한 냄비에 넣는 방식 |
| 첫/끝 프레임 | 시작·끝 이미지를 주면 그 사이를 자동 생성 | A→B 사이 채우기 |
| 영상 확장(extend) | 기존 비디오를 입력해 뒷부분을 이어 붙이는 기능 | 잘린 영상 뒤 이야기 이어 그리기 |
| 크레딧 | 생성 비용 단위, 2K·15초에 약 150크레딧 | 게임 내 재화 |
| 다국어 프롬프트 | 목표 언어로 그대로 쓰면 해당 언어 대사 생성 | 일본어로 쓰면 일본어 연기 |
