Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
36 changes: 18 additions & 18 deletions ja/tutorials/video/minimax/minimax-h3.mdx
Original file line number Diff line number Diff line change
Expand Up @@ -2,15 +2,15 @@
title: "MiniMax H3: ComfyUI ワークフロー例"
description: "オープンウェイトのMiniMax H3をComfyUIで使用する方法を学びます。テキストから動画へ、画像から動画へ、参照から動画へのネイティブワークフローを備え、すべてネイティブのステレオオーディオに対応しています。"
sidebarTitle: "MiniMax H3"
translationSourceHash: df5a6d77
translationSourceHash: c55b373a
translationFrom: tutorials/video/minimax/minimax-h3.mdx
translationBlockHashes:
"_intro": 4c7a3600
"Key features": 7bfa7de1
"Getting started": fddf949c
"Setting the output resolution": 08aa2b8b
"ComfyUI Native Workflows": efce2cbc
"Speeding up generation with Sage Attention": 1b231e7c
"ComfyUI Native Workflows": 47751f38
---


Expand All @@ -19,6 +19,7 @@ translationBlockHashes:




[MiniMax H3](https://www.minimax.io/blog/minimax-h3) は、MiniMaxの汎用オムニモーダル生成モデルで、現在はオープンウェイトとして公開されています。テキスト、画像、ビデオ、オーディオを単一のコンテキストで統合的に理解し、**ネイティブステレオオーディオ**付きのビデオを生成します。つまり、音声、サウンドエフェクト、音楽は、後から重ね合わせるのではなく、単一のフォワードパスでまとめてモデル化されます。出力は最大2K解像度、24fps、約15秒です。

ComfyUI は MiniMax H3 をネイティブにサポートしています。テンプレートライブラリには現在、それぞれ 1 つの生成モードをカバーする 3 つのサンプルワークフローが用意されています:
Expand Down Expand Up @@ -60,20 +61,6 @@ MiniMax H3はオープンウェイトで、ComfyUIでサポートされていま

テンプレートは高速なプレビューサイズになっています。フル品質で出力するには、16:9 でメガピクセルを約 `1.0` に上げると、およそ 1344x768 になります。これは H3 のネイティブキャンバス(短辺 768px、上限 768x1344 ピクセル)です。

## Sage Attention で生成を高速化

サンプルワークフローはデフォルトで標準のアテンション実装を使用します。[Sage Attention](https://github.com/woct0rdho/SageAttention) を使用すると、品質の低下を最小限に抑えながら生成速度をおよそ2倍にできます。Sage Attention はオプションの依存関係のため、自分でインストールする必要があります:

1. `sageattention` Python パッケージをインストールします。[SageAttention releases](https://github.com/woct0rdho/SageAttention/releases) ページから自分の PyTorch と CUDA のバージョンに合った wheel ファイルをダウンロードし、`pip install <wheel-file>` でインストールします。
2. [KJNodes カスタムノード](https://github.com/kijai/ComfyUI-KJNodes) をインストールします。これにより `Patch Sage Attention KJ` ノードが提供されます。ComfyUI Manager を使用するか、リポジトリを `ComfyUI/custom_nodes/` にクローンして ComfyUI を再起動してください。
3. ワークフローに `Patch Sage Attention KJ` ノードを追加し、`UNETLoader` と `BasicGuider` ノードの間に接続します:`model` 入力は `UNETLoader` からモデルを受け取り、`model` 出力は `BasicGuider` の `model` 入力に接続します。`sage_attention` は `auto` に設定します。
4. 通常どおりワークフローを実行します。パッチを適用する必要があるのは guider だけです。scheduler は sigmas を生成するだけで、そのままにしておけます。

注意:

- Sage Attention は float16 または bfloat16 テンソルを必要とします。MiniMax H3 の一部のレイヤーは他の dtype で実行されるため、コンソールに "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead" というメッセージが表示されることがあります。これは正常です。影響を受けるレイヤーは標準アテンションにフォールバックし、生成は正常に動作します。
- 別の方法として、ノードを追加せずに `--use-sage-attention` フラグ付きで ComfyUI を起動して、Sage Attention をグローバルに有効にすることもできます。

## ComfyUI のネイティブワークフロー

### MiniMax H3 テキストからビデオ生成 (T2V)
Expand Down Expand Up @@ -258,9 +245,22 @@ ComfyUI/
2. **各参照にジョブを割り当てる**: どの参照がショットのどの部分(アイデンティティ、スタイル、モーション、カメラ、音声)を担当するかを明示します。明示的な割り当ての方がはるかに良い結果が得られる傾向があります。
3. **制限**: 参照画像は最大9枚、参照ビデオは最大3本(それぞれ独自のサウンドトラックを持つことができます)、スタンドアロンの参照オーディオクリップは最大3つまで使用できます。
4. **ref_image_size**: `match` は参照を生成解像度に縮小して高速化します。`max` は短辺を最大2048pxに保つことでアイデンティティの忠実度を高めますが、速度は低下します。
5. **サンプラー**: 参照が多いプロンプトでは、`beta` または `normal` scheduler を使用した `res_multistep` が `simple` よりも良い結果を出す傾向があります。
6. **注意**: R2V は `ref2va` diffusion モデルを使用します。これは T2V および I2V ワークフローで使用される `fl2va` モデルとは異なる重みセットです。
5. **注意**: R2V は `ref2va` diffusion モデルを使用します。これは T2V および I2V ワークフローで使用される `fl2va` モデルとは異なる重みセットです。

#### プロンプト作成ガイド

MiniMax は、参照駆動生成(R2V)向けの公式 [フルリファレンスモードのプロンプトガイド](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md) を公開しています。このガイドでは、書き換え出力の構造(subject definitions、参照ラベル、retention analysis など)と、各参照にターゲットショットでの役割を割り当てる方法を説明しています。

## Sage Attention で生成を高速化

サンプルワークフローはデフォルトで標準のアテンション実装を使用します。[Sage Attention](https://github.com/woct0rdho/SageAttention) を使用すると、品質の低下を最小限に抑えながら生成速度をおよそ2倍にできます。Sage Attention はオプションの依存関係のため、自分でインストールする必要があります:

1. `sageattention` Python パッケージをインストールします。[SageAttention releases](https://github.com/woct0rdho/SageAttention/releases) ページから自分の PyTorch と CUDA のバージョンに合った wheel ファイルをダウンロードし、`pip install <wheel-file>` でインストールします。
2. [KJNodes カスタムノード](https://github.com/kijai/ComfyUI-KJNodes) をインストールします。これにより `Patch Sage Attention KJ` ノードが提供されます。ComfyUI Manager を使用するか、リポジトリを `ComfyUI/custom_nodes/` にクローンして ComfyUI を再起動してください。
3. ワークフローに `Patch Sage Attention KJ` ノードを追加し、`UNETLoader` と `BasicGuider` ノードの間に接続します:`model` 入力は `UNETLoader` からモデルを受け取り、`model` 出力は `BasicGuider` の `model` 入力に接続します。`sage_attention` は `auto` に設定します。
4. 通常どおりワークフローを実行します。パッチを適用する必要があるのは guider だけです。scheduler は sigmas を生成するだけで、そのままにしておけます。

注意:

- Sage Attention は float16 または bfloat16 テンソルを必要とします。MiniMax H3 の一部のレイヤーは他の dtype で実行されるため、コンソールに "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead" というメッセージが表示されることがあります。これは正常です。影響を受けるレイヤーは標準アテンションにフォールバックし、生成は正常に動作します。
- 別の方法として、ノードを追加せずに `--use-sage-attention` フラグ付きで ComfyUI を起動して、Sage Attention をグローバルに有効にすることもできます。
36 changes: 18 additions & 18 deletions ko/tutorials/video/minimax/minimax-h3.mdx
Original file line number Diff line number Diff line change
Expand Up @@ -2,15 +2,15 @@
title: "MiniMax H3: ComfyUI 워크플로 예시"
description: "ComfyUI에서 오픈 가중치 MiniMax H3를 사용하는 방법을 알아보세요. 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 레퍼런스 기반 비디오 생성을 위한 네이티브 워크플로를 제공하며, 모든 기능에서 네이티브 스테레오 오디오를 지원합니다."
sidebarTitle: "MiniMax H3"
translationSourceHash: df5a6d77
translationSourceHash: c55b373a
translationFrom: tutorials/video/minimax/minimax-h3.mdx
translationBlockHashes:
"_intro": 4c7a3600
"Key features": 7bfa7de1
"Getting started": fddf949c
"Setting the output resolution": 08aa2b8b
"ComfyUI Native Workflows": efce2cbc
"Speeding up generation with Sage Attention": 1b231e7c
"ComfyUI Native Workflows": 47751f38
---


Expand All @@ -20,6 +20,7 @@ translationBlockHashes:




[MiniMax H3](https://www.minimax.io/blog/minimax-h3)는 MiniMax의 범용 옴니모달 생성 모델로, 현재 오픈 가중치로 제공됩니다. 이 모델은 단일 컨텍스트에서 텍스트, 이미지, 비디오, 오디오를 함께 이해하며, **네이티브 스테레오 오디오**로 비디오를 생성합니다. 음성, 사운드 효과, 음악이 이후에 덧붙여지는 대신 단일 포워드 패스에서 함께 모델링됩니다. 출력은 최대 2K 해상도, 24fps, 약 15초입니다.

ComfyUI는 MiniMax H3를 네이티브로 지원합니다. 템플릿 라이브러리에는 현재 각각 하나의 생성 모드를 다루는 예제 워크플로 3개가 제공됩니다:
Expand Down Expand Up @@ -61,20 +62,6 @@ MiniMax H3는 오픈 가중치로 ComfyUI에서 지원됩니다. 시작하려면

템플릿은 빠른 미리보기 크기로 제공됩니다. 전체 품질로 출력하려면 16:9에서 메가픽셀을 약 `1.0`으로 올리면 약 1344x768이 됩니다. 이는 H3의 네이티브 캔버스(단변 768px, 최대 768x1344 픽셀)입니다.

## Sage Attention으로 생성 가속화

예제 워크플로는 기본적으로 표준 어텐션 구현을 사용합니다. [Sage Attention](https://github.com/woct0rdho/SageAttention)을 사용하면 품질 손실을 최소화하면서 생성 속도를 약 2배 높일 수 있습니다. Sage Attention은 선택적 의존성으로, 직접 설치해야 합니다:

1. `sageattention` Python 패키지를 설치합니다. [SageAttention releases](https://github.com/woct0rdho/SageAttention/releases) 페이지에서 자신의 PyTorch 및 CUDA 버전과 일치하는 wheel 파일을 다운로드한 후 `pip install <wheel-file>`로 설치합니다.
2. `Patch Sage Attention KJ` 노드를 제공하는 [KJNodes 커스텀 노드](https://github.com/kijai/ComfyUI-KJNodes)를 설치합니다. ComfyUI Manager를 사용하거나, 리포지토리를 `ComfyUI/custom_nodes/`에 클론한 후 ComfyUI를 다시 시작하세요.
3. 워크플로에 `Patch Sage Attention KJ` 노드를 추가하고 `UNETLoader`와 `BasicGuider` 노드 사이에 연결합니다: `model` 입력은 `UNETLoader`에서 모델을 받고, `model` 출력은 `BasicGuider`의 `model` 입력에 연결합니다. `sage_attention`을 `auto`로 설정하세요.
4. 평소처럼 워크플로를 실행합니다. 패치가 필요한 것은 guider뿐입니다. scheduler는 시그마를 생성할 뿐이므로 그대로 두면 됩니다.

참고:

- Sage Attention은 float16 또는 bfloat16 텐서가 필요합니다. MiniMax H3의 일부 레이어는 다른 dtype으로 실행되므로 콘솔에 "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead" 메시지가 표시될 수 있습니다. 이는 정상입니다. 영향을 받는 레이어는 표준 어텐션으로 대체되며 생성은 계속 정상 작동합니다.
- 또는 노드를 추가하는 대신 `--use-sage-attention` 플래그로 ComfyUI를 시작하여 Sage Attention을 전역적으로 활성화할 수도 있습니다.

## ComfyUI 기본 워크플로

### MiniMax H3 텍스트 기반 비디오 생성 (T2V)
Expand Down Expand Up @@ -263,9 +250,22 @@ ComfyUI/
2. **각 레퍼런스에 역할 지정**: 어떤 레퍼런스가 샷의 어떤 부분(정체성, 스타일, 모션, 카메라, 음성)을 담당하는지 명시합니다. 명시적인 지정이 훨씬 잘 작동하는 경향이 있습니다.
3. **제한 사항**: 최대 9개의 레퍼런스 이미지, 3개의 레퍼런스 비디오(각각 자체 사운드트랙 포함 가능), 3개의 독립 레퍼런스 오디오 클립을 사용할 수 있습니다.
4. **ref_image_size**: `match`는 속도를 위해 레퍼런스를 생성 해상도로 축소하고, `max`는 속도를 희생하더라도 더 강한 정체성 충실도를 위해 최대 2048px 단변을 유지합니다.
5. **샘플러**: `res_multistep` 샘플러에 `beta` 또는 `normal` 스케줄러를 사용하면 레퍼런스가 많은 프롬프트에서 `simple`보다 좋은 결과를 내는 경향이 있습니다.
6. **참고**: R2V는 T2V 및 I2V 워크플로에서 사용하는 `fl2va` 모델과 다른 가중치 세트인 `ref2va` 디퓨전 모델을 사용합니다.
5. **참고**: R2V는 T2V 및 I2V 워크플로에서 사용하는 `fl2va` 모델과 다른 가중치 세트인 `ref2va` 디퓨전 모델을 사용합니다.

#### 프롬프트 작성 가이드

MiniMax는 레퍼런스 기반 생성(R2V)을 위한 공식 [전체 참조 모드 프롬프트 가이드](https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md)를 제공합니다. 이 가이드는 재작성 출력 구조(주제 정의, 레퍼런스 라벨, 보존 분석)와 각 레퍼런스에 대상 샷에서의 역할을 지정하는 방법을 설명합니다.

## Sage Attention으로 생성 가속화

예제 워크플로는 기본적으로 표준 어텐션 구현을 사용합니다. [Sage Attention](https://github.com/woct0rdho/SageAttention)을 사용하면 품질 손실을 최소화하면서 생성 속도를 약 2배 높일 수 있습니다. Sage Attention은 선택적 의존성으로, 직접 설치해야 합니다:

1. `sageattention` Python 패키지를 설치합니다. [SageAttention releases](https://github.com/woct0rdho/SageAttention/releases) 페이지에서 자신의 PyTorch 및 CUDA 버전과 일치하는 wheel 파일을 다운로드한 후 `pip install <wheel-file>`로 설치합니다.
2. `Patch Sage Attention KJ` 노드를 제공하는 [KJNodes 커스텀 노드](https://github.com/kijai/ComfyUI-KJNodes)를 설치합니다. ComfyUI Manager를 사용하거나, 리포지토리를 `ComfyUI/custom_nodes/`에 클론한 후 ComfyUI를 다시 시작하세요.
3. 워크플로에 `Patch Sage Attention KJ` 노드를 추가하고 `UNETLoader`와 `BasicGuider` 노드 사이에 연결합니다: `model` 입력은 `UNETLoader`에서 모델을 받고, `model` 출력은 `BasicGuider`의 `model` 입력에 연결합니다. `sage_attention`을 `auto`로 설정하세요.
4. 평소처럼 워크플로를 실행합니다. 패치가 필요한 것은 guider뿐입니다. scheduler는 시그마를 생성할 뿐이므로 그대로 두면 됩니다.

참고:

- Sage Attention은 float16 또는 bfloat16 텐서가 필요합니다. MiniMax H3의 일부 레이어는 다른 dtype으로 실행되므로 콘솔에 "Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead" 메시지가 표시될 수 있습니다. 이는 정상입니다. 영향을 받는 레이어는 표준 어텐션으로 대체되며 생성은 계속 정상 작동합니다.
- 또는 노드를 추가하는 대신 `--use-sage-attention` 플래그로 ComfyUI를 시작하여 Sage Attention을 전역적으로 활성화할 수도 있습니다.
Loading
Loading