# MiniMax H3 (ComfyUI) R2V workflow with SLA sparse attention - 0.6MP 10s in 3m12s on RTX 3080 10GB

> Source: <https://gist.github.com/junzhisangcun/bb5b541d8d369636a075442dc69e14bd>
> Published: 2026-08-26 01:28:58+00:00

RTX 3080 10GB で 0.6MP・10秒の R2V が **3分12秒**で回る構成です。

**ComfyUI 0.33.0 以降**（動作確認は 0.33.1 / torch 2.13+cu130）

**カスタムノード**

```
cd ComfyUI/custom_nodes
git clone https://github.com/PlagueKind/ComfyUI-PlagueKind-Nodes
```

`H3SLAAttention`

を使うためのものです。MIT、Triton が必要（sageattention が入っていれば通常は入っています）。

**モデル**（すべて Comfy-Org/MiniMax-H3 から）

| ファイル | 置き場所 |
|---|---|
`minimax_h3_ref2va_pruned_int8_convrot.safetensors` |
`models/diffusion_models/` |
`qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors` |
`models/text_encoders/` |
`minimax_h3_video_vae_fp16.safetensors` |
`models/vae/` |
`minimax_h3_audio_vae_fp32.safetensors` |
`models/vae/` |

**turbo LoRA**（`models/loras/`

に置く）

- 4step:
[Kijai/MiniMax-H3_comfy](https://huggingface.co/Kijai/MiniMax-H3_comfy)の`minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy_resized_avg_rank_21_bf16.safetensors`

- 8step:
[drbaph/MiniMax-H3-Turbo-Lora-ComfyUI](https://huggingface.co/drbaph/MiniMax-H3-Turbo-Lora-ComfyUI)の`minimax_h3_turbo_4step_ckpt850_pruned_comfyui.safetensors`

```
--vram-headroom 2.0 --use-sage-attention --disable-pinned-memory
```

`--disable-pinned-memory`

は**強く推奨**します。無いと ComfyUI が RAM の40%をページアウト不能に固定し、バッチや構成切り替えで空きRAMが枯れて**同じ設定が4倍遅くなります**。GPU使用率100%・消費電力は定格のまま遅くなるので外形からは判りません。単発では10%遅くなりますが、その価値があります。

| 構成 | サンプリング | 総所要 |
|---|---|---|
| sage のみ・ckpt850 8step | 7分48秒 | 9分42秒 |
| sage + SLA・ckpt850 8step | 3分57秒 | 5分31秒 |
sage + SLA + nopin・lightx2v 4step |
2分03秒 |
3分12秒 |

同梱の JSON は最後の構成（lightx2v 4step）です。

| step | LoRA | sampler | |
|---|---|---|---|
| 静かなカット | 4 | lightx2v（strength 0.75） | `er_sde` |
| 動きのあるカット | 8 | ckpt850（strength 1.0） | `res_multistep` |

**速い動きは 4step で破綻します**（武器を薙ぐ、ダンス等）。8step で解消します。

| 項目 | 値 | 理由 |
|---|---|---|
| 配置 | チェーンの最後、Scheduler と Guider の両方に直結 |
作者の必須要件。外すと効かない |
| sparsity_ratio | 0.90 | break-even は 0.60。それ以下では密より遅い |
| block_size | 64 |
128 は台詞が robotic になる。H3 は音声を毎秒80行で詰めるため |
| protect_audio | オン |
音声は系列の約1%しかなく、切ると音だけ劣化する。コスト約7% |
| min_seq_len | 8192 | これ未満の系列は自動的に密に戻る（低解像度・短尺では効かない） |

効いているかは **stderr のログ**で確認できます。

```
SLA: 400 calls | S=49826 | blocks 151/779 kept (80.6% sparse) | 0 dense fall-throughs | displaced attention_sage
```

`displaced attention_pytorch`

と出たら sage が無効です。

`MiniMaxH3SigmaShift`

の音声側は **3.0** が正です。6.0 にすると 4step で音声を踏み越えてノイズになります。turbo 使用時の音声ノイズはほぼこれが原因です。

- プロンプト（プレースホルダが入っています）
`example_character.png`

/`example_background.png`

を自分の参照画像に- 出力先
`H3/output`

背景を固定したいカットが複数ある場合は、**背景の一枚絵を2枚目の参照に入れてください**。本文で空間を細かく書いても、参照が無いとカットごとに別の場所になります。
