Spaces:
Paused
Paused
Disable xformers memory-efficient attention in VAE (unsupported on Blackwell/sm_120 GPUs)
Browse files- vae_wrapper.py +4 -4
vae_wrapper.py
CHANGED
|
@@ -15,7 +15,7 @@ def default(value, default_value):
|
|
| 15 |
|
| 16 |
def load_stable_model(model_path):
|
| 17 |
vae_model = StableDiffusionPipeline.from_pretrained(model_path)
|
| 18 |
-
vae_model.set_use_memory_efficient_attention_xformers(
|
| 19 |
return vae_model.vae
|
| 20 |
|
| 21 |
|
|
@@ -74,7 +74,7 @@ class VaeWrapper(nn.Module):
|
|
| 74 |
if latent_type == "stable":
|
| 75 |
vae_model = load_stable_model("stabilityai/stable-diffusion-x4-upscaler")
|
| 76 |
vae_model.enable_slicing()
|
| 77 |
-
vae_model.set_use_memory_efficient_attention_xformers(
|
| 78 |
self.down_factor = 4
|
| 79 |
elif latent_type == "video":
|
| 80 |
vae_model = AutoencoderKLTemporalDecoder.from_pretrained(
|
|
@@ -83,7 +83,7 @@ class VaeWrapper(nn.Module):
|
|
| 83 |
torch_dtype=torch.float16 if variant == "fp16" else torch.float32,
|
| 84 |
variant="fp16" if variant == "fp16" else None,
|
| 85 |
)
|
| 86 |
-
vae_model.set_use_memory_efficient_attention_xformers(
|
| 87 |
self.down_factor = 8
|
| 88 |
elif latent_type == "refiner":
|
| 89 |
vae_model = AutoencoderKL.from_pretrained(
|
|
@@ -92,7 +92,7 @@ class VaeWrapper(nn.Module):
|
|
| 92 |
revision=None,
|
| 93 |
)
|
| 94 |
vae_model.enable_slicing()
|
| 95 |
-
vae_model.set_use_memory_efficient_attention_xformers(
|
| 96 |
self.down_factor = 8
|
| 97 |
|
| 98 |
vae_model.eval()
|
|
|
|
| 15 |
|
| 16 |
def load_stable_model(model_path):
|
| 17 |
vae_model = StableDiffusionPipeline.from_pretrained(model_path)
|
| 18 |
+
vae_model.set_use_memory_efficient_attention_xformers(False)
|
| 19 |
return vae_model.vae
|
| 20 |
|
| 21 |
|
|
|
|
| 74 |
if latent_type == "stable":
|
| 75 |
vae_model = load_stable_model("stabilityai/stable-diffusion-x4-upscaler")
|
| 76 |
vae_model.enable_slicing()
|
| 77 |
+
vae_model.set_use_memory_efficient_attention_xformers(False)
|
| 78 |
self.down_factor = 4
|
| 79 |
elif latent_type == "video":
|
| 80 |
vae_model = AutoencoderKLTemporalDecoder.from_pretrained(
|
|
|
|
| 83 |
torch_dtype=torch.float16 if variant == "fp16" else torch.float32,
|
| 84 |
variant="fp16" if variant == "fp16" else None,
|
| 85 |
)
|
| 86 |
+
vae_model.set_use_memory_efficient_attention_xformers(False)
|
| 87 |
self.down_factor = 8
|
| 88 |
elif latent_type == "refiner":
|
| 89 |
vae_model = AutoencoderKL.from_pretrained(
|
|
|
|
| 92 |
revision=None,
|
| 93 |
)
|
| 94 |
vae_model.enable_slicing()
|
| 95 |
+
vae_model.set_use_memory_efficient_attention_xformers(False)
|
| 96 |
self.down_factor = 8
|
| 97 |
|
| 98 |
vae_model.eval()
|