Tensor Banana

Запустил SDXL Turbo чисто на процессоре через OpenVINO (модель rupeshs/sdxl-turbo-openvino-int8). На CPU именно через OpenVINO - самая большая скорость, все остальные реализации в несколько раз медленнее: в Automatic1111 1.5 минуты на картинку, в stable-diffusion.cpp еще не тестил, но там тоже нет API.

Скорость генерации приемлимая (10-24s), качество почти приемлимое, намного лучше чем при использовании LCM lora. Базовое разрешение модели 512x512, но для портретов неплохо 512x768 2 steps. В 1 шаг много артефактов получается. TAESDXL не понравилась - тоже артефакты лезут.

Скорость генерации на Ryzen, 8 ядер:
512x512, 2 steps - 14s
512x768, 2 steps - 24s
Теперь хочу прикрутить fastsdcpu к SillyTavern именно на CPU, потому что GPU и так занят LLM, TTS и wav2lip.

В fastsdcpu нет API. В automatic1111 openVINO не поддерживается. В SD.Next есть поддержка OpenVINO для SDXL, но нет для SDXL Turbo. В openvinotoolkit webui SDXL Turbo работает, но использует ~60 GB RAM, использует особый python+torch и часто падает.

https://github.com/rupeshs/fastsdcpu

👍3

398 views18:59

Tensor Banana

Pink photoshoot (juggernautXL)

402 views20:40

Tensor Banana

0:12

This media is not supported in your browser

VIEW IN TELEGRAM

Скетч, генерация и анимация

🔥3

400 views21:26

Tensor Banana

0:14

This media is not supported in your browser

VIEW IN TELEGRAM

Взял картинку, сделал анимацию в Stable Video Diffusion с низким motion_bucket_id. Затем засунул в Silly tavern Wav2lip. Голос XTTSv2, стих от Mixtral, рифма моя.

В общем, теперь можно и с любой фоткой чатиться, если видео под рукой нет. Главное, чтобы в анимации было морганание и движение глаз, чтобы смотрелось реалистичнее.

👍4

498 viewsedited 19:19

Tensor Banana

0:18

This media is not supported in your browser

VIEW IN TELEGRAM

Нейронка для создания музыки по картинке Image 2 music.

Создаёт 10 секунд музыки, анализируя загруженную картинку и созданное описание. Описание можно изменять для изменения стиля или нужных инструментов.

https://huggingface.co/spaces/fffiloni/image-to-music-v2

🔥2

471 viewsedited 21:54

Tensor Banana

0:23

This media is not supported in your browser

VIEW IN TELEGRAM

Взял 10 секунд этого голоса и загнал в генератор речи XTTSv2. Для придания акцента установил язык на турецкий, а не на русский. Затем закинул полученное аудио в Wav2lip для синхронизации губ и видео 😁😁

😁5🔥1

505 viewsedited 15:28

Tensor Banana

Forwarded from VGTimes (Илья)