whargarbl
651 subscribers
1.82K photos
193 videos
10 files
720 links
Последнее убежище кожанных мешков
Download Telegram
Так, обещал рассказать про свой сетап для кодинга на картофеле (Артем, привет!)

Дано: RTX4080, 16Gb
Хотим: Claude для нищебродов

Модель: LuffyTheFox/Qwen3.5-35B-A3B-Uncensored-FernflowerAI-GGUF
Это Qwen 35b, с снятой цензурой и фиксом весов, влазит в 16 с 128к контекстом, тк активно всего 3b
Квант: Q4-K-L В 3 битах будет быстрее, но хуже.

Мой Темплейт (с вшитым систем промптом )

Промпт длинный, суть: Краткость. Честность. Не пиздеть.
Краткость важна для экономии контекста - вы будете в него упираться но лонгранах

Фреймворк инференса: llama.cpp

Строка запуска (под программирование):
nohup ./llama-server --port 8001 --host 0.0.0.0 --model models/q35-35-a3b/FernflowerAI.Q4_K_L.gguf --ctx-size 131072 --temp 0.6 --top-p 0.95 --min-p 0 --top-k 20 --jinja --chat-template-file models/q35-35-a3b/temp.jinja --reasoning on &

Под ролеплей или творчество надо менять и промпт и креативность

Фреймворк для кодинга: opeclaude

Настройки opeclaude - в .bashrc добавить
export CLAUDE_CODE_USE_OPENAI=1
export OPENAI_API_KEY="1"
export OPENAI_BASE_URL=https://localhost:8001/v1

Пример сценария-диалога как закодить че-ть ненужное:

- скачай репу и перейди в папку А
- сделай бренч Б и переключись на него
- создай venv и установи зависимости
- изучи проект и составь отчет - сохрани как report.md
- мне надо сделать то то примерно так то - составь план работ!
- сохрани план работ в plan.md
- начинай работу согласно плана, пункт за пунктом
- сука, стой. Нет. Нет. Не надо так. СТООЙ!
- Ща сам напишу
- Я там написал говно какое то перепиши придерживаясь KISS
- проведи код ревью всех изменений
- напиши детальное описание/иснтрукцию как запустить, что делалось зачем, как и в каких местах менялось
- сохрани как ридми.мд
- напиши тесты и запускай, один за одним

Квен не Клод, Нужен контроль, код ревью и желательно читать что он планирует делать кого мы обманываем?.

По началу прикольно, потом начинает бесить

Кодит в целом на отвали, но быстро! И правит и так по кругу. Склонен сразу делать дичь, не подумав

Но из того что перепробовал (на 16 Гб) эта сборка пока лучшая
🤯5🍌3
A T-800 is preparing a meal in the kitchen

(треню дальше потихоньку)
🐳3
Протренил маленько на жирнющих картиночных ембедах и это прям хорошо "раскачало" веса. Как будто что то активировалось там - внутри

Воистину неисповедимы пути Господни
😱3🐳2👀1
Excuse me, Sir.. May your model generate a booba?
🍌7
Не могу пройти босса

Остался последний уровень - мелкие детали. Издалека вроде все неплохо, но при приближении видно что изображение как бы из маленьких "лоскутков"

Есть гипотеза что 8бит адам округляет мелкие шаги, а на "взрослого" адама - памяти не хватает.

Извращаюсь с миксед пресижен - мб в бф16 как раз модель будет лояльнее к этим микрописькам

Тяжело учить фронтир на 4090

https://huggingface.co/AiArtLab/sdxs-1b
Арендуем ГПУ

Где: в целом есть 3 рыбных места

runpod.io - дешевые диски, дорогие ГПУ - есть смысл если у вас датасеты несколько Тб и выше
clore.ai - дешевые пользовательские машины, сам я им не пользовался но говорят при везении можно взять недорого и надежную. Но будет обидно если вылетит
vast.ai - до 2 раз дешевле ранпод, но почти вдвое дороже clore - золотая середина - отличное качество за приемлемые деньги - я сижу тут (реклама: моя реф ссылка на васт https://cloud.vast.ai/?ref_id=152324 - мне перепадет немного)

Что: самые топовые ГПУ по соотношению цена/качество это 4090 и 5090. Соотвественно 24 и 32ГБ
Более старые/серверные тачки могут быть дешевле, но на круг выйдет дороже. Тупо сделаете меньше step на те же деньги. 4080/5080 - отличаются не только памятью (16), но и худшим TFLOPS. 3090/A100 - да и вся линейка Ada - очень устарела - они дико медленные

Страна: CN - самые дешевые, но почти всегда доступа к HF либо нет, либо очень медленный. Остальные страны надо проверять.

Цена за трафик: эта стоимость не включена в цену, но может очень варьироваться - от долларов до центов за Тб. Есть жулики кот ставят низкую цену и десятки долларов за Тб - будьте бдительны

Диск: цена также очень вариативна - но она включены и вы видите совокупную стоимость. Но. Смотрите на пропускную способность - она мб например 400 MB/s или 4000 MB/s - при одной и той же цене. Плохой диск - упретесь в него

Шина: PCIE 4.0,16x вдвое быстрее PCIE 4.0,8x и так далее - шина очень важна если обучении на мультиГПУ. Дешевые тачки обернутся бОльшими затратами. Но. На одной ГПУ - пофиг - можно съэкономить

DLPerf: это совокупный синтетический параметр перфоманса который считает vast - смело можете ориентироваться на него и тупо брать бОльший, например по DLPerf/$/Hour Но есть нюансы

Max CUDA: я беру от 12.8 для посл поколения (5090) по скорости она не ниже 13. На предпоследнем может быть уместна и 12.4 (она мб медленее но потреблять чуть меньше памяти)

Статус: deverified тачки обычно мёртвые, unverified - примерно 1 из 5 мб удачной. По цене они сильно ниже. Но может начать вылетать на третий день (verified тоже могут, но реже)

Остальные параметры пофиг

Далее

Проверьте куда - посмотрите какая куда активна в системе ls /etc/alternatives/cuda -l или update-alternatives --config cuda Нет смысла ставить куда выше чем поддерживает ваш драйвер (nvidia-smi) - работать будет хуже в лучшем случае

Обновите торч - pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu130 -U где cu130/128 - ваша куда. Торч должен быть под куду

Проверьте скорость - запустите инференс - например sdxs генерит картинку за sec примерно и бывали тачки с хорошими характеристиками но они генерили за 4 сек.

Собственно всё - проверьте скорость скачивания и запускайте трейн

Вы великолепны!
🐳6👀4👻2
Both my wife and son agree, my likeness is captured faster and better by the Rose optimizer.


Честно говоря я обожаю такие посты - типа я сделал новый оптимизатор который очень нравится моей маме

Но знаете что? Он прогнал на ГПТ-2 ОпенАи челендж и выглядит весьма неплохо

Решил попробовать - и он как минимум работает.

Rose - это очень простой и компактный (до дебильного) оптимизатор

По памяти жрет около адафактор - чуть меньше адамв8бит.

ЗЫ: Я делал с мюончиком адам8бит - https://github.com/recoilme/muon_adamw8bit - говно получилось - тренит бодро но анатомию руинит. Адам-мини еще попробовал - тож не работает с юнет (ну я запустить-запустил сунув в него только 2д матрицы - но он треснул по памяти)
🍌4
Хотя старый добрый адафактор тоже неплох (между картинками 3 часа на 1x4090 / 5000 step)
To be, or.. be horse!

Чувак собрал на коленке диффузионку для текстов и обучил на макбук эир (Шекспир)
https://www.reddit.com/r/MachineLearning/comments/1srufft/bulding_my_own_diffusion_language_model_from/

Кода меньше чем в вашем последнем ДАГе

Многие думают что это некст биг финк

А вот тут веса унисекс диффузии показывают
https://huggingface.co/inclusionAI/LLaDA2.0-Uni

ЗЫ: "мамкин" оптимизатор Rose всё же сошел с дистанции. Лосс пошел вверх, фокус не удался
Пиксель диффужен (без вае)

https://huggingface.co/nvidia/PixelDiT-1300M-1024px

Хотел написать разбор, но передумал

Это проект тех же людей что делали pixart/sana /dc-ae и прочие сомнительные штуки

Я не верю ни в этих людей ни в эту команду ни единому слову в их папире

Как обычно манипуляции домыслы и крики СОТА

Недолюблюваю их всей душой. Тем не менее оно работает - и инференс довольно быстрый

Обучать не пробовал потому что не хочу чинить их лютый говнокод и нет доверия. Предполагаю что обучка в пиксельспейс будет жрать память как не в себя но могу и ошибаться - мб все и не так плохо - проверьте сами

Сота или нет - я не знаю По картинкам вроде как нет - но по папире да

Обучку на имаджнет я не дергал - так как считаю что это не говорит ничего о том способна ли модель сгенерить BMW

Промпты для теста брал отсюда
https://huggingface.co/AiArtLab/sdxs-1b#samples-with-seed-0-and-good-prompts
🐳2😱1
Получили микро грант от banodoco

Это такое комьюнити чуваков которые делают очень прикольный вижуал арт нейронками, проводят фесты и тп

Помимо этого они вкладывают в опенсурс и в экосистему на которой все это держится

Раньше я там тусил как артист а теперь пришел просить хелп как программист - такой вот круг

У них невероятно дружелюбное комьюнити и можно часами залипать в их дискорд

да думаю все знают их, не знаю зачем я это пишу - принесу тогда немношк видео
🐳5🌚2