Так, обещал рассказать про свой сетап для кодинга на картофеле (Артем, привет!)
Дано: RTX4080, 16Gb
Хотим: Claude для нищебродов
Модель: LuffyTheFox/Qwen3.5-35B-A3B-Uncensored-FernflowerAI-GGUF
Это Qwen 35b, с снятой цензурой и фиксом весов, влазит в 16 с 128к контекстом, тк активно всего 3b
Квант: Q4-K-L В 3 битах будет быстрее, но хуже.
Мой Темплейт (с вшитым систем промптом )
Промпт длинный, суть: Краткость. Честность. Не пиздеть.
Краткость важна для экономии контекста - вы будете в него упираться но лонгранах
Фреймворк инференса: llama.cpp
Строка запуска (под программирование):
Под ролеплей или творчество надо менять и промпт и креативность
Фреймворк для кодинга: opeclaude
Настройки opeclaude - в .bashrc добавить
export CLAUDE_CODE_USE_OPENAI=1
export OPENAI_API_KEY="1"
export OPENAI_BASE_URL=https://localhost:8001/v1
Пример сценария-диалога как закодить че-ть ненужное:
- скачай репу и перейди в папку А
- сделай бренч Б и переключись на него
- создай venv и установи зависимости
- изучи проект и составь отчет - сохрани как report.md
- мне надо сделать то то примерно так то - составь план работ!
- сохрани план работ в plan.md
- начинай работу согласно плана, пункт за пунктом
- сука, стой. Нет. Нет. Не надо так. СТООЙ!
- Ща сам напишу
- Я там написал говно какое то перепиши придерживаясь KISS
- проведи код ревью всех изменений
- напиши детальное описание/иснтрукцию как запустить, что делалось зачем, как и в каких местах менялось
- сохрани как ридми.мд
- напиши тесты и запускай, один за одним
Квен не Клод, Нужен контроль, код ревью и желательно читать что он планирует делатького мы обманываем? .
По началу прикольно, потом начинает бесить
Кодит в целом на отвали, но быстро! И правит и так по кругу. Склонен сразу делать дичь, не подумав
Но из того что перепробовал (на 16 Гб) эта сборка пока лучшая
Дано: RTX4080, 16Gb
Хотим: Claude для нищебродов
Модель: LuffyTheFox/Qwen3.5-35B-A3B-Uncensored-FernflowerAI-GGUF
Это Qwen 35b, с снятой цензурой и фиксом весов, влазит в 16 с 128к контекстом, тк активно всего 3b
Квант: Q4-K-L В 3 битах будет быстрее, но хуже.
Мой Темплейт (с вшитым систем промптом )
Промпт длинный, суть: Краткость. Честность. Не пиздеть.
Краткость важна для экономии контекста - вы будете в него упираться но лонгранах
Фреймворк инференса: llama.cpp
Строка запуска (под программирование):
nohup ./llama-server --port 8001 --host 0.0.0.0 --model models/q35-35-a3b/FernflowerAI.Q4_K_L.gguf --ctx-size 131072 --temp 0.6 --top-p 0.95 --min-p 0 --top-k 20 --jinja --chat-template-file models/q35-35-a3b/temp.jinja --reasoning on &
Под ролеплей или творчество надо менять и промпт и креативность
Фреймворк для кодинга: opeclaude
Настройки opeclaude - в .bashrc добавить
export CLAUDE_CODE_USE_OPENAI=1
export OPENAI_API_KEY="1"
export OPENAI_BASE_URL=https://localhost:8001/v1
Пример сценария-диалога как закодить че-ть ненужное:
- скачай репу и перейди в папку А
- сделай бренч Б и переключись на него
- создай venv и установи зависимости
- изучи проект и составь отчет - сохрани как report.md
- мне надо сделать то то примерно так то - составь план работ!
- сохрани план работ в plan.md
- начинай работу согласно плана, пункт за пунктом
- сука, стой. Нет. Нет. Не надо так. СТООЙ!
- Ща сам напишу
- Я там написал говно какое то перепиши придерживаясь KISS
- проведи код ревью всех изменений
- напиши детальное описание/иснтрукцию как запустить, что делалось зачем, как и в каких местах менялось
- сохрани как ридми.мд
- напиши тесты и запускай, один за одним
Квен не Клод, Нужен контроль, код ревью и желательно читать что он планирует делать
По началу прикольно, потом начинает бесить
Кодит в целом на отвали, но быстро! И правит и так по кругу. Склонен сразу делать дичь, не подумав
Но из того что перепробовал (на 16 Гб) эта сборка пока лучшая
🤯5🍌3
Не могу пройти босса
Остался последний уровень - мелкие детали. Издалека вроде все неплохо, но при приближении видно что изображение как бы из маленьких "лоскутков"
Есть гипотеза что 8бит адам округляет мелкие шаги, а на "взрослого" адама - памяти не хватает.
Извращаюсь с миксед пресижен - мб в бф16 как раз модель будет лояльнее к этим микрописькам
Тяжело учить фронтир на 4090
https://huggingface.co/AiArtLab/sdxs-1b
Остался последний уровень - мелкие детали. Издалека вроде все неплохо, но при приближении видно что изображение как бы из маленьких "лоскутков"
Есть гипотеза что 8бит адам округляет мелкие шаги, а на "взрослого" адама - памяти не хватает.
Извращаюсь с миксед пресижен - мб в бф16 как раз модель будет лояльнее к этим микрописькам
Тяжело учить фронтир на 4090
https://huggingface.co/AiArtLab/sdxs-1b
Арендуем ГПУ
Где: в целом есть 3 рыбных места
runpod.io - дешевые диски, дорогие ГПУ - есть смысл если у вас датасеты несколько Тб и выше
clore.ai - дешевые пользовательские машины, сам я им не пользовался но говорят при везении можно взять недорого и надежную. Но будет обидно если вылетит
vast.ai - до 2 раз дешевле ранпод, но почти вдвое дороже clore - золотая середина - отличное качество за приемлемые деньги - я сижу тут (реклама: моя реф ссылка на васт https://cloud.vast.ai/?ref_id=152324 - мне перепадет немного)
Что: самые топовые ГПУ по соотношению цена/качество это 4090 и 5090. Соотвественно 24 и 32ГБ
Более старые/серверные тачки могут быть дешевле, но на круг выйдет дороже. Тупо сделаете меньше step на те же деньги. 4080/5080 - отличаются не только памятью (16), но и худшим TFLOPS. 3090/A100 - да и вся линейка Ada - очень устарела - они дико медленные
Страна: CN - самые дешевые, но почти всегда доступа к HF либо нет, либо очень медленный. Остальные страны надо проверять.
Цена за трафик: эта стоимость не включена в цену, но может очень варьироваться - от долларов до центов за Тб. Есть жулики кот ставят низкую цену и десятки долларов за Тб - будьте бдительны
Диск: цена также очень вариативна - но она включены и вы видите совокупную стоимость. Но. Смотрите на пропускную способность - она мб например 400 MB/s или 4000 MB/s - при одной и той же цене. Плохой диск - упретесь в него
Шина: PCIE 4.0,16x вдвое быстрее PCIE 4.0,8x и так далее - шина очень важна если обучении на мультиГПУ. Дешевые тачки обернутся бОльшими затратами. Но. На одной ГПУ - пофиг - можно съэкономить
DLPerf: это совокупный синтетический параметр перфоманса который считает vast - смело можете ориентироваться на него и тупо брать бОльший, например по DLPerf/$/Hour Но есть нюансы
Max CUDA: я беру от 12.8 для посл поколения (5090) по скорости она не ниже 13. На предпоследнем может быть уместна и 12.4 (она мб медленее но потреблять чуть меньше памяти)
Статус: deverified тачки обычно мёртвые, unverified - примерно 1 из 5 мб удачной. По цене они сильно ниже. Но может начать вылетать на третий день (verified тоже могут, но реже)
Остальные параметры пофиг
Далее
Проверьте куда - посмотрите какая куда активна в системе ls /etc/alternatives/cuda -l или update-alternatives --config cuda Нет смысла ставить куда выше чем поддерживает ваш драйвер (nvidia-smi) - работать будет хуже в лучшем случае
Обновите торч - pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu130 -U где cu130/128 - ваша куда. Торч должен быть под куду
Проверьте скорость - запустите инференс - например sdxs генерит картинку за sec примерно и бывали тачки с хорошими характеристиками но они генерили за 4 сек.
Собственно всё - проверьте скорость скачивания и запускайте трейн
Вы великолепны!
Где: в целом есть 3 рыбных места
runpod.io - дешевые диски, дорогие ГПУ - есть смысл если у вас датасеты несколько Тб и выше
clore.ai - дешевые пользовательские машины, сам я им не пользовался но говорят при везении можно взять недорого и надежную. Но будет обидно если вылетит
vast.ai - до 2 раз дешевле ранпод, но почти вдвое дороже clore - золотая середина - отличное качество за приемлемые деньги - я сижу тут (реклама: моя реф ссылка на васт https://cloud.vast.ai/?ref_id=152324 - мне перепадет немного)
Что: самые топовые ГПУ по соотношению цена/качество это 4090 и 5090. Соотвественно 24 и 32ГБ
Более старые/серверные тачки могут быть дешевле, но на круг выйдет дороже. Тупо сделаете меньше step на те же деньги. 4080/5080 - отличаются не только памятью (16), но и худшим TFLOPS. 3090/A100 - да и вся линейка Ada - очень устарела - они дико медленные
Страна: CN - самые дешевые, но почти всегда доступа к HF либо нет, либо очень медленный. Остальные страны надо проверять.
Цена за трафик: эта стоимость не включена в цену, но может очень варьироваться - от долларов до центов за Тб. Есть жулики кот ставят низкую цену и десятки долларов за Тб - будьте бдительны
Диск: цена также очень вариативна - но она включены и вы видите совокупную стоимость. Но. Смотрите на пропускную способность - она мб например 400 MB/s или 4000 MB/s - при одной и той же цене. Плохой диск - упретесь в него
Шина: PCIE 4.0,16x вдвое быстрее PCIE 4.0,8x и так далее - шина очень важна если обучении на мультиГПУ. Дешевые тачки обернутся бОльшими затратами. Но. На одной ГПУ - пофиг - можно съэкономить
DLPerf: это совокупный синтетический параметр перфоманса который считает vast - смело можете ориентироваться на него и тупо брать бОльший, например по DLPerf/$/Hour Но есть нюансы
Max CUDA: я беру от 12.8 для посл поколения (5090) по скорости она не ниже 13. На предпоследнем может быть уместна и 12.4 (она мб медленее но потреблять чуть меньше памяти)
Статус: deverified тачки обычно мёртвые, unverified - примерно 1 из 5 мб удачной. По цене они сильно ниже. Но может начать вылетать на третий день (verified тоже могут, но реже)
Остальные параметры пофиг
Далее
Проверьте куда - посмотрите какая куда активна в системе ls /etc/alternatives/cuda -l или update-alternatives --config cuda Нет смысла ставить куда выше чем поддерживает ваш драйвер (nvidia-smi) - работать будет хуже в лучшем случае
Обновите торч - pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu130 -U где cu130/128 - ваша куда. Торч должен быть под куду
Проверьте скорость - запустите инференс - например sdxs генерит картинку за sec примерно и бывали тачки с хорошими характеристиками но они генерили за 4 сек.
Собственно всё - проверьте скорость скачивания и запускайте трейн
Вы великолепны!
🐳6👀4👻2
Both my wife and son agree, my likeness is captured faster and better by the Rose optimizer.
Честно говоря я обожаю такие посты - типа я сделал новый оптимизатор который очень нравится моей маме
Но знаете что? Он прогнал на ГПТ-2 ОпенАи челендж и выглядит весьма неплохо
Решил попробовать - и он как минимум работает.
Rose - это очень простой и компактный (до дебильного) оптимизатор
По памяти жрет около адафактор - чуть меньше адамв8бит.
ЗЫ: Я делал с мюончиком адам8бит - https://github.com/recoilme/muon_adamw8bit - говно получилось - тренит бодро но анатомию руинит. Адам-мини еще попробовал - тож не работает с юнет (ну я запустить-запустил сунув в него только 2д матрицы - но он треснул по памяти)
🍌4
Хотя старый добрый адафактор тоже неплох (между картинками 3 часа на 1x4090 / 5000 step)
To be, or.. be horse!
Чувак собрал на коленке диффузионку для текстов и обучил на макбук эир (Шекспир)
https://www.reddit.com/r/MachineLearning/comments/1srufft/bulding_my_own_diffusion_language_model_from/
Кода меньше чем в вашем последнем ДАГе
Многие думают что это некст биг финк
А вот тут веса унисекс диффузии показывают
https://huggingface.co/inclusionAI/LLaDA2.0-Uni
ЗЫ: "мамкин" оптимизатор Rose всё же сошел с дистанции. Лосс пошел вверх, фокус не удался
Чувак собрал на коленке диффузионку для текстов и обучил на макбук эир (Шекспир)
https://www.reddit.com/r/MachineLearning/comments/1srufft/bulding_my_own_diffusion_language_model_from/
Кода меньше чем в вашем последнем ДАГе
Многие думают что это некст биг финк
А вот тут веса унисекс диффузии показывают
https://huggingface.co/inclusionAI/LLaDA2.0-Uni
ЗЫ: "мамкин" оптимизатор Rose всё же сошел с дистанции. Лосс пошел вверх, фокус не удался
Reddit
From the MachineLearning community on Reddit
Explore this post and more from the MachineLearning community
Пиксель диффужен (без вае)
https://huggingface.co/nvidia/PixelDiT-1300M-1024px
Хотел написать разбор, но передумал
Это проект тех же людей что делали pixart/sana /dc-ae и прочие сомнительные штуки
Я не верю ни в этих людей ни в эту команду ни единому слову в их папире
Как обычно манипуляции домыслы и крики СОТА
Недолюблюваю их всей душой. Тем не менее оно работает - и инференс довольно быстрый
Обучать не пробовал потому что не хочу чинить их лютый говнокод и нет доверия. Предполагаю что обучка в пиксельспейс будет жрать память как не в себя но могу и ошибаться - мб все и не так плохо - проверьте сами
Сота или нет - я не знаю По картинкам вроде как нет - но по папире да
Обучку на имаджнет я не дергал - так как считаю что это не говорит ничего о том способна ли модель сгенерить BMW
Промпты для теста брал отсюда
https://huggingface.co/AiArtLab/sdxs-1b#samples-with-seed-0-and-good-prompts
https://huggingface.co/nvidia/PixelDiT-1300M-1024px
Хотел написать разбор, но передумал
Это проект тех же людей что делали pixart/sana /dc-ae и прочие сомнительные штуки
Я не верю ни в этих людей ни в эту команду ни единому слову в их папире
Как обычно манипуляции домыслы и крики СОТА
Недолюблюваю их всей душой. Тем не менее оно работает - и инференс довольно быстрый
Обучать не пробовал потому что не хочу чинить их лютый говнокод и нет доверия. Предполагаю что обучка в пиксельспейс будет жрать память как не в себя но могу и ошибаться - мб все и не так плохо - проверьте сами
Сота или нет - я не знаю По картинкам вроде как нет - но по папире да
Обучку на имаджнет я не дергал - так как считаю что это не говорит ничего о том способна ли модель сгенерить BMW
Промпты для теста брал отсюда
https://huggingface.co/AiArtLab/sdxs-1b#samples-with-seed-0-and-good-prompts
🐳2😱1
Получили микро грант от banodoco
Это такое комьюнити чуваков которые делают очень прикольный вижуал арт нейронками, проводят фесты и тп
Помимо этого они вкладывают в опенсурс и в экосистему на которой все это держится
Раньше я там тусил как артист а теперь пришел просить хелп как программист - такой вот круг
У них невероятно дружелюбное комьюнити и можно часами залипать в их дискорд
да думаю все знают их, не знаю зачем я это пишу - принесу тогда немношк видео
Это такое комьюнити чуваков которые делают очень прикольный вижуал арт нейронками, проводят фесты и тп
Помимо этого они вкладывают в опенсурс и в экосистему на которой все это держится
Раньше я там тусил как артист а теперь пришел просить хелп как программист - такой вот круг
У них невероятно дружелюбное комьюнити и можно часами залипать в их дискорд
да думаю все знают их, не знаю зачем я это пишу - принесу тогда немношк видео
🐳5🌚2