آموزش LLM و VLM
2.76K subscribers
40 photos
24 videos
19 files
102 links
آموزش تخصصی LLM و Hugging face

گروه مباحثه:

@llm_group
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
🎓 دوره جامع آموزش هوش مصنوعی مولد با مدل‌های زبانی بزرگ (LLM)

اگر می‌خواید بدونین مدل‌هایی مثل ChatGPT، Gemini یا Grok چطور ساخته می‌شن، چطور آموزش می‌بینن و چطور می‌تونن به زبان‌های مختلف از جمله فارسی پاسخ بدن، این دوره دقیقاً همون چیزیه که دنبالش هستین.

📚 در این دوره یاد می‌گیرین:
- مدل‌های زبانی بزرگ دقیقاً چی هستن و چطور کار می‌کنن
- مفاهیم پایه‌ای مثل زبان طبیعی، ترنسفورمر و attention
- مراحل آموزش مدل‌ها از pretraining تا fine-tuning
- روش‌های پیشرفته مثل instruction tuning، RLHF، DPO و GRPO

📂 به همراه حدود 20 نوت‌بوک پروژه‌محور و قابل اجرا
👨‍🏫 تدریس توسط مهندس علیرضا اخوان‌پور
💡 مناسب برای دانشجویان، پژوهشگران و علاقه‌مندان به AI و NLP


🔗 لینک دوره  |  📄سرفصلها 

🔥 برای اطلاع از  کدهای تخفیف، همین حالا عضو کانال تلگرام ما بشید:
👇👇👇
@llm_huggingface
👆👆👆

🎓ما رو تو اینستاگرام هم دنبال کنید...

https://www.instagram.com/class.vision

#llm #course #دوره #مدل_زبانی_بزرگ #هوش_مصنوعی #مکتب‌خونه #کلاس_ویژن #علیرضا_اخوان_پور
👍31
Media is too big
VIEW IN TELEGRAM
🌟 مدل‌های زبانی-تصویری (VLM)| مدرس: علیرضا اخوان‌پور

مدل‌های زبانی-تصویری (VLM) نسل جدیدی از مدل‌های مولد هستن که علاوه بر متن، تصویر رو هم می‌فهمن. یعنی می‌تونن عکس رو توصیف کنن، به سوال درباره‌ی محتواش جواب بدن و حتی بین متن و تصویر ارتباط برقرار کنن.

📚 در این دوره یاد می‌گیرید:

- ساختار و معماری مدل‌های VLM

- کاربردهای جذاب مثل پرسش‌وپاسخ تصویری و مولتی‌مودال

- نحوه‌ی آموزش و به‌کارگیری این مدل‌ها در پروژه‌های واقعی

🔗 مشاهده دوره:
https://mktb.me/e3gx/


~~~
کانال تلگرامی دوره
@llm_huggingface
👍3
مسیر حرفه‌ای یادگیری مدل‌های زبانی و چند وجهی
از Deep Learning تا LLM و VLM

اگر می‌خواهید به‌صورت اصولی وارد دنیای مدل‌های زبانی بزرگ و مدل‌های چندوجهی شوید، این مسیر آموزشی پیشنهاد می‌شود:

🧠 مرحله اول: دوره جامع Deep Learning


پایه‌ای‌ترین و ضروری‌ترین گام برای ورود حرفه‌ای به هوش مصنوعی.
شامل مفاهیم کلیدی یادگیری عمیق

🔗 لینک دوره: https://mktb.me/2klm/

🤖 مرحله دوم: دوره جامع LLM


اینجا قلب ماجرا است، در این دوره به‌صورت مفهومی و پروژه‌محور یاد می‌گیرید:

طراحی و آموزش مدل‌های زبانی بزرگ

مفاهیم کلیدی مثل Transformer، Attention، Instruction Tuning

روش‌های پیشرفته مثل RLHF، DPO، GRPO و RAG

ساخت اپلیکیشن‌های مبتنی بر LLM


🔗 لینک دوره: https://mktb.me/04dr/

🖼 مرحله سوم: دوره VLM (مدل‌های چندوجهی متن-تصویر)

اگر می‌خواهید فراتر از متن بروید و وارد دنیای مدل‌های بینایی-زبانی شوید، این مرحله مخصوص شماست.
در این دوره با معماری‌ها و کاربردهای VLM آشنا می‌شوید؛ مثل:

درک و تحلیل تصویر با مدل‌های چندوجهی

Visual QA

OCR و سیستم‌های ترکیبی متن-تصویر

فاین تیون VLM ها


🔗 لینک دوره: https://mktb.me/e3gx/
7
🎁🎊🎉به بهانه بلک فرایدی
برای همراهان کانال 👇

🎓 دوره جامع LLM
با تخفیف ۷۰٪ واقعی
🎟 بلیط ورود به دنیای مدل‌های زبانی بزرگ 🚀

کد تخفیف: COUPON-fa527
فقط برای مدت محدود - تا 10 آذرماه
https://mktb.me/04dr/
++++++++++++++++++
🎓 دوره جامع VLM – مدل‌های زبانی-تصویری

با تخفیف ۷۰٪ واقعی
🎟 ورود به دنیای مولتی‌مودال و AI ترکیبی 🚀

کد تخفیف: COUPON-0db40
فقط برای مدت محدود – تا 10 آذرماه
https://mktb.me/e3gx/
++++++++++++++++++

🎓 دوره جامع دیپ‌لرنینگ با TensorFlow
با تخفیف ۷۰٪ واقعی
🎟 یادگیری عملی شبکه‌های عصبی و پروژه‌های AI 🚀
کد تخفیف: COUPON-dc646
فقط برای مدت محدود – تا 10 آذرماه
https://mktb.me/2klm/
4👍4🤔2
🚀 Qwen3-VL Tech report is now out on arXiv!

From pretraining to post-training, architecture to infra, data to evaluation — we’ve packed in the details for anyone building on vision-language models.

🔥 3 models >1M downloads in just over a month
🏆 Qwen3-VL-8B leads with 2M+ downloads
📚 Built on the shoulders of Qwen2.5-VL (2800+ citations in <10 months!)

Check out the paper for insights, baselines, and future directions.
Let’s keep pushing VLMs forward — together.

arxiv.org/pdf/2511.21631
6
https://jsai.ir/

فایل زیپ اشاره شده در ویدیوهای کورس prompt api مرورگر؛ ابتدای این سایت اضافه شد

https://jsai.ir/
🙏3
آموزش LLM و VLM
https://jsai.ir/ فایل زیپ اشاره شده در ویدیوهای کورس prompt api مرورگر؛ ابتدای این سایت اضافه شد https://jsai.ir/
مینی دوره ساخت هوش مصنوعی شخصی در مرورگر؛ برای معرفی قابلیت جدید مرورگرهاست، چیزی که بدون ابزار اضافی شما را قادر میکنه از LLM داخلی مرورگر سوال بپرسید؛ مثلا فقط با این چند خط کد js تو مرورگر کروم یا اج
البته به شرط داشتن سخت افزار و به روز بودن مرورگر


  //  Create Session: 
const session = await LanguageModel.create();

// Define the Question (Prompt)
const question = "پایتخت ایران کجاست؟ فقط نام شهر را بگو.";

console.log(`سؤال شما: ${question}`);

// Prompt the model:
const result = await session.prompt(question);

// Display the result
console.log("پاسخ هوش مصنوعی:", result);

ما اصلا فریم ورکی نیاز نیست نصب کنیم، خود مرورگرها اضافه کردند و بیشتر برای کلاینت ساید کارها جذابه...

مثالهاشم اینجاست:

https://jsai.ir/
5🙏3👍1
📢 اطلاعیه دوره Agentic AI

پس از برگزاری دوره‌های «LLM» و «VLM»، اکنون دوره جدید «Agentic AI» در آستانه انتشار قرار دارد.

این دوره که پیش‌تر به دلیل شرایط جنگی با تأخیر مواجه شده بود، اکنون در مراحل نهایی آماده‌سازی قرار دارد و آخرین جلسه آن روز شنبه ضبط خواهد شد.

🗓 زمان تقریبی انتشار: اواسط تیرماه

سرفصل‌های دوره:

🔹 Reflection
🔹 Tool Use
🔹 Planning
🔹 Multi-Agent Collaboration
🔹 Model Context Protocol (MCP)
🔹 Evaluation of Agentic Systems
🔹 CrewAI Framework
🔹 LangChain & LangGraph

در این دوره با مفاهیم، معماری‌ها، چارچوب‌ها و روش‌های عملی طراحی و توسعه Agentهای هوشمند آشنا خواهید شد و نحوه ساخت سیستم‌های Agentic مدرن را به‌صورت گام‌به‌گام فرا خواهید گرفت.

منتظر انتشار این دوره باشید.
71👍4🙏2
This media is not supported in your browser
VIEW IN TELEGRAM
آیا gzip می‌تواند یک مدل زبانی باشد؟

یک محقق کشف کرد که gzip — همان الگوریتم فشرده‌سازی قدیمی و ساده لینوکس — می‌تواند متن تولید کند؛ بدون هیچ شبکه عصبی، بدون وزن، بدون آموزش.
چطور؟
هر الگوریتم فشرده‌سازی در دلش یک مدل احتمالاتی پنهان دارد:
داده‌ای که «انتظارش را دارد» با بایت کمتری کُد می‌شود
داده غیرمنتظره بایت بیشتری می‌خواهد

پس می‌شود از این معیار به عنوان امتیازدهی استفاده کرد:
هر ادامه متنی که بهتر فشرده شود، «محتمل‌تر» است!
روش کار (gzipt):
۱. یک corpus (مثلاً متون شکسپیر) به gzip داده می‌شود
۲. یک prompt ورودی می‌گیرد
۳. با beam search روی توالی بایت‌ها جستجو می‌کند
۴. ادامه‌ای را انتخاب می‌کند که بهترین فشرده‌سازی را داشته باشد
نتیجه؟
خروجی کاملاً منسجم نیست، ولی به‌طور شگفت‌انگیزی ساختار زبان را درک کرده!
این ایده از مقاله‌ای با نام "Language Modeling is Compression" الهام گرفته که می‌گوید:
هر مدل پیش‌بینی، یک compressor است و هر compressor یک مدل پیش‌بینی.


بلاگ پست:
🔗 https://nathan.rs/posts/gzip-lm/

کد پروژه:
🔗 nathan.rs/posts/
23🔥7👍1🤔1
GLM-5.2 — قوی‌ترین مدل اوپن‌سورس تا امروز

شرکت Z.ai مدل GLM-5.2 رو منتشر کرد؛ 744 میلیارد پارامتر، کانتکست 1 میلیون توکن، و عملکرد مشابه Claude Opus 4.8 و GPT-5.5.

با Unsloth می‌تونید نسخه کوانتایز شده‌اش رو لوکال اجرا کنید — نسخه 2-bit فقط 245GB RAM نیاز داره و روی مک M-series یا ترکیب GPU+RAM کار می‌کنه.

سه حالت استدلال داره: بدون thinking، high و max.

🔗 مستندات: https://unsloth.ai/docs/models/glm-5.2
🤗 دانلود: https://huggingface.co/unsloth/GLM-5.2-GGUF
14👍4
Forwarded from Tensorflow(@CVision)
🔍 Agentic Resource Discovery (ARD)

یه استاندارد جدید و باز از Hugging Face (با همکاری Microsoft، Google، GoDaddy و دیگران) که لایه‌ی discovery رو برای ایجنت‌ها حل می‌کنه.

مشکل امروز اینه که ایجنت‌ها باید همه چیز رو از قبل بدونن — URL سرور MCP رو hardcode کنی، ابزارها رو از قبل install کنی، و همه چیز static باشه. با بزرگ‌شدن اکوسیستم، این روش دیگه scale نمی‌ده.

حالا ARD چی می‌کنه؟
— هر publisher یه فایل ai-catalog.json رو در یه مسیر well-known روی دامنه‌ش منتشر می‌کنه
— رجیستری‌ها اون رو ایندکس می‌کنن
— ایجنت به‌جای hardcode کردن، با intent جستجو می‌کنه و capability مناسب رو پیدا می‌کنه

# نمونه با HF CLI
hf discover search "Fine tune a language model"
hf discover search "Generate an image" --kind mcp

اکوسیستم Hugging Face یه reference implementation به اسم Discover Tool ارائه داده که به هزاران Skills، MCP Server و Spaces دسترسی می‌ده — و از طریق MCP هم قابل استفاده‌ست:
https://huggingface-hf-discover.hf.space/mcp

در واقع ARD مثل DNS برای ایجنت‌هاست — به‌جای اینکه بدونی کجا بری، بگی چی می‌خوای.

🔗 مستندات: agenticresourcediscovery.org

🤗بلاگ مرتبط:
https://huggingface.co/blog/agentic-resource-discovery-launch
7
مدل جدید Gemma4-12B Agentic v2 — یه ایجنت کدنویسی کامل روی سخت‌افزار شخصی

یه fine-tune قوی روی Gemma 4 12B که تمرکزش روی کدنویسی + استفاده از ابزار + کارهای چندمرحله‌ای (agentic) هست.



📊 عملکرد روی بنچمارک ایجنتیک (tau2-bench telecom):


➡️ تقریباً ۳.۵ برابر بهتر از مدل پایه در تسک‌های ایجنتیک (۵۵ به جای ۱۵ در بنچ مارک)



مدل پایه معمولاً توی تسک‌های چندمرحله‌ای زود تسلیم می‌شه و کار رو به انسان واگذار می‌کنه. این مدل یاد گرفته مثل یه دولوپر واقعی عمل کنه:

read → reason → act → verify

یعنی اول state رو بررسی می‌کنه، بعد تشخیص می‌ده، بعد fix می‌زنه، و در نهایت نتیجه رو verify می‌کنه — بدون hallucinate کردن مسیرها یا توابع ناموجود.



📦 سایزهای GGUF موجود:

- Q3_K_M → 5.7 GB (مناسب GPU های 8GB)
- Q4_K_M → 6.87 GB پیشنهادی
- Q6_K → 9.11 GB
- Q8_0 → 11.8 GB



اجرا با Ollama:
ollama run hf.co/yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF:Q4_K_M


🔗 https://huggingface.co/yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF
9
فاین تیون کردن مدل‌های MoE با یه خط کد، ۳.۷ برابر سریع‌تر!

اخیرا NVIDIA یه کتابخونه open-source معرفی کرده به اسم NeMo AutoModel که روی Transformers v5 هاگینگ‌فیس ساخته شده.

فقط یه خط import عوض می‌شه:
🔹 تا ۳.۷ برابر throughput بالاتر
🔹 تا ۳۲٪ حافظه GPU کمتر
🔹 امکان fine-tune مدل ۵۵۰B که با Transformers خالص اصلاً در حافظه جا نمی‌شه

سه تکنیک به کار برده:
Expert Parallelism، DeepEP fused dispatch، و TransformerEngine kernels.

اگه با مدل‌های MoE مثل Qwen3 یا DeepSeek کار می‌کنید، ارزش خوندن داره 👇

🔗 https://huggingface.co/blog/nvidia/accelerating-fine-tuning-nvidia-nemo-automodel
22
🗂️  تبدیل اسناد به چانک‌های آماده برای RAG با Chunkr
یه ابزار متن‌باز برای پردازش هوشمند اسناد؛ PDF، PowerPoint، Word و تصویر رو می‌گیره و خروجی ساختاریافته برای پایپ‌لاین‌های RAG و LLM تولید می‌کنه.
تحلیل لایه‌بندی سند با OCR و Bounding Box
خروجی HTML و Markdown ساختاریافته
پردازش با مدل‌های Vision-Language
Self-hosted با Docker Compose و پشتیبانی از LLMهای مختلف
🔗 مستندات: https://docs.chunkr.ai/pages/get-started/welcome
🐙 گیت‌هاب: https://github.com/lumina-ai-inc/chunkr
#RAG #LLM #OpenSource #DocumentAI
👍83
🦅 مدل Ornith-1.0 — مدل متن‌باز با قابلیت خودبهبودی برای Agentic Coding

یه خانواده مدل جدید از DeepReinforce که روی کدنویسی عاملی (Agentic Coding) تخصص داره. از نسخه 9B برای edge devices تا 397B در مقیاس frontier.

🧠 نوآوری اصلی: به‌جای اینکه scaffold کدنویسی رو انسان طراحی کنه، مدل با RL هم راه‌حل و هم scaffold رو خودش یاد می‌گیره و هر دو رو با هم بهینه می‌کنه — یعنی هر بار بهتر می‌شه.

📊 نسخه 35B چقدر قوی‌ه؟
با فقط 35 میلیارد پارامتر از مدل‌های 397B مثل Qwen3.5 پیشی می‌گیره:

در Terminal-Bench 2.1 → 64.4 (در برابر 53.5 از Qwen3.5-397B)

در SWE-Bench Verified → 75.6

🖥️ اجرا با Ollama:

ollama run ornith:35b



🔗 https://ollama.com/library/ornith:35b

🤗https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B-GGUF

#AgenticAI #OpenSource #LLM #CodingAgent #Ollama
5