آموزش LLM و VLM
2.76K subscribers
40 photos
24 videos
19 files
102 links
آموزش تخصصی LLM و Hugging face

گروه مباحثه:

@llm_group
Download Telegram
https://jsai.ir/

فایل زیپ اشاره شده در ویدیوهای کورس prompt api مرورگر؛ ابتدای این سایت اضافه شد

https://jsai.ir/
🙏3
آموزش LLM و VLM
https://jsai.ir/ فایل زیپ اشاره شده در ویدیوهای کورس prompt api مرورگر؛ ابتدای این سایت اضافه شد https://jsai.ir/
مینی دوره ساخت هوش مصنوعی شخصی در مرورگر؛ برای معرفی قابلیت جدید مرورگرهاست، چیزی که بدون ابزار اضافی شما را قادر میکنه از LLM داخلی مرورگر سوال بپرسید؛ مثلا فقط با این چند خط کد js تو مرورگر کروم یا اج
البته به شرط داشتن سخت افزار و به روز بودن مرورگر


  //  Create Session: 
const session = await LanguageModel.create();

// Define the Question (Prompt)
const question = "پایتخت ایران کجاست؟ فقط نام شهر را بگو.";

console.log(`سؤال شما: ${question}`);

// Prompt the model:
const result = await session.prompt(question);

// Display the result
console.log("پاسخ هوش مصنوعی:", result);

ما اصلا فریم ورکی نیاز نیست نصب کنیم، خود مرورگرها اضافه کردند و بیشتر برای کلاینت ساید کارها جذابه...

مثالهاشم اینجاست:

https://jsai.ir/
5🙏3👍1
📢 اطلاعیه دوره Agentic AI

پس از برگزاری دوره‌های «LLM» و «VLM»، اکنون دوره جدید «Agentic AI» در آستانه انتشار قرار دارد.

این دوره که پیش‌تر به دلیل شرایط جنگی با تأخیر مواجه شده بود، اکنون در مراحل نهایی آماده‌سازی قرار دارد و آخرین جلسه آن روز شنبه ضبط خواهد شد.

🗓 زمان تقریبی انتشار: اواسط تیرماه

سرفصل‌های دوره:

🔹 Reflection
🔹 Tool Use
🔹 Planning
🔹 Multi-Agent Collaboration
🔹 Model Context Protocol (MCP)
🔹 Evaluation of Agentic Systems
🔹 CrewAI Framework
🔹 LangChain & LangGraph

در این دوره با مفاهیم، معماری‌ها، چارچوب‌ها و روش‌های عملی طراحی و توسعه Agentهای هوشمند آشنا خواهید شد و نحوه ساخت سیستم‌های Agentic مدرن را به‌صورت گام‌به‌گام فرا خواهید گرفت.

منتظر انتشار این دوره باشید.
71👍4🙏2
This media is not supported in your browser
VIEW IN TELEGRAM
آیا gzip می‌تواند یک مدل زبانی باشد؟

یک محقق کشف کرد که gzip — همان الگوریتم فشرده‌سازی قدیمی و ساده لینوکس — می‌تواند متن تولید کند؛ بدون هیچ شبکه عصبی، بدون وزن، بدون آموزش.
چطور؟
هر الگوریتم فشرده‌سازی در دلش یک مدل احتمالاتی پنهان دارد:
داده‌ای که «انتظارش را دارد» با بایت کمتری کُد می‌شود
داده غیرمنتظره بایت بیشتری می‌خواهد

پس می‌شود از این معیار به عنوان امتیازدهی استفاده کرد:
هر ادامه متنی که بهتر فشرده شود، «محتمل‌تر» است!
روش کار (gzipt):
۱. یک corpus (مثلاً متون شکسپیر) به gzip داده می‌شود
۲. یک prompt ورودی می‌گیرد
۳. با beam search روی توالی بایت‌ها جستجو می‌کند
۴. ادامه‌ای را انتخاب می‌کند که بهترین فشرده‌سازی را داشته باشد
نتیجه؟
خروجی کاملاً منسجم نیست، ولی به‌طور شگفت‌انگیزی ساختار زبان را درک کرده!
این ایده از مقاله‌ای با نام "Language Modeling is Compression" الهام گرفته که می‌گوید:
هر مدل پیش‌بینی، یک compressor است و هر compressor یک مدل پیش‌بینی.


بلاگ پست:
🔗 https://nathan.rs/posts/gzip-lm/

کد پروژه:
🔗 nathan.rs/posts/
23🔥7👍1🤔1
GLM-5.2 — قوی‌ترین مدل اوپن‌سورس تا امروز

شرکت Z.ai مدل GLM-5.2 رو منتشر کرد؛ 744 میلیارد پارامتر، کانتکست 1 میلیون توکن، و عملکرد مشابه Claude Opus 4.8 و GPT-5.5.

با Unsloth می‌تونید نسخه کوانتایز شده‌اش رو لوکال اجرا کنید — نسخه 2-bit فقط 245GB RAM نیاز داره و روی مک M-series یا ترکیب GPU+RAM کار می‌کنه.

سه حالت استدلال داره: بدون thinking، high و max.

🔗 مستندات: https://unsloth.ai/docs/models/glm-5.2
🤗 دانلود: https://huggingface.co/unsloth/GLM-5.2-GGUF
14👍4
Forwarded from Tensorflow(@CVision)
🔍 Agentic Resource Discovery (ARD)

یه استاندارد جدید و باز از Hugging Face (با همکاری Microsoft، Google، GoDaddy و دیگران) که لایه‌ی discovery رو برای ایجنت‌ها حل می‌کنه.

مشکل امروز اینه که ایجنت‌ها باید همه چیز رو از قبل بدونن — URL سرور MCP رو hardcode کنی، ابزارها رو از قبل install کنی، و همه چیز static باشه. با بزرگ‌شدن اکوسیستم، این روش دیگه scale نمی‌ده.

حالا ARD چی می‌کنه؟
— هر publisher یه فایل ai-catalog.json رو در یه مسیر well-known روی دامنه‌ش منتشر می‌کنه
— رجیستری‌ها اون رو ایندکس می‌کنن
— ایجنت به‌جای hardcode کردن، با intent جستجو می‌کنه و capability مناسب رو پیدا می‌کنه

# نمونه با HF CLI
hf discover search "Fine tune a language model"
hf discover search "Generate an image" --kind mcp

اکوسیستم Hugging Face یه reference implementation به اسم Discover Tool ارائه داده که به هزاران Skills، MCP Server و Spaces دسترسی می‌ده — و از طریق MCP هم قابل استفاده‌ست:
https://huggingface-hf-discover.hf.space/mcp

در واقع ARD مثل DNS برای ایجنت‌هاست — به‌جای اینکه بدونی کجا بری، بگی چی می‌خوای.

🔗 مستندات: agenticresourcediscovery.org

🤗بلاگ مرتبط:
https://huggingface.co/blog/agentic-resource-discovery-launch
7
مدل جدید Gemma4-12B Agentic v2 — یه ایجنت کدنویسی کامل روی سخت‌افزار شخصی

یه fine-tune قوی روی Gemma 4 12B که تمرکزش روی کدنویسی + استفاده از ابزار + کارهای چندمرحله‌ای (agentic) هست.



📊 عملکرد روی بنچمارک ایجنتیک (tau2-bench telecom):


➡️ تقریباً ۳.۵ برابر بهتر از مدل پایه در تسک‌های ایجنتیک (۵۵ به جای ۱۵ در بنچ مارک)



مدل پایه معمولاً توی تسک‌های چندمرحله‌ای زود تسلیم می‌شه و کار رو به انسان واگذار می‌کنه. این مدل یاد گرفته مثل یه دولوپر واقعی عمل کنه:

read → reason → act → verify

یعنی اول state رو بررسی می‌کنه، بعد تشخیص می‌ده، بعد fix می‌زنه، و در نهایت نتیجه رو verify می‌کنه — بدون hallucinate کردن مسیرها یا توابع ناموجود.



📦 سایزهای GGUF موجود:

- Q3_K_M → 5.7 GB (مناسب GPU های 8GB)
- Q4_K_M → 6.87 GB پیشنهادی
- Q6_K → 9.11 GB
- Q8_0 → 11.8 GB



اجرا با Ollama:
ollama run hf.co/yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF:Q4_K_M


🔗 https://huggingface.co/yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF
9
فاین تیون کردن مدل‌های MoE با یه خط کد، ۳.۷ برابر سریع‌تر!

اخیرا NVIDIA یه کتابخونه open-source معرفی کرده به اسم NeMo AutoModel که روی Transformers v5 هاگینگ‌فیس ساخته شده.

فقط یه خط import عوض می‌شه:
🔹 تا ۳.۷ برابر throughput بالاتر
🔹 تا ۳۲٪ حافظه GPU کمتر
🔹 امکان fine-tune مدل ۵۵۰B که با Transformers خالص اصلاً در حافظه جا نمی‌شه

سه تکنیک به کار برده:
Expert Parallelism، DeepEP fused dispatch، و TransformerEngine kernels.

اگه با مدل‌های MoE مثل Qwen3 یا DeepSeek کار می‌کنید، ارزش خوندن داره 👇

🔗 https://huggingface.co/blog/nvidia/accelerating-fine-tuning-nvidia-nemo-automodel
22
🗂️  تبدیل اسناد به چانک‌های آماده برای RAG با Chunkr
یه ابزار متن‌باز برای پردازش هوشمند اسناد؛ PDF، PowerPoint، Word و تصویر رو می‌گیره و خروجی ساختاریافته برای پایپ‌لاین‌های RAG و LLM تولید می‌کنه.
تحلیل لایه‌بندی سند با OCR و Bounding Box
خروجی HTML و Markdown ساختاریافته
پردازش با مدل‌های Vision-Language
Self-hosted با Docker Compose و پشتیبانی از LLMهای مختلف
🔗 مستندات: https://docs.chunkr.ai/pages/get-started/welcome
🐙 گیت‌هاب: https://github.com/lumina-ai-inc/chunkr
#RAG #LLM #OpenSource #DocumentAI
👍83
🦅 مدل Ornith-1.0 — مدل متن‌باز با قابلیت خودبهبودی برای Agentic Coding

یه خانواده مدل جدید از DeepReinforce که روی کدنویسی عاملی (Agentic Coding) تخصص داره. از نسخه 9B برای edge devices تا 397B در مقیاس frontier.

🧠 نوآوری اصلی: به‌جای اینکه scaffold کدنویسی رو انسان طراحی کنه، مدل با RL هم راه‌حل و هم scaffold رو خودش یاد می‌گیره و هر دو رو با هم بهینه می‌کنه — یعنی هر بار بهتر می‌شه.

📊 نسخه 35B چقدر قوی‌ه؟
با فقط 35 میلیارد پارامتر از مدل‌های 397B مثل Qwen3.5 پیشی می‌گیره:

در Terminal-Bench 2.1 → 64.4 (در برابر 53.5 از Qwen3.5-397B)

در SWE-Bench Verified → 75.6

🖥️ اجرا با Ollama:

ollama run ornith:35b



🔗 https://ollama.com/library/ornith:35b

🤗https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B-GGUF

#AgenticAI #OpenSource #LLM #CodingAgent #Ollama
5
🖼️ Krea 2 Turbo

مدل تولید تصویر اوپن‌سورس با ۱۲ میلیارد پارامتر

مجپوعه Krea AI اولین مدل بومی خودش رو منتشر کرد و وزن‌ها رو هم اوپن‌سورس کرده.

چرا جالبه؟
▸ تولید تصویر ۲K در ~۲ ثانیه روی GPU معمولی
▸ فقط ۸ inference step، بدون CFG
▸ رتبه اول بین لب‌های مستقل در لیدربورد Artificial Analysis
▸ اختلاف تنها ۰.۱۴ امتیاز با GPT Image در style fidelity


🔗 لینک‌ها
HuggingFace: https://huggingface.co/krea/Krea-2-Turbo
GitHub: https://github.com/krea-ai/krea-2
گزارش تکنیکال: https://www.krea.ai/blog/krea-2-technical-report
8
روش MiCA جایگزین قدرتمند LoRA در Fine-tuning

یه روش جدید به اسم MiCA یا (MinoCA Component Adaptation) به کتابخونه PEFT هاگینگ‌فیس اضافه شده و نتایجش چشمگیره.

ایده اصلی
تکنیک LoRA روی بخش‌هایی از مدل تمرکز می‌کنه که بیشترین استفاده رو دارن. MiCA برعکس عمل می‌کنه — روی فضاهای کمتر استفاده‌شده (minor singular subspace) تنظیم می‌کنه تا دانش جدید جذب بشه بدون اینکه دانش قبلی از بین بره.

نتایج روی ۳ مدل مختلف:
📈 +۸۸٪ یادگیری دانش جدید نسبت به LoRA
🧠 -۱۹٪ فراموشی فاجعه‌بار (Catastrophic Forgetting)
-۸۳٪ پارامتر قابل آموزش


استفاده ازش ساده‌ست. فقط یه خط تغییر کافیه:
init_lora_weights="mica"
کاربرد اصلی:

به‌خصوص برای continued pretraining و domain adaptation — جایی که می‌خواید مدل دانش جدید یاد بگیره ولی توانایی‌های قبلیش رو حفظ کنه.


🔗 لینک‌ها:
📄 Paper (arXiv): https://arxiv.org/abs/2604.01694
🤗 HuggingFace: https://huggingface.co/papers/2604.01694
💻 PEFT Example & README: https://github.com/huggingface/peft/blob/main/examples/mica_finetuning/README.md
21👍3
Forwarded from Tensorflow(@CVision)
📊 بهره‌وری توکن در Agent Arena

بنچ مارک Agent Arena عملکرد ایجنت‌های هوش مصنوعی رو روی تسک‌های واقعی (نوشتن کد، ساخت اسلاید، تحقیق وب، توسعه اپ، تحلیل اسناد) با ابزارهای search، filesystem و terminal می‌سنجه.

نکته کلیدی اینه که مصرف توکن بیشتر همیشه به کیفیت بهتر منجر نمی‌شه. این نمودار هر مدل را نشون می‌ده
بهبود عملکرد (عمودی) در برابر میانه توکن مصرفی (افقی) — و یک خط روند کلی ترسیم می‌کنه. فاصله از این خط، بخش جالب ماجراست.

یافته‌ها:

مدل Opus با توکن کمتر کیفیت بالاتری می‌ده. Fable با +۱۴.۱٪ بهترین کیفیت رو داره، در برابر +۹.۲٪ برای Opus 4.8 Thinking با مصرف توکن مشابه.

هر سه مدل GPT-5.5 (بین +۶.۲٪ تا +۸.۶٪) بالای خط بهره‌وری قرار دارن، با توکن کمتر از مدل‌های پیشروی Claude.

مدل GLM-5.2 با +۵.۱٪ تقریباً دقیق روی خط روند قرار می‌گیره.

⚠️ توکن مساوی بازده نیست: Gemini-3.5 Flash بیشترین توکن رو مصرف می‌کنه ولی فاصله زیادی تا فرانتیر داره، و Grok Build 0.1 با ۲۰هزار+ توکن، بهبود منفی نشون می‌ده.

⚠️ گوشه پایین-چپ (مصرف کم، بازده کم): Grok-4.3، Nemotron 3 Ultra و Gemma-4 31B.

@cvision
14
This media is not supported in your browser
VIEW IN TELEGRAM
مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگ‌ترین گلوگاه‌های مدل‌های Vision-Language

مدل جدید LocateAnything انویدیا مشکل کندی مدل‌های تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).

مسئله چی بود؟ مدل‌های VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و به‌صورت متوالی تولید می‌کنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیش‌بینی می‌شن، کاهش دقت هندسی.

راه‌حل PBD: کل باکس به‌عنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیش‌بینی می‌شه، نه توکن به توکن. این کار هم‌زمانی همون‌قدر که سرعت رو بالا می‌بره، دقت رو هم بهتر می‌کنه چون چهار مختصه با آگاهی از هم پیش‌بینی می‌شن (نه کور و مستقل).

📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf

🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/

💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything

🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
18
مدل SenseNova-Vision-7B-MoT از تیم SenseNova

برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر می‌گیرن و متن تولید می‌کنن، این مدل هم متن تولید می‌کنه هم تصویر — یعنی می‌تونه خروجی‌هایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سه‌بعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه


- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کی‌پوینت

- تخمین عمق و نرمال سطح

- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)

- بازسازی هندسه چندنمایی و تخمین پوز دوربین


📊 عملکرد:

در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسک‌های تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.

البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقب‌تره — یعنی این مدل تخصصیِ کارهای ساختاریافته بینایی‌ست، نه مکالمه و استدلال عمومی.


🔗 مدل در هاگینگ فیس
🔗 گیت‌هاب
📄 مقاله

___
@llm_huggingface
@cvision
5
پارت ۱

تو دوره‌ی LLM مکتب‌خونه با مفهوم knowledge distillation آشنا شدیم؛ ایده‌ی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانش‌آموزِ کوچیک‌تر رو آموزش می‌ده تا رفتارش رو تقلید کنه.
اما واقعیت اینه که این روش خیلی متنوع‌تره. تو پست زیر نشون می‌ده مدل‌های فرانتیر ۲۰۲۶ دقیقاً از چه نسخه‌هایی از distillation استفاده می‌کنن:

1️⃣ معلم بزرگ و دانش‌آموز کوچیک (روش کلاسیک):
مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logit‌های معلم match می‌کنن (soft label) یا مستقیم روی متن تولیدشده‌ی معلم fine-tune می‌شن.
👍63