یه مدل بنیادی (foundation model) جدید منتشر شده توسط گوگل برای داده های ساختار یافته، هم برای رگرسیون هم طبقه بندی قابل استفادست
TabFM: Tabular Foundation Models
https://github.com/google-research/tabfm
TabFM: Tabular Foundation Models
https://github.com/google-research/tabfm
❤10👍1
Tensorflow(@CVision)
یه مدل بنیادی (foundation model) جدید منتشر شده توسط گوگل برای داده های ساختار یافته، هم برای رگرسیون هم طبقه بندی قابل استفادست TabFM: Tabular Foundation Models https://github.com/google-research/tabfm
مدل بنیادی TabFM چطور کار میکنه؟
نکته جالب TabFM اینه که مسئله پیشبینی روی دادههای جدولی رو به یه مسئله In-Context Learning (ICL) تبدیل کرده - دقیقاً همون منطقی که مدلهای زبانی مثل GPT ازش استفاده میکنن.
تفاوت با روش سنتی: به جای اینکه برای هر دیتاست جدید یه مدل جدید train کنید (مثل XGBoost که باید hyperparameter tuning و feature engineering انجام بدید)، کل دیتاست (هم دادههای train و هم ردیفهای test) رو بهعنوان یه prompt واحد به مدل میدید و مدل توی یک forward pass پیشبینی میکنه. یعنی صفر تا صد zero-shot - بدون training، بدون tuning.
نحوهی آموزش: چون دیتاستهای جدولی باکیفیت و متنوع (به خاطر مالکیت خصوصی و حساسیت دادههای صنعتی) کمیابن، گوگل مدل رو کاملاً روی صدها میلیون دیتاست synthetic آموزش داده که با Structural Causal Models (SCM) تولید شدن.
نتایج: روی بنچمارک TabArena (۳۸ دیتاست classification و ۱۳ تا regression)، حتی در حالت zero-shot عملکردش با baseline های heavily-tuned مثل gradient-boosted trees قابل رقابته و با یه نسخه ensemble (ترکیب ۳۲ متغیر با NNLS solver و SVD features) نتایج بهتری هم میگیره.
دسترسی:
وزنها روی HuggingFace هم موجودن (نسخهی PyTorch و JAX/Flax)
به زودی از طریق BigQuery هم با یه دستور ساده
نکته جالب TabFM اینه که مسئله پیشبینی روی دادههای جدولی رو به یه مسئله In-Context Learning (ICL) تبدیل کرده - دقیقاً همون منطقی که مدلهای زبانی مثل GPT ازش استفاده میکنن.
تفاوت با روش سنتی: به جای اینکه برای هر دیتاست جدید یه مدل جدید train کنید (مثل XGBoost که باید hyperparameter tuning و feature engineering انجام بدید)، کل دیتاست (هم دادههای train و هم ردیفهای test) رو بهعنوان یه prompt واحد به مدل میدید و مدل توی یک forward pass پیشبینی میکنه. یعنی صفر تا صد zero-shot - بدون training، بدون tuning.
نحوهی آموزش: چون دیتاستهای جدولی باکیفیت و متنوع (به خاطر مالکیت خصوصی و حساسیت دادههای صنعتی) کمیابن، گوگل مدل رو کاملاً روی صدها میلیون دیتاست synthetic آموزش داده که با Structural Causal Models (SCM) تولید شدن.
نتایج: روی بنچمارک TabArena (۳۸ دیتاست classification و ۱۳ تا regression)، حتی در حالت zero-shot عملکردش با baseline های heavily-tuned مثل gradient-boosted trees قابل رقابته و با یه نسخه ensemble (ترکیب ۳۲ متغیر با NNLS solver و SVD features) نتایج بهتری هم میگیره.
دسترسی:
وزنها روی HuggingFace هم موجودن (نسخهی PyTorch و JAX/Flax)
به زودی از طریق BigQuery هم با یه دستور ساده
AI.PREDICT در SQL قابل استفاده میشه👌8❤6
This media is not supported in your browser
VIEW IN TELEGRAM
:
🚀 تشخیص و سگمنتیشن اشیاء Open-Set — بدون نیاز به آموزش مجدد!
مدلهای سریع و دقیقی مثل YOLO معمولاً محدود به یک سری دستهبندی از پیش تعریفشده هستن. تکنیکهای Open-Set این محدودیت رو برمیدارن، اما معمولاً سرعت رو فدا میکنن.
حالا با ترکیب سه رویکرد در یک سیستم یکپارچه و کارآمد، قابلیت «هر چیزی رو ببین» (See Anything) بهصورت real-time ممکن شده:
🔹 پرامپت متنی
🔹 پرامپت تصویری
🔹 تشخیص بدون پرامپت (Prompt-free)
✨ پرامپت تصویری (Visual Prompting)
فقط با یک نمونه تصویری ساده، مدل میتونه بلافاصله اشیاء مشابه رو تشخیص بده — بدون نیاز به آموزش مجدد و بدون نیاز به پرامپت متنی. این روش با افزودن اطلاعات به embedding های تصویری با پیچیدگی کم، امکان تطبیق سریع و آنی با اشیاء ناشناخته رو در محیطهای صنعتی و پویا فراهم میکنه.
🟠 کاربردها:
✅ خطوط تولید صنعتی — تطبیق آنی با محصولات جدید در حال حرکت
✅ نظارت تصویری — تشخیص پویای تهدیدات
✅ خردهفروشی — صندوق هوشمند برای هر نوع محصولی
✅ سلامت — کمک به تشخیص ناهنجاریها در لحظه
https://docs.ultralytics.com/models/yoloe
https://yolovx.com/
🚀 تشخیص و سگمنتیشن اشیاء Open-Set — بدون نیاز به آموزش مجدد!
مدلهای سریع و دقیقی مثل YOLO معمولاً محدود به یک سری دستهبندی از پیش تعریفشده هستن. تکنیکهای Open-Set این محدودیت رو برمیدارن، اما معمولاً سرعت رو فدا میکنن.
حالا با ترکیب سه رویکرد در یک سیستم یکپارچه و کارآمد، قابلیت «هر چیزی رو ببین» (See Anything) بهصورت real-time ممکن شده:
🔹 پرامپت متنی
🔹 پرامپت تصویری
🔹 تشخیص بدون پرامپت (Prompt-free)
✨ پرامپت تصویری (Visual Prompting)
فقط با یک نمونه تصویری ساده، مدل میتونه بلافاصله اشیاء مشابه رو تشخیص بده — بدون نیاز به آموزش مجدد و بدون نیاز به پرامپت متنی. این روش با افزودن اطلاعات به embedding های تصویری با پیچیدگی کم، امکان تطبیق سریع و آنی با اشیاء ناشناخته رو در محیطهای صنعتی و پویا فراهم میکنه.
🟠 کاربردها:
✅ خطوط تولید صنعتی — تطبیق آنی با محصولات جدید در حال حرکت
✅ نظارت تصویری — تشخیص پویای تهدیدات
✅ خردهفروشی — صندوق هوشمند برای هر نوع محصولی
✅ سلامت — کمک به تشخیص ناهنجاریها در لحظه
https://docs.ultralytics.com/models/yoloe
https://yolovx.com/
❤10
Forwarded from 🚀 کلاسویژن | یادگیری هوش مصنوعی از پایه تا پیشرفته
تمام ویدویهای دوره RNN-LSTM_GRU که چندماه پیش رایگان شده بود در لیست پخش آپارات نیز قرار داده شد
https://www.aparat.com/playlist/287685/
https://www.aparat.com/playlist/287685/
آپارات - سرویس اشتراک ویدیو
شبکههای بازگشتی در Tensorflow2.0 و Keras - لیست پخش
مصاحبه با شرکت کنندگان دوره دیپ لرنینگ,قسمت اول - مقدمات شبکههای بازگشتی (RNN),قسمت دوم - یک واحد بازگشتی ساده و شبکه بازگشتی,قسمت سوم - پیادهسازی تخمین تابع با شبکههای بازگشتی ساده,قسمت چهارم - طول دنباله متغیر در شبکه های بازگشتی (1),قسمت پنجم - طول…
👍8❤5
یادگیری ماشین؛ نسل جدید پیشبینی منحنی بازده و مدیریت مدتزمان
در بازارهایی مثل ایران که نرخهای بهره به محدودههای بالایی رسیدهاند، مدیریت مدتزمان و پیشبینی ساختار زمانی نرخها تبدیل به یکی از چالشهای اصلی فعالان حوزهٔ #ریسک، ALM و مدیریت پرتفوی شده است. در چنین محیطی، رفتار منحنی بازده بهشدت #غیر_خطی و حساس است و مدلهای سنتی همیشه پاسخگو نیستند.
بهعنوان کسی که سالها روی ساخت مدلهای دادهمحور و ابزارهای ML برای تحلیل بازارها کار کردهام، همیشه برایم مهم بوده که ببینم ترکیب مدلهای کلاسیک با معماریهای مدرن یادگیری ماشین تا چه حد میتواند در محیطهای با نرخ بهره بالا ارزش ایجاد کند.
اخیراً مقالهای با عنوان: Data-Driven Duration Management: Term Structure Forecasting Using Machine Learning از Tobias Lausser، Joao Eduardo Vuolo و Rudi Zagst منتشر شده که دقیقاً همین موضوع را بررسی میکند.
دو نکتهٔ کلیدی مقاله که برای بازار ایران اهمیت ویژه دارد:
برای بازار آمریکا: بهترین مدل، یک شبکهٔ عصبی direct forecasting است که
فاکتورهای DNS را برای کاهش ابعاد دادههای نرخ صفر استفاده میکند، و
یک Autoencoder را برای استخراج ویژگیهای کلان اقتصادی بهکار میگیرد. این ترکیب باعث میشود مدل هم ساختار منحنی را بهتر بفهمد و هم اثرات تورم، سیاست پولی و سیکلهای اقتصادی را بهصورت فشرده و بدون نویز وارد پیشبینی کند.
چرا این موضوع برای ایران مهم است؟
در محیطهایی با نرخ بهره بسیار بالا:
رفتار منحنی بازده بهشدت تحت تأثیر متغیرهای کلان است.
نویز دادهها زیاد است و کاهش ابعاد (DNS یا PCA) ضروری میشود.
استفاده از #Autoencoder برای استخراج ویژگیهای کلان میتواند کمک کند اثرات تورم، سیاستهای بانک مرکزی، نقدینگی و شوکهای اقتصادی بهشکل فشرده و قابلاستفاده وارد مدل شوند.
بهنظر من، این نوع رویکرد ترکیبی میتواند پایهٔ نسل جدید ابزارهای مدیریت ریسک و ساخت پرتفوی در بازارهای با نرخ بهره بالا باشد؛ مخصوصاً در ایران که دینامیکهای کلان نقش بسیار پررنگی در شکلگیری منحنی بازده دارند. https://www.linkedin.com/feed/update/urn:li:activity:7478336398442430464/
در بازارهایی مثل ایران که نرخهای بهره به محدودههای بالایی رسیدهاند، مدیریت مدتزمان و پیشبینی ساختار زمانی نرخها تبدیل به یکی از چالشهای اصلی فعالان حوزهٔ #ریسک، ALM و مدیریت پرتفوی شده است. در چنین محیطی، رفتار منحنی بازده بهشدت #غیر_خطی و حساس است و مدلهای سنتی همیشه پاسخگو نیستند.
بهعنوان کسی که سالها روی ساخت مدلهای دادهمحور و ابزارهای ML برای تحلیل بازارها کار کردهام، همیشه برایم مهم بوده که ببینم ترکیب مدلهای کلاسیک با معماریهای مدرن یادگیری ماشین تا چه حد میتواند در محیطهای با نرخ بهره بالا ارزش ایجاد کند.
اخیراً مقالهای با عنوان: Data-Driven Duration Management: Term Structure Forecasting Using Machine Learning از Tobias Lausser، Joao Eduardo Vuolo و Rudi Zagst منتشر شده که دقیقاً همین موضوع را بررسی میکند.
دو نکتهٔ کلیدی مقاله که برای بازار ایران اهمیت ویژه دارد:
برای بازار آمریکا: بهترین مدل، یک شبکهٔ عصبی direct forecasting است که
فاکتورهای DNS را برای کاهش ابعاد دادههای نرخ صفر استفاده میکند، و
یک Autoencoder را برای استخراج ویژگیهای کلان اقتصادی بهکار میگیرد. این ترکیب باعث میشود مدل هم ساختار منحنی را بهتر بفهمد و هم اثرات تورم، سیاست پولی و سیکلهای اقتصادی را بهصورت فشرده و بدون نویز وارد پیشبینی کند.
چرا این موضوع برای ایران مهم است؟
در محیطهایی با نرخ بهره بسیار بالا:
رفتار منحنی بازده بهشدت تحت تأثیر متغیرهای کلان است.
نویز دادهها زیاد است و کاهش ابعاد (DNS یا PCA) ضروری میشود.
استفاده از #Autoencoder برای استخراج ویژگیهای کلان میتواند کمک کند اثرات تورم، سیاستهای بانک مرکزی، نقدینگی و شوکهای اقتصادی بهشکل فشرده و قابلاستفاده وارد مدل شوند.
بهنظر من، این نوع رویکرد ترکیبی میتواند پایهٔ نسل جدید ابزارهای مدیریت ریسک و ساخت پرتفوی در بازارهای با نرخ بهره بالا باشد؛ مخصوصاً در ایران که دینامیکهای کلان نقش بسیار پررنگی در شکلگیری منحنی بازده دارند. https://www.linkedin.com/feed/update/urn:li:activity:7478336398442430464/
LinkedIn
#ریسک #غیر_خطی #autoencoder #یادگیری_ماشین #مدیریت_ریسک #فینتک #شبکه_عصبی #pca #nelsonsiegel #machinelearning #fixedincome #yieldcurve…
یادگیری ماشین؛ نسل جدید پیشبینی منحنی بازده و مدیریت مدتزمان
در بازارهایی مثل ایران که نرخهای بهره به محدودههای بالایی رسیدهاند، مدیریت مدتزمان و پیشبینی ساختار زمانی نرخها تبدیل به یکی از چالشهای اصلی فعالان حوزهٔ #ریسک، ALM و مدیریت پرتفوی شده…
در بازارهایی مثل ایران که نرخهای بهره به محدودههای بالایی رسیدهاند، مدیریت مدتزمان و پیشبینی ساختار زمانی نرخها تبدیل به یکی از چالشهای اصلی فعالان حوزهٔ #ریسک، ALM و مدیریت پرتفوی شده…
❤7
پشتیبانی نامبرلند واقعاً در حد فاجعهست! تلفنی که عمراً جواب بدن!
بعد ماجرای بن شدن اکانت اول به خود Claude ایمیل زدم، گفتن چون خرید از طریق اکانت اپل انجام شده، اونا نمیتونن پیگیری کنن و باید از طرف همون اکانت اپل (که نامبرلند باهاش خرید کرده) اقدام بشه.
بعد این موضوع رو به نامبرلند گفتم که خب شما با اکانت اپلتون خرید کردید، پس خودتون باید پیگیری کنید. جواب کاملاً بیربطی دادن و انگار نه انگار!
خب من که اصلاً دسترسیای به اکانتی که خودشون باهاش پرداخت کردن ندارم! این چه جور پشتیبانیایه🤦♂️
#نامبرلند #پشتیبانی_ضعیف
بعد ماجرای بن شدن اکانت اول به خود Claude ایمیل زدم، گفتن چون خرید از طریق اکانت اپل انجام شده، اونا نمیتونن پیگیری کنن و باید از طرف همون اکانت اپل (که نامبرلند باهاش خرید کرده) اقدام بشه.
بعد این موضوع رو به نامبرلند گفتم که خب شما با اکانت اپلتون خرید کردید، پس خودتون باید پیگیری کنید. جواب کاملاً بیربطی دادن و انگار نه انگار!
خب من که اصلاً دسترسیای به اکانتی که خودشون باهاش پرداخت کردن ندارم! این چه جور پشتیبانیایه🤦♂️
#نامبرلند #پشتیبانی_ضعیف
👍31😱9👌2❤1
This media is not supported in your browser
VIEW IN TELEGRAM
یه بنده خدایی یه پرامپت را آزمایش کرده و اعلام کرده که Fable 5 تو رقابت جدیدمون کامل بقیه رو داغون کرد، ولی ۶ برابر گرونتر از Opus 4.8 تموم شد!
به ۴ مدل یه پرامپت یکسان داده: ساخت سه تا صحنه مستقل با HTML5 canvas و فیزیک واقعی
پرامپتها:
خارج شدن قطار از ریل روی یه پل شکسته و سقوط تو آب
پرش دو ماشین از سکو و برخورد تو هوا روی یه دره
له کردن یه ردیف ماشین پارکشده توسط مونستر تراک
خروجیها:
Fable 5: ۶۲,۱۵۸ توکن، $۳.۱۲
GPT 5.5: ۳۷,۷۵۳ توکن، $۱.۱۴
Opus 4.8: ۲۲,۲۸۰ توکن، $۰.۵۶
GLM 5.2: ۳۶,۲۴۶ توکن، $۰.۰۸
مدل Fable 5 هر سه صحنه رو با نمره A+ رد کرد. برخوردها واقعی بهنظر میرسیدن، اشیاء درست میافتادن و میشکستن، و هیچچیز از داخل زمین رد نمیشد یا معلق نمیموند.
مدل GPT 5.5 نزدیکترین رقیب به Fable بود. تو صحنهی Bigfoot حتی بهنظرمون یهکم از Fable بهتر بود.
مدل GLM 5.2 تو هیچ صحنهای برنده نشد، ولی بهمراتب ارزونترین بود.
منبع: https://twitter.com/atomic_chat_hq/status/2072446067962978411
به ۴ مدل یه پرامپت یکسان داده: ساخت سه تا صحنه مستقل با HTML5 canvas و فیزیک واقعی
پرامپتها:
خارج شدن قطار از ریل روی یه پل شکسته و سقوط تو آب
پرش دو ماشین از سکو و برخورد تو هوا روی یه دره
له کردن یه ردیف ماشین پارکشده توسط مونستر تراک
خروجیها:
Fable 5: ۶۲,۱۵۸ توکن، $۳.۱۲
GPT 5.5: ۳۷,۷۵۳ توکن، $۱.۱۴
Opus 4.8: ۲۲,۲۸۰ توکن، $۰.۵۶
GLM 5.2: ۳۶,۲۴۶ توکن، $۰.۰۸
مدل Fable 5 هر سه صحنه رو با نمره A+ رد کرد. برخوردها واقعی بهنظر میرسیدن، اشیاء درست میافتادن و میشکستن، و هیچچیز از داخل زمین رد نمیشد یا معلق نمیموند.
مدل GPT 5.5 نزدیکترین رقیب به Fable بود. تو صحنهی Bigfoot حتی بهنظرمون یهکم از Fable بهتر بود.
مدل GLM 5.2 تو هیچ صحنهای برنده نشد، ولی بهمراتب ارزونترین بود.
منبع: https://twitter.com/atomic_chat_hq/status/2072446067962978411
🔥14❤4👍4
Forwarded from آموزش LLM و VLM
This media is not supported in your browser
VIEW IN TELEGRAM
مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگترین گلوگاههای مدلهای Vision-Language
مدل جدید LocateAnything انویدیا مشکل کندی مدلهای تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).
مسئله چی بود؟ مدلهای VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و بهصورت متوالی تولید میکنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیشبینی میشن، کاهش دقت هندسی.
راهحل PBD: کل باکس بهعنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیشبینی میشه، نه توکن به توکن. این کار همزمانی همونقدر که سرعت رو بالا میبره، دقت رو هم بهتر میکنه چون چهار مختصه با آگاهی از هم پیشبینی میشن (نه کور و مستقل).
📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/
💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything
🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
مدل جدید LocateAnything انویدیا مشکل کندی مدلهای تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).
مسئله چی بود؟ مدلهای VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و بهصورت متوالی تولید میکنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیشبینی میشن، کاهش دقت هندسی.
راهحل PBD: کل باکس بهعنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیشبینی میشه، نه توکن به توکن. این کار همزمانی همونقدر که سرعت رو بالا میبره، دقت رو هم بهتر میکنه چون چهار مختصه با آگاهی از هم پیشبینی میشن (نه کور و مستقل).
📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/
💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything
🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
❤13🔥4❤🔥2😱1
چند هفته پیش ضبط دورهی Agentic AI تموم شد 🎬
طبق چیزی که دوستان مکتبخونه گفتن، این دوره ۸ فصلی قراره هفته آینده روی سایت مکتبخونه منتشر بشه
طبق چیزی که دوستان مکتبخونه گفتن، این دوره ۸ فصلی قراره هفته آینده روی سایت مکتبخونه منتشر بشه
❤56❤🔥7⚡3👌2💯2
Forwarded from آموزش LLM و VLM
مدل SenseNova-Vision-7B-MoT از تیم SenseNova
برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر میگیرن و متن تولید میکنن، این مدل هم متن تولید میکنه هم تصویر — یعنی میتونه خروجیهایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سهبعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه
- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کیپوینت
- تخمین عمق و نرمال سطح
- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)
- بازسازی هندسه چندنمایی و تخمین پوز دوربین
📊 عملکرد:
در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسکهای تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.
البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقبتره — یعنی این مدل تخصصیِ کارهای ساختاریافته بیناییست، نه مکالمه و استدلال عمومی.
🔗 مدل در هاگینگ فیس
🔗 گیتهاب
📄 مقاله
___
@llm_huggingface
@cvision
برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر میگیرن و متن تولید میکنن، این مدل هم متن تولید میکنه هم تصویر — یعنی میتونه خروجیهایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سهبعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه
- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کیپوینت
- تخمین عمق و نرمال سطح
- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)
- بازسازی هندسه چندنمایی و تخمین پوز دوربین
📊 عملکرد:
در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسکهای تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.
البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقبتره — یعنی این مدل تخصصیِ کارهای ساختاریافته بیناییست، نه مکالمه و استدلال عمومی.
🔗 مدل در هاگینگ فیس
🔗 گیتهاب
📄 مقاله
___
@llm_huggingface
@cvision
❤13🔥2👍1
شرکت NVIDIA یه مجموعه داده بزرگ رایگان برای آموزش هوش مصنوعی منتشر کرده
برای اینکه یه هوش مصنوعی بتونه کارهای واقعی انجام بده (کد بزنه، خطا پیدا کنه، از ابزار استفاده کنه)، باید با هزاران نمونهی واقعی از این کارها آموزش ببینه. ولی این نمونهها کمیاب هستن و شرکتها معمولاً منتشر نمیکنند.
مثلا یه ربات که فقط با متن انگلیسی آموزش دیده، وقتی بخواد توهین رو توی زبون کرهای یا ژاپنی تشخیص بده، شکست میخوره، چرا که توی این زبونها پرخاشگری معمولاً توی «لحن مؤدبانهی ظاهری» پنهان میشه، نه توی کلمات رکیک! فلذا بدیهیست که دادهی انگلیسی به تنهایی کافی نیست.
حالا انویدیا دو تا چیز رو رایگان منتشر کرده:
📍 اولا Prompt Atlas — یه نقشهی بصری با میلیونها نمونه پرامپت واقعی (کدنویسی، ریاضی، ایمنی و...) که میتونی توش بگردی:
https://huggingface.co/spaces/nvidia/nemotron-post-training-v3-prompt-atlas
👥 ثانیا Nemotron-Personas — بیش از ۲ میلیارد «آدم مصنوعی» از ۱۰ کشور مختلف، برای تست اینکه هوش مصنوعی واقعاً فرهنگ و زبون مردمِ مناطق مختلف رو میفهمه یا نه.
🔗 مقاله:
https://huggingface.co/blog/nvidia/open-data-for-agents
#NVIDIA #هوش_مصنوعی #Nemotron
برای اینکه یه هوش مصنوعی بتونه کارهای واقعی انجام بده (کد بزنه، خطا پیدا کنه، از ابزار استفاده کنه)، باید با هزاران نمونهی واقعی از این کارها آموزش ببینه. ولی این نمونهها کمیاب هستن و شرکتها معمولاً منتشر نمیکنند.
مثلا یه ربات که فقط با متن انگلیسی آموزش دیده، وقتی بخواد توهین رو توی زبون کرهای یا ژاپنی تشخیص بده، شکست میخوره، چرا که توی این زبونها پرخاشگری معمولاً توی «لحن مؤدبانهی ظاهری» پنهان میشه، نه توی کلمات رکیک! فلذا بدیهیست که دادهی انگلیسی به تنهایی کافی نیست.
حالا انویدیا دو تا چیز رو رایگان منتشر کرده:
📍 اولا Prompt Atlas — یه نقشهی بصری با میلیونها نمونه پرامپت واقعی (کدنویسی، ریاضی، ایمنی و...) که میتونی توش بگردی:
https://huggingface.co/spaces/nvidia/nemotron-post-training-v3-prompt-atlas
👥 ثانیا Nemotron-Personas — بیش از ۲ میلیارد «آدم مصنوعی» از ۱۰ کشور مختلف، برای تست اینکه هوش مصنوعی واقعاً فرهنگ و زبون مردمِ مناطق مختلف رو میفهمه یا نه.
🔗 مقاله:
https://huggingface.co/blog/nvidia/open-data-for-agents
#NVIDIA #هوش_مصنوعی #Nemotron
❤16👍3
Forwarded from آموزش LLM و VLM
پارت ۱
تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه.
اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای فرانتیر ۲۰۲۶ دقیقاً از چه نسخههایی از distillation استفاده میکنن:
1️⃣ معلم بزرگ و دانشآموز کوچیک (روش کلاسیک):
مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logitهای معلم match میکنن (soft label) یا مستقیم روی متن تولیدشدهی معلم fine-tune میشن.
تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه.
اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای فرانتیر ۲۰۲۶ دقیقاً از چه نسخههایی از distillation استفاده میکنن:
1️⃣ معلم بزرگ و دانشآموز کوچیک (روش کلاسیک):
مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logitهای معلم match میکنن (soft label) یا مستقیم روی متن تولیدشدهی معلم fine-tune میشن.
👍5❤2
Forwarded from آموزش LLM و VLM
آموزش LLM و VLM
پارت ۱ تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه. اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای…
پارت ۲
2️⃣ ادغام چند متخصص RL در یک مدل (on-policy distillation):
بهجای اینکه یک مدل رو با RL روی همهچی خوب کنیم (که باعث فراموشی مهارتهای قبلی میشه)، برای هر حوزه (ریاضی، کد، ایجنت) یه معلمِ متخصص جدا با RL میسازن، بعد همه رو تو یه دانشآموز واحد distill میکنن؛ در حالی که خودِ دانشآموز داره rollout تولید میکنه. جالبه که این معلمها لزوماً بزرگتر نیستن، فقط تخصصیترن. این الگو رو DeepSeek-V4، MiMo (با نام MOPD)، GLM-5 و Nemotron 3 Ultra استفاده کردن.
3️⃣ خود مدل، معلم خودش (self-distillation):
مثل Cursor Composer 2.5 که یه hint به context اضافه میکنه، نسخهی hintدار مدل میشه معلم نسخهی بدونhint. یا روش Thinking Machines که برای جلوگیری از فراموشی، از چکپوینتِ قبل از fine-tune بهعنوان معلم استفاده میکنن.
نکتهی مشترک همهشون: معلم لزوماً بزرگتر نیست، فقط تو یه context یا حوزه بهتره. گاهی اون معلم، خودِ مدله.
🔗 منبع: huggingface.co/blog/sergiopaniego/distillation-2026
2️⃣ ادغام چند متخصص RL در یک مدل (on-policy distillation):
بهجای اینکه یک مدل رو با RL روی همهچی خوب کنیم (که باعث فراموشی مهارتهای قبلی میشه)، برای هر حوزه (ریاضی، کد، ایجنت) یه معلمِ متخصص جدا با RL میسازن، بعد همه رو تو یه دانشآموز واحد distill میکنن؛ در حالی که خودِ دانشآموز داره rollout تولید میکنه. جالبه که این معلمها لزوماً بزرگتر نیستن، فقط تخصصیترن. این الگو رو DeepSeek-V4، MiMo (با نام MOPD)، GLM-5 و Nemotron 3 Ultra استفاده کردن.
3️⃣ خود مدل، معلم خودش (self-distillation):
مثل Cursor Composer 2.5 که یه hint به context اضافه میکنه، نسخهی hintدار مدل میشه معلم نسخهی بدونhint. یا روش Thinking Machines که برای جلوگیری از فراموشی، از چکپوینتِ قبل از fine-tune بهعنوان معلم استفاده میکنن.
نکتهی مشترک همهشون: معلم لزوماً بزرگتر نیست، فقط تو یه context یا حوزه بهتره. گاهی اون معلم، خودِ مدله.
🔗 منبع: huggingface.co/blog/sergiopaniego/distillation-2026
👍11❤2
https://blog.google/innovation-and-ai/products/gemini-notebook/notebooklm-gemini-notebook/
👍1
Forwarded from آموزش LLM و VLM
🚀 موشنشات از کیمی K3 رونمایی کرد
شرکت چینی Moonshot AI امروز قدرتمندترین مدل پرچمدار خودش، Kimi K3، رو رسما معرفی کرد.
🔹 پنجرهی زمینه تا ۱ میلیون توکن
🔹 بهبود قابلتوجه در کدنویسی، تولید سهبعدی و وظایف دانشی پیچیده
🔹 طبق برخی نشتها و تستهای کاربران، حدود ۲.۵ تریلیون پارامتر دارد (این رقم هنوز رسما تأیید نشده)
🔹 در برخی بنچمارکهای کدنویسی از GPT-5.5 جلو زده
این عرضه فقط ۳ ماه بعد از متنباز شدن K2.6 اتفاق افتاد و نشوندهندهی شتاب چشمگیر در چرخهی توسعهی موشنشاته.
💰 همزمان، موشنشات دور جدید تأمین مالی با ارزشگذاری ۲۰ میلیارد دلاری رو بسته و درآمد سالانهی خانوادهی مدلهای کیمی از ۳۰۰ میلیون دلار عبور کرده.
بازار پیشبینی Polymarket پیش از رونمایی، احتمال عرضهی K3 در جولای رو تا ۹۸٪ برآورد کرده بود.
📎 منبع: finance.biggo.com
شرکت چینی Moonshot AI امروز قدرتمندترین مدل پرچمدار خودش، Kimi K3، رو رسما معرفی کرد.
🔹 پنجرهی زمینه تا ۱ میلیون توکن
🔹 بهبود قابلتوجه در کدنویسی، تولید سهبعدی و وظایف دانشی پیچیده
🔹 طبق برخی نشتها و تستهای کاربران، حدود ۲.۵ تریلیون پارامتر دارد (این رقم هنوز رسما تأیید نشده)
🔹 در برخی بنچمارکهای کدنویسی از GPT-5.5 جلو زده
این عرضه فقط ۳ ماه بعد از متنباز شدن K2.6 اتفاق افتاد و نشوندهندهی شتاب چشمگیر در چرخهی توسعهی موشنشاته.
💰 همزمان، موشنشات دور جدید تأمین مالی با ارزشگذاری ۲۰ میلیارد دلاری رو بسته و درآمد سالانهی خانوادهی مدلهای کیمی از ۳۰۰ میلیون دلار عبور کرده.
بازار پیشبینی Polymarket پیش از رونمایی، احتمال عرضهی K3 در جولای رو تا ۹۸٪ برآورد کرده بود.
📎 منبع: finance.biggo.com
❤8
🔥 یه خبر فوقالعاده برای دیزاینرها و تولیدکنندههای محتوا!
نسخه جدید هوش مصنوعی Qwen-Image-3.0 معرفی شد و این بار قرار نیست فقط عکسهای قشنگ تحویلمون بده!
این مدل یه ابزار کاملاً کاربردی و حرفهایه که میتونه طرحهای پیچیده و دقیق بزنه؛ از جمله: 📰 طراحی صفحات روزنامه و مجله 🎬 ساخت استوریبورد برای ویدیوها 💻 طراحی رابط کاربری (UI) وبسایت
💡 نکته جذابتر؟ از ۱۲ زبان مختلف پشتیبانی میکنه و دقتش توی درک جزئیات واقعاً بالاست.
📌 اگه دیزاینری یا محتوا میسازی، حتماً این ابزار جدید رو تست کن!
نسخه جدید هوش مصنوعی Qwen-Image-3.0 معرفی شد و این بار قرار نیست فقط عکسهای قشنگ تحویلمون بده!
این مدل یه ابزار کاملاً کاربردی و حرفهایه که میتونه طرحهای پیچیده و دقیق بزنه؛ از جمله: 📰 طراحی صفحات روزنامه و مجله 🎬 ساخت استوریبورد برای ویدیوها 💻 طراحی رابط کاربری (UI) وبسایت
💡 نکته جذابتر؟ از ۱۲ زبان مختلف پشتیبانی میکنه و دقتش توی درک جزئیات واقعاً بالاست.
📌 اگه دیزاینری یا محتوا میسازی، حتماً این ابزار جدید رو تست کن!
❤16
Media is too big
VIEW IN TELEGRAM
مقدمه کورس Agentic AI که در روزهای پیش رو منتشر خواهد شد...
🔥25❤6👍4❤🔥2
Forwarded from آموزش LLM و VLM
🧠 مایکروسافت مدل جدید Mage-VL رو منتشر کرد؛ یک مدل چندوجهیِ «کدک-محور» برای درک ویدیو و استریم زنده
مایکروسافت دو مدل بههممرتبط رو روی HuggingFace منتشر کرده:
🔹 مدل Mage-VL — مدل چندوجهیِ ۴ میلیارد پارامتری (بر پایهی Qwen3-4B) که همزمان تصویر، ویدیوی کوتاه/بلند و استریم زنده رو درک میکنه.
🔹 مدل Mage-ViT — انکودر بصری همین مدل، که کاملاً از صفر (بدون هیچ پیشآموزش تصویر-متنِ میلیاردی) آموزش دیده.
✨ ایده
بهجای اینکه ویدیو رو به فریمهای یکنواخت تبدیل کنن و همهشون رو به مدل بدن (که پرهزینهست)، از منطق کدکهای ویدیویی (مثل H.264/HEVC) الهام گرفتن: فقط فریمهای کلیدی (I-frame) کامل نگه داشته میشن و از فریمهای پیشبینیشده (P-frame) فقط بخشهایی که واقعاً حرکت/تغییر دارن انتخاب میشن. نتیجه؟
• کاهش بیش از ۷۵٪ در تعداد توکنهای بصری
• تا ۳.۵ برابر سرعت بیشتر در inference
• آموزش روی ویدیوهایی تا ۸ برابر طولانیتر با همون بودجهی محاسباتی
📊 عملکرد:
با همون بکبون ۴B، در تقریباً همهی بنچمارکهای ویدیویی و درک مکانی از Qwen3-VL-4B جلوتره (مثلاً +۲۲.۵ در QVHighlight و +۱۱ در VSI-Bench)، و در تصاویر استاتیک همسطح یا کمی بهتره.
🎙️ یه قابلیت جالب دیگه: یک «گیت شناختی» سبک داره که مدل رو در حالت استریم فقط وقتی «رویداد قابلتوجهی» رخ بده فعال میکنه (مثلاً روی گزارش زندهی فوتبال تست شده) — بدون نیاز به چند مدل جدا.
🔗 Mage-VL: https://huggingface.co/microsoft/Mage-VL
🔗 Mage-ViT: https://huggingface.co/microsoft/Mage-ViT
مایکروسافت دو مدل بههممرتبط رو روی HuggingFace منتشر کرده:
🔹 مدل Mage-VL — مدل چندوجهیِ ۴ میلیارد پارامتری (بر پایهی Qwen3-4B) که همزمان تصویر، ویدیوی کوتاه/بلند و استریم زنده رو درک میکنه.
🔹 مدل Mage-ViT — انکودر بصری همین مدل، که کاملاً از صفر (بدون هیچ پیشآموزش تصویر-متنِ میلیاردی) آموزش دیده.
✨ ایده
بهجای اینکه ویدیو رو به فریمهای یکنواخت تبدیل کنن و همهشون رو به مدل بدن (که پرهزینهست)، از منطق کدکهای ویدیویی (مثل H.264/HEVC) الهام گرفتن: فقط فریمهای کلیدی (I-frame) کامل نگه داشته میشن و از فریمهای پیشبینیشده (P-frame) فقط بخشهایی که واقعاً حرکت/تغییر دارن انتخاب میشن. نتیجه؟
• کاهش بیش از ۷۵٪ در تعداد توکنهای بصری
• تا ۳.۵ برابر سرعت بیشتر در inference
• آموزش روی ویدیوهایی تا ۸ برابر طولانیتر با همون بودجهی محاسباتی
📊 عملکرد:
با همون بکبون ۴B، در تقریباً همهی بنچمارکهای ویدیویی و درک مکانی از Qwen3-VL-4B جلوتره (مثلاً +۲۲.۵ در QVHighlight و +۱۱ در VSI-Bench)، و در تصاویر استاتیک همسطح یا کمی بهتره.
🎙️ یه قابلیت جالب دیگه: یک «گیت شناختی» سبک داره که مدل رو در حالت استریم فقط وقتی «رویداد قابلتوجهی» رخ بده فعال میکنه (مثلاً روی گزارش زندهی فوتبال تست شده) — بدون نیاز به چند مدل جدا.
🔗 Mage-VL: https://huggingface.co/microsoft/Mage-VL
🔗 Mage-ViT: https://huggingface.co/microsoft/Mage-ViT
huggingface.co
microsoft/Mage-VL · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👏6
Forwarded from َAgenticAI
Media is too big
VIEW IN TELEGRAM
🤖 دوره «Agentic AI با پایتون» منتشر شد!
اگه دنبال این هستی که از حرف زدن با یه مدل زبانی، بری سراغ ساختن عاملهایی (Agent) که واقعاً کار انجام میدن، ابزار صدا میزنن، با هم تیم میشن و پروژههای واقعی رو پیش میبرن، این دوره برای شماست!
توی ۸ فصل، از صفر تا ساخت یک پروژهی نهایی کامل جلو میریم:
📘 مقدمه 📗 فصل ۱ - مقدمهای بر گردشکارهای عاملمحور 📗 فصل ۲ - الگوی طراحی Reflection 📗 فصل ۳ - استفاده از ابزار (Tool Use) 📗 فصل ۴ - MCP (پروتکل ارتباط مدل با ابزارها) 📗 فصل ۵ - نکات عملی برای ساخت Agentic AI 📗 فصل ۶ - الگوهای عاملهای با خودمختاری بالا 📗 فصل ۷ - سیستمهای چندعامله با crewAI 📗 فصل ۸ - LangChain
🎯 پروژه نهایی: پیادهسازی سامانهی Text-to-SQL
تمام کدهای دوره روی گیتهاب در دسترس است:
👉 github.com/Alireza-Akhavan/agentic_ai
🎁 تخفیف ویژه
1️⃣برای ۱۰۰ نفر اول، کد تخفیف ۷۰٪ی:
2️⃣ برای ۱۰۰ نفر بعدی، کد تخفیف ۶۰٪ی:
تعداد کدها محدوده، پس اگر میخواهی Agentic AI را اصولی یاد بگیری، همین امروز ثبتنام کن.
سرفصلهای این دوره |برای مشاهده اسلاید؛ تمرین، پروژه 👈 @agentic_llm
اگه دنبال این هستی که از حرف زدن با یه مدل زبانی، بری سراغ ساختن عاملهایی (Agent) که واقعاً کار انجام میدن، ابزار صدا میزنن، با هم تیم میشن و پروژههای واقعی رو پیش میبرن، این دوره برای شماست!
توی ۸ فصل، از صفر تا ساخت یک پروژهی نهایی کامل جلو میریم:
📘 مقدمه 📗 فصل ۱ - مقدمهای بر گردشکارهای عاملمحور 📗 فصل ۲ - الگوی طراحی Reflection 📗 فصل ۳ - استفاده از ابزار (Tool Use) 📗 فصل ۴ - MCP (پروتکل ارتباط مدل با ابزارها) 📗 فصل ۵ - نکات عملی برای ساخت Agentic AI 📗 فصل ۶ - الگوهای عاملهای با خودمختاری بالا 📗 فصل ۷ - سیستمهای چندعامله با crewAI 📗 فصل ۸ - LangChain
🎯 پروژه نهایی: پیادهسازی سامانهی Text-to-SQL
تمام کدهای دوره روی گیتهاب در دسترس است:
👉 github.com/Alireza-Akhavan/agentic_ai
🎁 تخفیف ویژه
1️⃣برای ۱۰۰ نفر اول، کد تخفیف ۷۰٪ی:
COUPON-EAA612️⃣ برای ۱۰۰ نفر بعدی، کد تخفیف ۶۰٪ی:
COUPON-6EE77تعداد کدها محدوده، پس اگر میخواهی Agentic AI را اصولی یاد بگیری، همین امروز ثبتنام کن.
سرفصلهای این دوره |برای مشاهده اسلاید؛ تمرین، پروژه 👈 @agentic_llm
❤🔥9❤5🔥1
Forwarded from َAgenticAI
🔥10❤5