پشتیبانی نامبرلند واقعاً در حد فاجعهست! تلفنی که عمراً جواب بدن!
بعد ماجرای بن شدن اکانت اول به خود Claude ایمیل زدم، گفتن چون خرید از طریق اکانت اپل انجام شده، اونا نمیتونن پیگیری کنن و باید از طرف همون اکانت اپل (که نامبرلند باهاش خرید کرده) اقدام بشه.
بعد این موضوع رو به نامبرلند گفتم که خب شما با اکانت اپلتون خرید کردید، پس خودتون باید پیگیری کنید. جواب کاملاً بیربطی دادن و انگار نه انگار!
خب من که اصلاً دسترسیای به اکانتی که خودشون باهاش پرداخت کردن ندارم! این چه جور پشتیبانیایه🤦♂️
#نامبرلند #پشتیبانی_ضعیف
بعد ماجرای بن شدن اکانت اول به خود Claude ایمیل زدم، گفتن چون خرید از طریق اکانت اپل انجام شده، اونا نمیتونن پیگیری کنن و باید از طرف همون اکانت اپل (که نامبرلند باهاش خرید کرده) اقدام بشه.
بعد این موضوع رو به نامبرلند گفتم که خب شما با اکانت اپلتون خرید کردید، پس خودتون باید پیگیری کنید. جواب کاملاً بیربطی دادن و انگار نه انگار!
خب من که اصلاً دسترسیای به اکانتی که خودشون باهاش پرداخت کردن ندارم! این چه جور پشتیبانیایه🤦♂️
#نامبرلند #پشتیبانی_ضعیف
👍31😱9👌2❤1
This media is not supported in your browser
VIEW IN TELEGRAM
یه بنده خدایی یه پرامپت را آزمایش کرده و اعلام کرده که Fable 5 تو رقابت جدیدمون کامل بقیه رو داغون کرد، ولی ۶ برابر گرونتر از Opus 4.8 تموم شد!
به ۴ مدل یه پرامپت یکسان داده: ساخت سه تا صحنه مستقل با HTML5 canvas و فیزیک واقعی
پرامپتها:
خارج شدن قطار از ریل روی یه پل شکسته و سقوط تو آب
پرش دو ماشین از سکو و برخورد تو هوا روی یه دره
له کردن یه ردیف ماشین پارکشده توسط مونستر تراک
خروجیها:
Fable 5: ۶۲,۱۵۸ توکن، $۳.۱۲
GPT 5.5: ۳۷,۷۵۳ توکن، $۱.۱۴
Opus 4.8: ۲۲,۲۸۰ توکن، $۰.۵۶
GLM 5.2: ۳۶,۲۴۶ توکن، $۰.۰۸
مدل Fable 5 هر سه صحنه رو با نمره A+ رد کرد. برخوردها واقعی بهنظر میرسیدن، اشیاء درست میافتادن و میشکستن، و هیچچیز از داخل زمین رد نمیشد یا معلق نمیموند.
مدل GPT 5.5 نزدیکترین رقیب به Fable بود. تو صحنهی Bigfoot حتی بهنظرمون یهکم از Fable بهتر بود.
مدل GLM 5.2 تو هیچ صحنهای برنده نشد، ولی بهمراتب ارزونترین بود.
منبع: https://twitter.com/atomic_chat_hq/status/2072446067962978411
به ۴ مدل یه پرامپت یکسان داده: ساخت سه تا صحنه مستقل با HTML5 canvas و فیزیک واقعی
پرامپتها:
خارج شدن قطار از ریل روی یه پل شکسته و سقوط تو آب
پرش دو ماشین از سکو و برخورد تو هوا روی یه دره
له کردن یه ردیف ماشین پارکشده توسط مونستر تراک
خروجیها:
Fable 5: ۶۲,۱۵۸ توکن، $۳.۱۲
GPT 5.5: ۳۷,۷۵۳ توکن، $۱.۱۴
Opus 4.8: ۲۲,۲۸۰ توکن، $۰.۵۶
GLM 5.2: ۳۶,۲۴۶ توکن، $۰.۰۸
مدل Fable 5 هر سه صحنه رو با نمره A+ رد کرد. برخوردها واقعی بهنظر میرسیدن، اشیاء درست میافتادن و میشکستن، و هیچچیز از داخل زمین رد نمیشد یا معلق نمیموند.
مدل GPT 5.5 نزدیکترین رقیب به Fable بود. تو صحنهی Bigfoot حتی بهنظرمون یهکم از Fable بهتر بود.
مدل GLM 5.2 تو هیچ صحنهای برنده نشد، ولی بهمراتب ارزونترین بود.
منبع: https://twitter.com/atomic_chat_hq/status/2072446067962978411
🔥14❤4👍4
Forwarded from آموزش LLM و VLM
This media is not supported in your browser
VIEW IN TELEGRAM
مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگترین گلوگاههای مدلهای Vision-Language
مدل جدید LocateAnything انویدیا مشکل کندی مدلهای تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).
مسئله چی بود؟ مدلهای VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و بهصورت متوالی تولید میکنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیشبینی میشن، کاهش دقت هندسی.
راهحل PBD: کل باکس بهعنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیشبینی میشه، نه توکن به توکن. این کار همزمانی همونقدر که سرعت رو بالا میبره، دقت رو هم بهتر میکنه چون چهار مختصه با آگاهی از هم پیشبینی میشن (نه کور و مستقل).
📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/
💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything
🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
مدل جدید LocateAnything انویدیا مشکل کندی مدلهای تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).
مسئله چی بود؟ مدلهای VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و بهصورت متوالی تولید میکنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیشبینی میشن، کاهش دقت هندسی.
راهحل PBD: کل باکس بهعنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیشبینی میشه، نه توکن به توکن. این کار همزمانی همونقدر که سرعت رو بالا میبره، دقت رو هم بهتر میکنه چون چهار مختصه با آگاهی از هم پیشبینی میشن (نه کور و مستقل).
📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/
💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything
🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
❤13🔥4❤🔥2😱1
چند هفته پیش ضبط دورهی Agentic AI تموم شد 🎬
طبق چیزی که دوستان مکتبخونه گفتن، این دوره ۸ فصلی قراره هفته آینده روی سایت مکتبخونه منتشر بشه
طبق چیزی که دوستان مکتبخونه گفتن، این دوره ۸ فصلی قراره هفته آینده روی سایت مکتبخونه منتشر بشه
❤56❤🔥7⚡3👌2💯2
Forwarded from آموزش LLM و VLM
مدل SenseNova-Vision-7B-MoT از تیم SenseNova
برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر میگیرن و متن تولید میکنن، این مدل هم متن تولید میکنه هم تصویر — یعنی میتونه خروجیهایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سهبعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه
- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کیپوینت
- تخمین عمق و نرمال سطح
- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)
- بازسازی هندسه چندنمایی و تخمین پوز دوربین
📊 عملکرد:
در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسکهای تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.
البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقبتره — یعنی این مدل تخصصیِ کارهای ساختاریافته بیناییست، نه مکالمه و استدلال عمومی.
🔗 مدل در هاگینگ فیس
🔗 گیتهاب
📄 مقاله
___
@llm_huggingface
@cvision
برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر میگیرن و متن تولید میکنن، این مدل هم متن تولید میکنه هم تصویر — یعنی میتونه خروجیهایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سهبعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه
- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کیپوینت
- تخمین عمق و نرمال سطح
- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)
- بازسازی هندسه چندنمایی و تخمین پوز دوربین
📊 عملکرد:
در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسکهای تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.
البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقبتره — یعنی این مدل تخصصیِ کارهای ساختاریافته بیناییست، نه مکالمه و استدلال عمومی.
🔗 مدل در هاگینگ فیس
🔗 گیتهاب
📄 مقاله
___
@llm_huggingface
@cvision
❤13🔥2👍1
شرکت NVIDIA یه مجموعه داده بزرگ رایگان برای آموزش هوش مصنوعی منتشر کرده
برای اینکه یه هوش مصنوعی بتونه کارهای واقعی انجام بده (کد بزنه، خطا پیدا کنه، از ابزار استفاده کنه)، باید با هزاران نمونهی واقعی از این کارها آموزش ببینه. ولی این نمونهها کمیاب هستن و شرکتها معمولاً منتشر نمیکنند.
مثلا یه ربات که فقط با متن انگلیسی آموزش دیده، وقتی بخواد توهین رو توی زبون کرهای یا ژاپنی تشخیص بده، شکست میخوره، چرا که توی این زبونها پرخاشگری معمولاً توی «لحن مؤدبانهی ظاهری» پنهان میشه، نه توی کلمات رکیک! فلذا بدیهیست که دادهی انگلیسی به تنهایی کافی نیست.
حالا انویدیا دو تا چیز رو رایگان منتشر کرده:
📍 اولا Prompt Atlas — یه نقشهی بصری با میلیونها نمونه پرامپت واقعی (کدنویسی، ریاضی، ایمنی و...) که میتونی توش بگردی:
https://huggingface.co/spaces/nvidia/nemotron-post-training-v3-prompt-atlas
👥 ثانیا Nemotron-Personas — بیش از ۲ میلیارد «آدم مصنوعی» از ۱۰ کشور مختلف، برای تست اینکه هوش مصنوعی واقعاً فرهنگ و زبون مردمِ مناطق مختلف رو میفهمه یا نه.
🔗 مقاله:
https://huggingface.co/blog/nvidia/open-data-for-agents
#NVIDIA #هوش_مصنوعی #Nemotron
برای اینکه یه هوش مصنوعی بتونه کارهای واقعی انجام بده (کد بزنه، خطا پیدا کنه، از ابزار استفاده کنه)، باید با هزاران نمونهی واقعی از این کارها آموزش ببینه. ولی این نمونهها کمیاب هستن و شرکتها معمولاً منتشر نمیکنند.
مثلا یه ربات که فقط با متن انگلیسی آموزش دیده، وقتی بخواد توهین رو توی زبون کرهای یا ژاپنی تشخیص بده، شکست میخوره، چرا که توی این زبونها پرخاشگری معمولاً توی «لحن مؤدبانهی ظاهری» پنهان میشه، نه توی کلمات رکیک! فلذا بدیهیست که دادهی انگلیسی به تنهایی کافی نیست.
حالا انویدیا دو تا چیز رو رایگان منتشر کرده:
📍 اولا Prompt Atlas — یه نقشهی بصری با میلیونها نمونه پرامپت واقعی (کدنویسی، ریاضی، ایمنی و...) که میتونی توش بگردی:
https://huggingface.co/spaces/nvidia/nemotron-post-training-v3-prompt-atlas
👥 ثانیا Nemotron-Personas — بیش از ۲ میلیارد «آدم مصنوعی» از ۱۰ کشور مختلف، برای تست اینکه هوش مصنوعی واقعاً فرهنگ و زبون مردمِ مناطق مختلف رو میفهمه یا نه.
🔗 مقاله:
https://huggingface.co/blog/nvidia/open-data-for-agents
#NVIDIA #هوش_مصنوعی #Nemotron
❤16👍3
Forwarded from آموزش LLM و VLM
پارت ۱
تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه.
اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای فرانتیر ۲۰۲۶ دقیقاً از چه نسخههایی از distillation استفاده میکنن:
1️⃣ معلم بزرگ و دانشآموز کوچیک (روش کلاسیک):
مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logitهای معلم match میکنن (soft label) یا مستقیم روی متن تولیدشدهی معلم fine-tune میشن.
تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه.
اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای فرانتیر ۲۰۲۶ دقیقاً از چه نسخههایی از distillation استفاده میکنن:
1️⃣ معلم بزرگ و دانشآموز کوچیک (روش کلاسیک):
مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logitهای معلم match میکنن (soft label) یا مستقیم روی متن تولیدشدهی معلم fine-tune میشن.
👍5❤2
Forwarded from آموزش LLM و VLM
آموزش LLM و VLM
پارت ۱ تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه. اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای…
پارت ۲
2️⃣ ادغام چند متخصص RL در یک مدل (on-policy distillation):
بهجای اینکه یک مدل رو با RL روی همهچی خوب کنیم (که باعث فراموشی مهارتهای قبلی میشه)، برای هر حوزه (ریاضی، کد، ایجنت) یه معلمِ متخصص جدا با RL میسازن، بعد همه رو تو یه دانشآموز واحد distill میکنن؛ در حالی که خودِ دانشآموز داره rollout تولید میکنه. جالبه که این معلمها لزوماً بزرگتر نیستن، فقط تخصصیترن. این الگو رو DeepSeek-V4، MiMo (با نام MOPD)، GLM-5 و Nemotron 3 Ultra استفاده کردن.
3️⃣ خود مدل، معلم خودش (self-distillation):
مثل Cursor Composer 2.5 که یه hint به context اضافه میکنه، نسخهی hintدار مدل میشه معلم نسخهی بدونhint. یا روش Thinking Machines که برای جلوگیری از فراموشی، از چکپوینتِ قبل از fine-tune بهعنوان معلم استفاده میکنن.
نکتهی مشترک همهشون: معلم لزوماً بزرگتر نیست، فقط تو یه context یا حوزه بهتره. گاهی اون معلم، خودِ مدله.
🔗 منبع: huggingface.co/blog/sergiopaniego/distillation-2026
2️⃣ ادغام چند متخصص RL در یک مدل (on-policy distillation):
بهجای اینکه یک مدل رو با RL روی همهچی خوب کنیم (که باعث فراموشی مهارتهای قبلی میشه)، برای هر حوزه (ریاضی، کد، ایجنت) یه معلمِ متخصص جدا با RL میسازن، بعد همه رو تو یه دانشآموز واحد distill میکنن؛ در حالی که خودِ دانشآموز داره rollout تولید میکنه. جالبه که این معلمها لزوماً بزرگتر نیستن، فقط تخصصیترن. این الگو رو DeepSeek-V4، MiMo (با نام MOPD)، GLM-5 و Nemotron 3 Ultra استفاده کردن.
3️⃣ خود مدل، معلم خودش (self-distillation):
مثل Cursor Composer 2.5 که یه hint به context اضافه میکنه، نسخهی hintدار مدل میشه معلم نسخهی بدونhint. یا روش Thinking Machines که برای جلوگیری از فراموشی، از چکپوینتِ قبل از fine-tune بهعنوان معلم استفاده میکنن.
نکتهی مشترک همهشون: معلم لزوماً بزرگتر نیست، فقط تو یه context یا حوزه بهتره. گاهی اون معلم، خودِ مدله.
🔗 منبع: huggingface.co/blog/sergiopaniego/distillation-2026
👍11❤2
https://blog.google/innovation-and-ai/products/gemini-notebook/notebooklm-gemini-notebook/
👍1
Forwarded from آموزش LLM و VLM
🚀 موشنشات از کیمی K3 رونمایی کرد
شرکت چینی Moonshot AI امروز قدرتمندترین مدل پرچمدار خودش، Kimi K3، رو رسما معرفی کرد.
🔹 پنجرهی زمینه تا ۱ میلیون توکن
🔹 بهبود قابلتوجه در کدنویسی، تولید سهبعدی و وظایف دانشی پیچیده
🔹 طبق برخی نشتها و تستهای کاربران، حدود ۲.۵ تریلیون پارامتر دارد (این رقم هنوز رسما تأیید نشده)
🔹 در برخی بنچمارکهای کدنویسی از GPT-5.5 جلو زده
این عرضه فقط ۳ ماه بعد از متنباز شدن K2.6 اتفاق افتاد و نشوندهندهی شتاب چشمگیر در چرخهی توسعهی موشنشاته.
💰 همزمان، موشنشات دور جدید تأمین مالی با ارزشگذاری ۲۰ میلیارد دلاری رو بسته و درآمد سالانهی خانوادهی مدلهای کیمی از ۳۰۰ میلیون دلار عبور کرده.
بازار پیشبینی Polymarket پیش از رونمایی، احتمال عرضهی K3 در جولای رو تا ۹۸٪ برآورد کرده بود.
📎 منبع: finance.biggo.com
شرکت چینی Moonshot AI امروز قدرتمندترین مدل پرچمدار خودش، Kimi K3، رو رسما معرفی کرد.
🔹 پنجرهی زمینه تا ۱ میلیون توکن
🔹 بهبود قابلتوجه در کدنویسی، تولید سهبعدی و وظایف دانشی پیچیده
🔹 طبق برخی نشتها و تستهای کاربران، حدود ۲.۵ تریلیون پارامتر دارد (این رقم هنوز رسما تأیید نشده)
🔹 در برخی بنچمارکهای کدنویسی از GPT-5.5 جلو زده
این عرضه فقط ۳ ماه بعد از متنباز شدن K2.6 اتفاق افتاد و نشوندهندهی شتاب چشمگیر در چرخهی توسعهی موشنشاته.
💰 همزمان، موشنشات دور جدید تأمین مالی با ارزشگذاری ۲۰ میلیارد دلاری رو بسته و درآمد سالانهی خانوادهی مدلهای کیمی از ۳۰۰ میلیون دلار عبور کرده.
بازار پیشبینی Polymarket پیش از رونمایی، احتمال عرضهی K3 در جولای رو تا ۹۸٪ برآورد کرده بود.
📎 منبع: finance.biggo.com
❤8
🔥 یه خبر فوقالعاده برای دیزاینرها و تولیدکنندههای محتوا!
نسخه جدید هوش مصنوعی Qwen-Image-3.0 معرفی شد و این بار قرار نیست فقط عکسهای قشنگ تحویلمون بده!
این مدل یه ابزار کاملاً کاربردی و حرفهایه که میتونه طرحهای پیچیده و دقیق بزنه؛ از جمله: 📰 طراحی صفحات روزنامه و مجله 🎬 ساخت استوریبورد برای ویدیوها 💻 طراحی رابط کاربری (UI) وبسایت
💡 نکته جذابتر؟ از ۱۲ زبان مختلف پشتیبانی میکنه و دقتش توی درک جزئیات واقعاً بالاست.
📌 اگه دیزاینری یا محتوا میسازی، حتماً این ابزار جدید رو تست کن!
نسخه جدید هوش مصنوعی Qwen-Image-3.0 معرفی شد و این بار قرار نیست فقط عکسهای قشنگ تحویلمون بده!
این مدل یه ابزار کاملاً کاربردی و حرفهایه که میتونه طرحهای پیچیده و دقیق بزنه؛ از جمله: 📰 طراحی صفحات روزنامه و مجله 🎬 ساخت استوریبورد برای ویدیوها 💻 طراحی رابط کاربری (UI) وبسایت
💡 نکته جذابتر؟ از ۱۲ زبان مختلف پشتیبانی میکنه و دقتش توی درک جزئیات واقعاً بالاست.
📌 اگه دیزاینری یا محتوا میسازی، حتماً این ابزار جدید رو تست کن!
❤16
Media is too big
VIEW IN TELEGRAM
مقدمه کورس Agentic AI که در روزهای پیش رو منتشر خواهد شد...
🔥25❤6👍4❤🔥2
Forwarded from آموزش LLM و VLM
🧠 مایکروسافت مدل جدید Mage-VL رو منتشر کرد؛ یک مدل چندوجهیِ «کدک-محور» برای درک ویدیو و استریم زنده
مایکروسافت دو مدل بههممرتبط رو روی HuggingFace منتشر کرده:
🔹 مدل Mage-VL — مدل چندوجهیِ ۴ میلیارد پارامتری (بر پایهی Qwen3-4B) که همزمان تصویر، ویدیوی کوتاه/بلند و استریم زنده رو درک میکنه.
🔹 مدل Mage-ViT — انکودر بصری همین مدل، که کاملاً از صفر (بدون هیچ پیشآموزش تصویر-متنِ میلیاردی) آموزش دیده.
✨ ایده
بهجای اینکه ویدیو رو به فریمهای یکنواخت تبدیل کنن و همهشون رو به مدل بدن (که پرهزینهست)، از منطق کدکهای ویدیویی (مثل H.264/HEVC) الهام گرفتن: فقط فریمهای کلیدی (I-frame) کامل نگه داشته میشن و از فریمهای پیشبینیشده (P-frame) فقط بخشهایی که واقعاً حرکت/تغییر دارن انتخاب میشن. نتیجه؟
• کاهش بیش از ۷۵٪ در تعداد توکنهای بصری
• تا ۳.۵ برابر سرعت بیشتر در inference
• آموزش روی ویدیوهایی تا ۸ برابر طولانیتر با همون بودجهی محاسباتی
📊 عملکرد:
با همون بکبون ۴B، در تقریباً همهی بنچمارکهای ویدیویی و درک مکانی از Qwen3-VL-4B جلوتره (مثلاً +۲۲.۵ در QVHighlight و +۱۱ در VSI-Bench)، و در تصاویر استاتیک همسطح یا کمی بهتره.
🎙️ یه قابلیت جالب دیگه: یک «گیت شناختی» سبک داره که مدل رو در حالت استریم فقط وقتی «رویداد قابلتوجهی» رخ بده فعال میکنه (مثلاً روی گزارش زندهی فوتبال تست شده) — بدون نیاز به چند مدل جدا.
🔗 Mage-VL: https://huggingface.co/microsoft/Mage-VL
🔗 Mage-ViT: https://huggingface.co/microsoft/Mage-ViT
مایکروسافت دو مدل بههممرتبط رو روی HuggingFace منتشر کرده:
🔹 مدل Mage-VL — مدل چندوجهیِ ۴ میلیارد پارامتری (بر پایهی Qwen3-4B) که همزمان تصویر، ویدیوی کوتاه/بلند و استریم زنده رو درک میکنه.
🔹 مدل Mage-ViT — انکودر بصری همین مدل، که کاملاً از صفر (بدون هیچ پیشآموزش تصویر-متنِ میلیاردی) آموزش دیده.
✨ ایده
بهجای اینکه ویدیو رو به فریمهای یکنواخت تبدیل کنن و همهشون رو به مدل بدن (که پرهزینهست)، از منطق کدکهای ویدیویی (مثل H.264/HEVC) الهام گرفتن: فقط فریمهای کلیدی (I-frame) کامل نگه داشته میشن و از فریمهای پیشبینیشده (P-frame) فقط بخشهایی که واقعاً حرکت/تغییر دارن انتخاب میشن. نتیجه؟
• کاهش بیش از ۷۵٪ در تعداد توکنهای بصری
• تا ۳.۵ برابر سرعت بیشتر در inference
• آموزش روی ویدیوهایی تا ۸ برابر طولانیتر با همون بودجهی محاسباتی
📊 عملکرد:
با همون بکبون ۴B، در تقریباً همهی بنچمارکهای ویدیویی و درک مکانی از Qwen3-VL-4B جلوتره (مثلاً +۲۲.۵ در QVHighlight و +۱۱ در VSI-Bench)، و در تصاویر استاتیک همسطح یا کمی بهتره.
🎙️ یه قابلیت جالب دیگه: یک «گیت شناختی» سبک داره که مدل رو در حالت استریم فقط وقتی «رویداد قابلتوجهی» رخ بده فعال میکنه (مثلاً روی گزارش زندهی فوتبال تست شده) — بدون نیاز به چند مدل جدا.
🔗 Mage-VL: https://huggingface.co/microsoft/Mage-VL
🔗 Mage-ViT: https://huggingface.co/microsoft/Mage-ViT
huggingface.co
microsoft/Mage-VL · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👏6
Forwarded from َAgenticAI
Media is too big
VIEW IN TELEGRAM
🤖 دوره «Agentic AI با پایتون» منتشر شد!
اگه دنبال این هستی که از حرف زدن با یه مدل زبانی، بری سراغ ساختن عاملهایی (Agent) که واقعاً کار انجام میدن، ابزار صدا میزنن، با هم تیم میشن و پروژههای واقعی رو پیش میبرن، این دوره برای شماست!
توی ۸ فصل، از صفر تا ساخت یک پروژهی نهایی کامل جلو میریم:
📘 مقدمه 📗 فصل ۱ - مقدمهای بر گردشکارهای عاملمحور 📗 فصل ۲ - الگوی طراحی Reflection 📗 فصل ۳ - استفاده از ابزار (Tool Use) 📗 فصل ۴ - MCP (پروتکل ارتباط مدل با ابزارها) 📗 فصل ۵ - نکات عملی برای ساخت Agentic AI 📗 فصل ۶ - الگوهای عاملهای با خودمختاری بالا 📗 فصل ۷ - سیستمهای چندعامله با crewAI 📗 فصل ۸ - LangChain
🎯 پروژه نهایی: پیادهسازی سامانهی Text-to-SQL
تمام کدهای دوره روی گیتهاب در دسترس است:
👉 github.com/Alireza-Akhavan/agentic_ai
🎁 تخفیف ویژه
1️⃣برای ۱۰۰ نفر اول، کد تخفیف ۷۰٪ی:
2️⃣ برای ۱۰۰ نفر بعدی، کد تخفیف ۶۰٪ی:
تعداد کدها محدوده، پس اگر میخواهی Agentic AI را اصولی یاد بگیری، همین امروز ثبتنام کن.
سرفصلهای این دوره |برای مشاهده اسلاید؛ تمرین، پروژه 👈 @agentic_llm
اگه دنبال این هستی که از حرف زدن با یه مدل زبانی، بری سراغ ساختن عاملهایی (Agent) که واقعاً کار انجام میدن، ابزار صدا میزنن، با هم تیم میشن و پروژههای واقعی رو پیش میبرن، این دوره برای شماست!
توی ۸ فصل، از صفر تا ساخت یک پروژهی نهایی کامل جلو میریم:
📘 مقدمه 📗 فصل ۱ - مقدمهای بر گردشکارهای عاملمحور 📗 فصل ۲ - الگوی طراحی Reflection 📗 فصل ۳ - استفاده از ابزار (Tool Use) 📗 فصل ۴ - MCP (پروتکل ارتباط مدل با ابزارها) 📗 فصل ۵ - نکات عملی برای ساخت Agentic AI 📗 فصل ۶ - الگوهای عاملهای با خودمختاری بالا 📗 فصل ۷ - سیستمهای چندعامله با crewAI 📗 فصل ۸ - LangChain
🎯 پروژه نهایی: پیادهسازی سامانهی Text-to-SQL
تمام کدهای دوره روی گیتهاب در دسترس است:
👉 github.com/Alireza-Akhavan/agentic_ai
🎁 تخفیف ویژه
1️⃣برای ۱۰۰ نفر اول، کد تخفیف ۷۰٪ی:
COUPON-EAA612️⃣ برای ۱۰۰ نفر بعدی، کد تخفیف ۶۰٪ی:
COUPON-6EE77تعداد کدها محدوده، پس اگر میخواهی Agentic AI را اصولی یاد بگیری، همین امروز ثبتنام کن.
سرفصلهای این دوره |برای مشاهده اسلاید؛ تمرین، پروژه 👈 @agentic_llm
❤🔥9❤5🔥1
Forwarded from َAgenticAI
🔥10❤5