DeepMind AI Expert
15.4K subscribers
1.37K photos
398 videos
122 files
2.44K links
مقالات کاربردی هوش مصنوعی در پایتون، علوم پزشکی، علوم انسانی، علوم اعصاب و...
دوره های آموزشی از دانشگاه های بزرگ و موسسات انلاین
پژوهشگران هوش مصنوعی ایران

یک چای مهمون کن

https://daramet.com/farzaddd

ارتباط با من:
https://t.iss.one/AI_DeepMind?direct
Download Telegram
این مقاله درباره استفاده Foundation Models مانند SAM، SAM2 و MedSAM برای تحلیل خودکار MRI اسکلتی-عضلانی است و نشان می‌دهد که چگونه می‌توان از تصاویر MRI معمولی، بیومارکرهای کمی و قابل‌اعتماد استخراج کرد و آن‌ها را برای تصمیم‌گیری بالینی به کار برد.
استفاده از مدل‌های بنیادی مانند SAM2 می‌توان MRIهای اسکلتی عضلانی را به‌طور خودکار به بیومارکرهای دقیق و قابل‌استفاده در پزشکی شخصی‌سازی‌شده تبدیل کرد؛ بیومارکرهایی که هم به کاهش بار کاری پزشکان کمک می‌کنند و هم می‌توانند خطر پیشرفت بیماری و نیاز به جراحی را پیش‌بینی کنند.

🔸 Clinical utility of foundation models in musculoskeletal MRI for biomarker fidelity and predictive outcomes


#مقاله #ایده_جذاب #هوش_مصنوعی #پردازش_تصویر #بینایی_ماشین #علوم_پزشکی #مدل_بنیادی


@AI_DeepMind
🔸 @AI_Person
👌83👍2
کلاس آموزشی یادگیری تقویتی مدلهای زبانی بزرگ از دانشگاه لس انجلس
Reinforcement Learning of Large Language Models, Spring 2025(UCLA)

🔸 Youtube playlist
🔸 Website

Great set of new lectures on reinforcement learning of LLMs. Covers a wide range of topics related to RLxLLMs such as basics/foundations, test-time compute, RLHF, and RL with verifiable rewards(RLVR).

#هوش_مصنوعی #الگوریتمها #یادگیری_تقویتی #کلاس_آموزشی #فیلم #پردازش_زبان_طبیعی

@AI_DeepMind
🔸 @AI_Person
12
سلام سایتی رایگان میشناسید بشه فوتبالهای جام‌جهانی رو انلاین نگاه کرد.؟
👍4🔥1
فروش فیلترشکن قابل ارایه و پشتیبانی برای تمام پلتفرمهای هوش مصنوعی و ... بدون ضریب

۱۰ گیگ 170
۱۵گیگ 255
۲۵گیگ 425
۴۵گیگ 765
۹۰ گیگ 1530

فروش فیلترشکن OpenVPN قابل ارایه و پشتیبانی حتی در زمان نت ملی برای تمام پلتفرمهای هوش مصنوعی و ... بدون ضریب

مناسب همه فعالیتها قابل استفاده در زمان قطعی نت، چند کاربره و یک ماهه


۱۱۰ گیگ تعداد کاربر نامحدود 3700
55 گیگ تعداد کاربر نامحدود 2700
حجم و تعداد کاربر نامحدود ۷ میلیون

ا IP ثابت آمریکا، آلمان، ترکیه موجود هست.

مناسب استفاده شخصی، شرکتها و استارت آپ ها، تریدرها و دارای IP ثابت

حداکثر سرعت قابل ارایه 16 مگابایت

@Farzadh1h
2
DeepMind AI Expert
کلاس آموزشی یادگیری تقویتی مدلهای زبانی بزرگ از دانشگاه لس انجلس Reinforcement Learning of Large Language Models, Spring 2025(UCLA) 🔸 Youtube playlist 🔸 Website Great set of new lectures on reinforcement learning of LLMs. Covers a wide range of topics related…
این مقاله یک مدل هوش مصنوعی به نام Topo-Omni معرفی می‌کند که سعی دارد سازمان‌دهی فضایی مغز انسان را تقلید کند. در مغز، نورون‌های نزدیک به هم معمولاً وظایف مشابهی دارند و نواحی تخصصی (مثل #تشخیص_چهره، صدا یا زبان) را تشکیل می‌دهند. پژوهشگران نشان دادند که اگر به یک مدل چندوجهی (تصویر، صدا و زبان) محدودیت Spatial Smoothness بدهند، این نواحی تخصصی به‌طور خودکار در مدل ظاهر می‌شوند.

🔸 Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

#نروساینس #هوش_مصنوعی #مولتی_مدل #مقاله #علوم_پزشکی


@AI_DeepMind
🔸 @AI_Person
8
مقاله زیر مدل Arbor تلاش می‌کند #هوش_مصنوعی را از یک «عامل تک‌پاسخی» به یک پژوهشگر خودمختار که فرضیه می‌سازد، آزمایش می‌کند، از شکست‌ها یاد می‌گیرد و دانش را انباشته می‌کند تبدیل کند. این مقاله یکی از جدی‌ترین گام‌ها به سمت Generalist Autonomous Research Agents محسوب می‌شود.

🔸 Toward Generalist Autonomous Research via Hypothesis-Tree Refinement

#مقاله #هوش_عمومی #یادگیری_تقویتی

@AI_DeepMind
🔸 @AI_Person
6👍2👌2
ما 15k شدیم مرسی همراه من در این کانال شدید❤️🌻🚶‍♂🥹
19🍓2
کانالم به ۲۷ تا boost نیاز داره کیه که ا boost کانالمو به حد برسونه؟! قبلا خیلی بهتر زود استار و boost میزدید خیلی به کانالم بی مهری میکنید🚶‍♂
https://t.iss.one/boost/AI_DeepMind
4🍓1
"High-Dimensional Data Analysis with Low-Dimensional Models" by Wright & Ma PDF: book-wright-ma.github.io

#کتاب #آمار #منابع

@AI_DeepMind
🔸 @AI_Person
10
Forwarded from Download IT | YouTube, Instagram, TikTok, VK, Twitter, Facebook
Media is too big
VIEW IN TELEGRAM
Ex-Amazon VP: Lessons from Working with Jeff Bezos that Changed My Life | Ethan Evans
[​1:34:10] · 43.2K views · Jun 3, 2026 · 1.2K likes · 50 comments · BigDeal by Codie Sanchez 623K subscribers · mp4 360p [262 MB]

You work harder than half your team. You deliver results. But somehow, the person who talks a good game in meetings just got promoted ahead of you. Here's the truth: hard work doesn't get you promoted. Visibility, advocacy, and understanding the game do.

Ethan Evans is a retired Amazon VP who spent over 15 years building billion dollar businesses inside one of the most demanding companies on earth. He went from getting fired twice early in his career to running Prime Video, Twitch sponsorships, the Amazon Appstore, and a t-shirt printing business that now does over a billion dollars a year. He worked directly with Jeff Bezos, survived public failures, learned how to navigate corporate politics without losing his soul, and retired early to teach…

saved by @download_it_bot
3
تیم Google DeepMind بررسی می‌کند که اگر AGI، یعنی #هوش_مصنوعی_عمومی در سطح انسان، ساخته شود، مسیرهای فنی محتمل برای رسیدن از آن به ASI یا #ابرهوش_مصنوعی چه خواهند بود. مقاله AGI را به‌طور غیررسمی سیستمی می‌داند که در بیشتر وظایف شناختی در سطح انسان میانه عمل می‌کند؛ ASI را سیستمی می‌داند که در تقریباً همه حوزه‌های مهم، از توانایی گروه‌های بزرگ متخصصان انسانی فراتر می‌رود
رسیدن به AGI لزوماً نقطه پایان پیشرفت AI نیست. حتی اگر یک مدل منفرد در نزدیکی سطح انسان متوقف شود، افزایش compute، بهبود الگوریتم‌ها، خودکارسازی پژوهش AI، و تشکیل جمعیت‌های عظیم عامل‌های AI می‌تواند قابلیت‌های جمعی را به سطحی فراتر از انسان ببرد. نویسندگان تأکید می‌کنند این چهار مسیر رقیب هم نیستند و ممکن است هم‌زمان رخ دهند و اثرشان ترکیبی باشد.


پیام اصلی مقاله این است که بحث نباید فقط روی «چه زمانی AGI می‌رسد؟» متوقف شود. پرسش مهم‌تر این است که بعد از AGI چه سازوکارهایی می‌توانند AI را از سطح انسان به سطح فراتر از سازمان‌های انسانی ببرند، و چه چیزهایی ممکن است این مسیر را کند یا متوقف کند. مقاله پیش‌بینی قطعی نمی‌دهد؛ بلکه یک نقشه پژوهشی ارائه می‌کند و می‌گوید ممکن است تحول AI نه یک جهش واحد، بلکه زنجیره‌ای از تغییرات بزرگ ناشی از پیشرفت‌های AI در علم، فناوری و اقتصاد باشد.

🔸 From AGI to ASI

#مقاله #هوش_مصنوعی

@AI_DeepMind
🔸 @AI_Person
8👍4👌1
این #مقاله یک روش برای generative future video modeling معرفی می‌کند؛ یعنی مدلی که با دیدن چند فریم گذشته، چند آینده محتمل را پیش‌بینی کند. ایده اصلی این است که به‌جای نمایش هر فریم با تعداد زیادی توکن فضایی، تغییر بین دو فریم پیاپی را فقط با یک توکن دلتا نمایش بدهیم. این توکن‌ساز DeltaTok نام دارد و مدل نهایی DeltaWorld است.

مدل‌های پیش‌بینی آینده معمولاً دو مشکل دارند: یا discriminative هستند و فقط یک آینده میانگین‌شده تولید می‌کنند، یا اگر مولد باشند، مثل diffusion یا autoregressive video models، بسیار پرهزینه‌اند و برای هر نمونه آینده به چندین forward pass نیاز دارند. مقاله می‌گوید در کاربردهایی مثل خودرو خودران، یک پیش‌بینی واحد کافی نیست، چون آینده چندین حالت ممکن دارد.

ایده DeltaTok به‌جای فشرده‌کردن کل فریم، فقط تفاوت ویژگی‌های دو فریم پیاپی را فشرده می‌کند. فریم‌ها ابتدا با یک Vision Foundation Model مثل DINOv3 به فضای feature تبدیل می‌شوند؛ سپس DeltaTok از ویژگی‌های فریم قبلی و فعلی، یک delta token می‌سازد که نشان می‌دهد چگونه باید ویژگی‌های فریم قبلی به فریم فعلی تبدیل شوند. دیکودر هم با گرفتن فریم قبلی و همین توکن، ویژگی‌های فریم جدید را بازسازی می‌کند.

اگر پیش‌بینی در فضای feature انجام شود و فقط تغییر بین فریم‌ها مدل شود، یک توکن برای هر فریم می‌تواند کافی باشد. نتیجه، مدلی است که چند آینده محتمل تولید می‌کند، اما بسیار سبک‌تر و سریع‌تر از world modelهای مولد رایج است.

🔸 A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens

#مدلهای_بنیادی #مدل_مولد #هوش_مصنوعی #بینایی_مدل_بنیادی #پردازش_تصویر #پردازش_فیلم

@AI_DeepMind
🔸 @AI_Person
6👌1
Forwarded from DeepMind AI Expert
فروش فیلترشکن قابل ارایه و پشتیبانی برای تمام پلتفرمهای هوش مصنوعی و ... بدون ضریب

۱۰ گیگ 170
۱۵گیگ 255
۲۵گیگ 425
۴۵گیگ 765
۹۰ گیگ 1530

فروش فیلترشکن OpenVPN قابل ارایه و پشتیبانی حتی در زمان نت ملی برای تمام پلتفرمهای هوش مصنوعی و ... بدون ضریب

مناسب همه فعالیتها قابل استفاده در زمان قطعی نت، چند کاربره و یک ماهه


۱۱۰ گیگ تعداد کاربر نامحدود 3700
55 گیگ تعداد کاربر نامحدود 2700
حجم و تعداد کاربر نامحدود ۷ میلیون

ا IP ثابت آمریکا، آلمان، ترکیه موجود هست.

مناسب استفاده شخصی، شرکتها و استارت آپ ها، تریدرها و دارای IP ثابت

حداکثر سرعت قابل ارایه 16 مگابایت

@Farzadh1h
2👌1
در مدل‌های Transformer، برای هر توکن تولیدشده، بردارهای Key و Value ذخیره می‌شوند تا مدل برای توکن‌های بعدی دوباره همه چیز را محاسبه نکند. این همان روش KV cache در این #مقاله است. اما هرچه خروجی طولانی‌تر شود، این cache بزرگ‌تر می‌شود و ممکن است GPU از حافظه خالی شود؛ مثال مقاله می‌گوید Qwen3-32B با وزن‌های ۴ بیتی روی GPU 24GB حدوداً بعد از ۲۴ هزار توکن به OOM می‌رسد.

روش‌هایی مثل StreamingLLM، H2O و SnapKV سعی می‌کنند فقط توکن‌های مهم را نگه دارند: توکن‌های ابتدایی موسوم به attention sinks، توکن‌های اخیر، و توکن‌هایی که attention زیادی گرفته‌اند یا «heavy hitters» هستند. این روش‌ها در بنچمارک‌ها مفیدند، اما اغلب فرض می‌کنند می‌توانند امتیازهای attention را ببینند.
پیشنهاد مقاله حاضر استفاده از TriAttention به‌جای نگاه کردن به attention scoreهای runtime، از هندسه بردارهای Q/K قبل از RoPE استفاده می‌کند تا پیش‌بینی کند کدام KV entry مهم است. چون به attention score نیاز ندارد، با FlashAttention تعارض ندارد. سپس با تکنیک‌هایی مثل forward-packing compaction یا hole-filling توکن‌های باقی‌مانده را فشرده و کنار هم می‌چیند تا blockهای کامل واقعاً آزاد شوند.

دلیل اینکه این مقاله خوب است چون که فشرده‌سازی KV cache فقط یک مسئله الگوریتمی نیست؛ باید با kernelها، allocatorها و نحوه مدیریت واقعی حافظه GPU سازگار باشد. TriAttention موفق‌تر است چون هم نیاز به attention scoreهای غیرقابل‌دسترسی را حذف می‌کند، هم بعد از eviction حافظه را واقعاً compact می‌کند تا blockهای GPU آزاد شوند.

🔸 KV Cache Compression and Its Infra Problems

#هوش_مصنوعی #پردازش_زبان_طبیعی

@AI_DeepMind
🔸 @AI_Person
7👍1👌1
اگر طلا دارین نفروشید درگیر جو حاضر نشید. خواستید بخرید ولی نفروشید. اگر میخواین بخرید طلا، مس، نفت بخرید البته روی پلتفرم های خارنجی
👍33🍓2
Forwarded from DeepMind AI Expert (Mehdi Dehghani)
معرفی #کتاب های #یادگیری_عمیق و #یادگیری_ماشین :

Data Mining and Machine Learning (Zaki)
👉link

Deep Learning
Foundations and Concepts, 2023, (Bishop)
👉link

Pattern Recognition and Machine Learning (Bishop)
👉link

Deep Learning (Goodfellow )
👉 link

Probabilistic Machine Learning_ An Introduction, 2022 , (Murphy)
👉link

Probabilistic Machine Learning: Advanced Topics, 2023 , (Murphy)
👉link

Dive into Deep Learning ,2023
👉link

Linear Algebra and Optimization for Machine Learning
👉link

Deep Learning with Python: Chollet, Francois
👉 link

Deep Learning with PyTorch Step-by-Step
👉 link

Mathematics for Machine Learning
👉 link

Hands-On Data Preprocessing in Python
👉 link

Mastering Machine Learning Algorithms
👉 link

Generative Deep Learning (David Foster)
👉 link

اگر کتاب های مهم دیگه ای هم میشناسید لطفا زیر همین پست کامنت کنید.

#هوش_مصنوعی #آموزش #شبکه_عصبی #مدل_های_دیپ_لرنینگ

🔸 مطالب بیشتر 👇👇

@AI_DeepMind
🔸 @AI_Person
16
روش ExpRL، به‌جای اینکه پاسخ‌های مرجع انسانی را مثل SFT مستقیماً تقلید کند، از آن‌ها فقط به‌عنوان reward scaffolds استفاده می‌کند. یعنی مدل هنگام تولید پاسخ، راه‌حل مرجع را نمی‌بیند؛ فقط یک LLM judge بعداً خروجی مدل را با راه‌حل مرجع مقایسه می‌کند و به میزان پیشرفت جزئی یا کامل آن امتیاز dense می‌دهد. هدف این است که حتی پاسخ‌های ناقص، اگر قدم‌های مفیدی به سمت حل مسئله برداشته‌اند، تقویت شوند.

روش ExpRL نوع استدلال مدل را هم تغییر می‌دهد: رفتارهایی مثل verification، self-correction و backtracking بیشتر می‌شوند. برداشت مقاله این است که RL priming خوب فقط به معنی افزایش چند رفتار عمومی مثل «بررسی جواب» نیست؛ بلکه باید هم رفتارهای جست‌وجومحور را زیاد کند و هم پوشش روی مسیرهای حل خاص هر مسئله را بهتر کند. این کار با استفاده از راه‌حل‌های مرجع به‌عنوان معیار پاداش dense انجام می‌شود، نه به‌عنوان چیزی که مدل مستقیماً تقلید کند. نتیجه‌ی مقاله این است که این روش نسبت به SFT، GRPO sparse و self-distillation، initialization بهتری برای RL بعدی می‌سازد.

🔸 ExpRL: Exploratory RL for LLM Mid-Training

#یادگیری_تقویتی #مقاله

@AI_DeepMind
🔸 @AI_Person
4
این گزارش TechCrunch درباره‌ی یک نقطه‌ی عطف در هوش مصنوعی در هوا-فضا است: برای اولین‌بار، یک ماهواره‌ی رصد زمین توانسته با کمک یک مدل بینایی-زبانی / VLM خودش در مدار تشخیص دهد دنبال چه چیزی بگردد، بدون اینکه تصویرها اول به زمین دانلود شوند و انسان‌ها یا سیستم‌های زمینی آن‌ها را تحلیل کنند. این اتفاق در آوریل ۲۰۲۶ روی ماهواره‌ی YAM-9 شرکت Loft Orbital رخ داده است.

ماهواره‌ای در مدار، با استفاده از Gemma 3 گوگل دیپ‌مایند و نرم‌افزار NAVI-Orbital ناسا JPL، توانسته به queryهای زبان طبیعی پاسخ دهد؛ مثلاً «محیط طبیعی کنار منطقه‌ی توسعه‌یافته‌ی انسانی را پیدا کن» یا «زیرساخت اطراف مراکز راه‌آهن را تشخیص بده». یعنی ماهواره فقط تصویر خام جمع نکرده، بلکه خودش در فضا تصویر را فهمیده و موارد مهم را جدا کرده است.
در آینده، به‌جای اینکه بگویی «از این منطقه عکس بگیر و بعداً روی زمین بررسی می‌کنیم»، می‌توانی به ماهواره بگویی:

«این مرز را پایش کن و اگر چیز مشکوکی دیدی خبر بده.»
یا:
«اطراف خطوط راه‌آهن دنبال زیرساخت خاص بگرد.»


ا Paul Lasserre از Loft Orbital می‌گوید این فناوری راه را برای always-on patrol layers in space باز می‌کند؛ یعنی لایه‌هایی از ماهواره‌ها که دائماً مناطق مشخصی را پایش می‌کنند و با منطق زبانی و تصویری تصمیم می‌گیرند چه چیزی مهم است.

این خبر فقط درباره‌ی «یک مدل روی یک ماهواره» نیست. پیام بزرگ‌تر این است که مسیر فناوری از ماهواره‌های تصویربردار به سمت ماهواره‌های فهمنده و تصمیم‌گیرنده می‌رود. یعنی سنسور فضایی دیگر فقط چشم نیست؛ کم‌کم مغز کوچک هم پیدا می‌کند.

در کوتاه‌مدت، کاربردش کاهش حجم داده و سریع‌تر کردن تحلیل است. در بلندمدت، می‌تواند پایه‌ای برای شبکه‌هایی از ماهواره‌های هوشمند، دستیارهای فضانوردی، پایش بلادرنگ زمین، و حتی زیرساخت محاسباتی بزرگ‌تر در فضا باشد. TechCrunch هم اشاره می‌کند که تجربه‌ی اجرای مدل‌های کوچک‌تر در مدار، برای آینده‌ی compute بزرگ‌تر در فضا، مخصوصاً در مدیریت انرژی و حافظه، درس‌های مهمی خواهد داشت.

🔸 A satellite just learned to find things on its own — here’s what that means

#مدل_بینایی #مدل_زبانی #بینایی_زبانی #هوا_فضا #پردازش_تصویر #مقاله

@AI_DeepMind
🔸 @AI_Person
7👌1
چطور می‌شود RNNها را طوری آموزش داد که مزیت حافظه‌ی فشرده و ثابت RNN را داشته باشند، ولی مشکل اصلی آموزش RNN یعنی Backpropagation Through Time یا BPTT را دور بزنند؟ مقاله روش Supervised Memory Training / SMT را پیشنهاد می‌کند.

مقاله می‌گوید به‌جای اینکه RNN را در زمان unroll کنیم و گرادیان را از آخر توالی تا اول برگردانیم، اول با یک مدل Transformer encoder-decoder یاد می‌گیریم «حافظه‌ی مناسب در هر لحظه» چیست. در آموزش، RNN روی حافظه‌های تولیدشده توسط encoder تمرین کرده، اما در inference باید با حافظه‌های خودش ادامه بدهد. خطاهای کوچک می‌توانند در طول rollout جمع شوند و باعث drift شوند.
روش SMT یک روش برای pretrain کردن RNNهای nonlinear بدون BPTT است. به‌جای backpropagation در طول کل زمان، یک Transformer حافظه‌های هدف را می‌سازد و RNN با supervised learning یاد می‌گیرد حافظه را یک قدم آپدیت کند. بعد DMT کمک می‌کند RNN هنگام استفاده از حافظه‌های خودش دچار drift نشود. نتیجه‌ی مقاله این است که این روش در وابستگی‌های بلندمدت، پایداری گرادیان، استفاده از حافظه و کارایی sequential compute بهتر از BPTT عمل می‌کند؛ بنابراین می‌تواند راهی برای scale کردن مدل‌هایی باشد که مثل RNN حافظه‌ی فشرده و ثابت از گذشته می‌سازند.

🔸 Pretraining Recurrent Networks without Recurrence

#مقاله #شبکه_عصبی_بازگشتی

@AI_DeepMind
🔸 @AI_Person
8👍1👌1
مدل‌های video generation می‌توانند نوعی world model باشند، چون آینده‌ی یک صحنه را شبیه‌سازی می‌کنند. اما مشکل این است که معمولاً برای تولید ویدئوی درست به یک prompt خیلی دقیق نیاز دارند؛ مثلاً فقط گفتن «هویج‌ها را خرد کن» کافی نیست، بلکه باید مرحله‌به‌مرحله توضیح داد چه چیزی حرکت کند و چه اتفاقی بیفتد. مقاله می‌گوید این باعث می‌شود چنین مدل‌هایی مستقیماً برای planning و decision-making مناسب نباشند، چون reasoning هنوز بیرون از مدل و معمولاً توسط یک LLM/VLM انجام می‌شود.

راه ساده‌ی دیگر، supervised fine-tuning روی زوج‌های «دستور داد و ویدئوی اجرای موفق تولید گردد» است، اما جمع‌آوری چنین داده‌ای برای کارهای متنوع، بلندمدت و دارای تعامل فیزیکی گران و سخت است. بنابراین مقاله دنبال راهی است که بدون ویدئوهای برچسب‌خورده‌ی task-execution، توانایی اجرای task را از خود مدل ویدئویی بیرون بکشد.

برای ساخت داده، مقاله از یک VLM استفاده می‌کند: از روی تصویر بدون برچسب، VLM یک task مناسب و یک solution prompt مفصل تولید می‌کند. سپس Demonstrator با آن solution prompt ویدئو تولید می‌کند و Executor یاد می‌گیرد از فقط task prompt کوتاه به همان نوع trajectory برسد. این یعنی دانش اجراییِ promptهای مفصل به یک interface کوتاه و instruction-conditioned منتقل می‌شود.

اگر Executor فقط Demonstrator را تقلید کند، سقف عملکردش محدود به آموزش دهنده می‌شود. مقاله برای عبور از این سقف از RL با بازخورد VLM استفاده می‌کند: Executor چند ویدئو تولید می‌کند، VLM بررسی می‌کند آیا task انجام شده یا نه، و rolloutهای بهتر تقویت می‌شوند. منطق مقاله این است که «ساختن ویدئوی درست» سخت‌تر از «تشخیص اینکه ویدئو task را انجام داده یا نه» است؛ بنابراین VLM می‌تواند به‌عنوان verifier یا reward model استفاده شود.

اما پاداش VLM به‌تنهایی خطرناک است، چون ممکن است reward hacking رخ دهد؛ مثلاً مدل شیء را غیرواقعی ظاهر یا ناپدید کند تا VLM فکر کند task انجام شده. برای همین WMSD یک Demonstrator anchor و یک consistency reward اضافه می‌کند تا مدل از دینامیک بصری و فیزیکی معقول دور نشود.

مقاله WMSD را روی DreamGen robotics benchmark هم ارزیابی می‌کند. نکته‌ی جالب این است که WMSD بدون task-specific supervision در بعضی معیارها با مدل‌های SFT‌شده رقابتی است. مثلاً در جدول DreamGen، نسخه‌ی WMSD مبتنی بر LTX-2 در معیار Object به 70.0 می‌رسد که از بسیاری baselineهای zero-shot و حتی بعضی SFTها بهتر است. در Behavior و Environment هم نسبت به LTX-2 zero-shot بهبود محسوسی دارد.

روش WMSD تلاش می‌کند مدل‌های ویدئویی را از “مولد ویدئو با prompt مفصل” به “world model دستورپذیر برای حل task” تبدیل کند. روش ابتدا با self-distillation دانش اجرایی Demonstrator را به Executor منتقل می‌کند، بعد با RL و بازخورد VLM، Executor را از تقلید صرف فراتر می‌برد. نتیجه‌ی اصلی مقاله این است که ترکیب on-policy self-distillation، reward مبتنی بر VLM، و anchor به teacher می‌تواند task-solving، درست‌بودن عامل، و سازگاری فیزیکی را بهتر کند، بدون نیاز به ویدئوهای task-execution برچسب‌خورده و بدون افزایش هزینه‌ی inference.

🔸 World Model Self-Distillation: Training World Models to Solve General Tasks

#یادگیری_تقویتی #مقاله #ایده_جذاب #مدل_مولد #رباتیک

@AI_DeepMind
🔸 @AI_Person
7👍1
این پلاگین Ponytail باعث میشه AI کدنویس کمتر over-engineer کنه و قبل از نوشتن کد زیاد، دنبال راه ساده‌تر بگرده.

یعنی ایده‌اش اینه که وقتی به AI میگی یه قابلیت بسازه، به‌جای اینکه سریع ۸۰ خط کد بنویسه، اول اینا رو چک کنه:

اصلاً لازم هست یا نه؟
توی standard library خود زبان هست؟
خود پلتفرم/مرورگر این قابلیت رو داره؟
توی dependencyهای فعلی پروژه هست؟
با یک خط کد حل میشه؟
فقط اگر هیچ‌کدوم نبود، کد مینیمال بنویسه.


مثالش هم میگه:
به‌جای اینکه AI بیاد date picker کامل با library و wrapper و logic بسازه،

بهترین کد، کدیه که اصلاً لازم نبوده بنویسی؛ چون کد کمتر یعنی باگ کمتر، نگهداری کمتر، هزینه کمتر.

🔸 Ponytail

#برنامه_نویسی #هوش_مصنوعی #منابع

@AI_DeepMind
🔸 @AI_Person
👍5🔥43👌1