Tensorflow(@CVision)

این ویدیو آموزشی درباره نحوه ذخیره‌سازی اطلاعات در مدل‌های زبان بزرگ هستش

ویدیو با یک مثال شروع می‌شه: اگر به یک مدل زبانی بزرگ عبارت

مایکل جردن ___ بازی می‌کند

را بدین و از اون بخواین پیش‌بینی کنه که کلمه بعدی چی باید باشه، اگر مدل به درستی "بسکتبال"رو پیش‌بینی کنه، نشان دهنده این هستش که در جایی از صدها میلیارد پارامتر اون، اطلاعاتی درباره یک فرد خاص و ورزش خاص او ذخیره شده.

سپس ویدیو به این سوال می‌پردازه که این اطلاعات چگونه ذخیره میشن و کجا قرار دارند. محققان گوگل DeepMind در این زمینه تحقیق کردن و نتیجه گرفتن که این اطلاعات در بخشی از شبکه‌های عصبی به نام "چندلایه پرسپترون" (MLPs) ذخیره می‌شن، اما درک کامل مکانیسم این ذخیره‌سازی هنوز حل نشده.

ویدیو سپس به جزئیات معماری ترانسفورمرها، که پایه و اساس بسیاری از مدل‌های زبان بزرگ هستند، می‌پردازه. بخش اصلی این معماری "چندلایه پرسپترون"ه که محاسبات اون نسبتا ساده، اما تفسیر این محاسبات بسیار چالش‌برانگیزه.

هدف اصلی ویدیو بررسی این محاسبات و ارائه یک مثال مشخص از نحوه ذخیره‌سازی یک واقعیت در این بخش از شبکه ست. این مثال نشون می‌ده که چگونه مدل می‌تونه واقعیت "مایکل جردن بسکتبال بازی می‌کند" را ذخیره کنه.

ویدیو سپس به جزئیات محاسبات در " پرسپترون چند لایه" می‌پردازه، از جمله ضرب ماتریس‌ها و تابع غیرخطی ReLU. همچنین به تعداد پارامترهای این بخش و نحوه عملکرد آن در پیش‌بینی کلمه بعدی می‌پردازه.

در نهایت، ویدیو به ایده "اثر همپوشانی" اشاره می‌کنه که و توضیح میده چرا مدل‌های زبان بزرگ با افزایش اندازه عملکرد بهتری دارن. این ایده می‌گه که در فضاهای با ابعاد بالا، می‌توان اطلاعات زیادی را در فضاهای تقریبا عمود به هم ذخیره کرد، حتی اگر این اطلاعات کاملاً مستقل نباشن.

https://youtu.be/9-Jl0dxWQs8

YouTube

How might LLMs store facts | Deep Learning Chapter 7

Unpacking the multilayer perceptrons in a transformer, and how they may store facts
Instead of sponsored ad reads, these lessons are funded directly by viewers: https://3b1b.co/support
An equally valuable form of support is to share the videos.

AI Alignment…

👍10❤4

3.95K viewsAlister ☄️, edited 02:48