DeepMind AI Expert
15.4K subscribers
1.37K photos
398 videos
122 files
2.44K links
مقالات کاربردی هوش مصنوعی در پایتون، علوم پزشکی، علوم انسانی، علوم اعصاب و...
دوره های آموزشی از دانشگاه های بزرگ و موسسات انلاین
پژوهشگران هوش مصنوعی ایران

یک چای مهمون کن

https://daramet.com/farzaddd

ارتباط با من:
https://t.iss.one/AI_DeepMind?direct
Download Telegram
#مقاله JoyAI-VL-Interaction یک مدل بینایی زبان ۸ میلیاردپارامتری که به‌جای مدل‌های معمول «نوبتی» که فقط بعد از سؤال کاربر پاسخ می‌دهند، دائماً ویدئو را می‌بیند و هر ثانیه خودش تصمیم می‌گیرد: ساکت بماند، پاسخ بدهد، یا کار سخت‌تر را به یک مدل/عامل پس‌زمینه واگذار کند. ایده‌ی اصلی مقاله این است که برای دنیای واقعی، مثل دوربین امنیتی، عینک هوشمند، پخش زنده یا کمک به کاربر هنگام آشپزی، مدل باید «حاضر» باشد و قبل از اینکه کاربر بپرسد، لحظه‌ی مهم را تشخیص دهد.

مشکل مدل‌های فعلی فقط سرعت نیست؛ مشکل این است که ذاتاً turn-based هستند، یعنی فقط وقتی کاربر چیزی می‌گوید فعال می‌شوند. JoyAI-VL-Interaction می‌خواهد این را به مدل event-driven / interaction model تبدیل کند: مدلی که جریان زنده‌ی تصویری را دنبال می‌کند و زمان درستِ حرف زدن را خودش انتخاب می‌کند.

این مقاله می‌گوید مسیر بعدی VLMها فقط «باهوش‌تر شدن» نیست، بلکه تعامل‌گرتر شدن است: مدل باید بتواند حاضر باشد، ببیند، زمان را بفهمد، خودش تصمیم بگیرد چه زمانی صحبت کند، و برای مسائل سخت‌تر از عامل پس‌زمینه کمک بگیرد. نقطه قوت اصلی کار، تبدیل proactivity و timing به قابلیت درونی مدل است، نه یک polling loop یا trigger بیرونی.

🔸 JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

#مدل_بینایی #بینایی_ماشین

☑️ @AI_DeepMind
@AI_Person
13👌6👍2
چرا مدل‌های بزرگ‌تر کارهایی را یاد می‌گیرند که مدل‌های کوچک‌تر یاد نمی‌گیرند. پاسخ نویسندگان این است: مسئله فقط «قدرت بیان مدل» یا «نمونه‌کارایی» نیست؛ در داده‌های مخلوط، بین تسک‌ها برای استفاده از نورون‌ها/ظرفیت مدل رقابت ایجاد می‌شود. مدل‌های کوچک‌تر ظرفیت خود را بیشتر صرف تسک‌های پرتکرار یا ساده می‌کنند و بنابراین تسک‌های نادر یا پیچیده را از دست می‌دهند.

🔸 Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention

#مقاله #پردازش_زبان_طبیعی

☑️ @AI_DeepMind
@AI_Person
👍53
مدل پر سروصدای fable 5 که توسط پنتاگون آمریکا براخلاف امنیت ملی تشخیص داده شده بود برای انتشار مجوز گرفت ولی باید برای دسترسی بهش تایید هویت کنید.
5
این #مقاله چارچوب به نام LatentMAS معرفی می‌کند که در آن ایجنت‌های LLM به‌جای اینکه با متن و Chain-of-Thought با هم حرف بزنند، مستقیماً در فضای نهفته/latent space با هم همکاری می‌کنند. ایده اصلی این است که متن، واسطه‌ای پرهزینه و کم‌فشرده برای انتقال فکر بین ایجنت‌هاست؛ بنابراین بهتر است «فکرهای داخلی» مدل، یعنی hidden states و KV cache، بین ایجنت‌ها منتقل شود. همکاری چندایجنتی لزوماً نباید از طریق متن انجام شود.

در سیستم‌های چندایجنتی معمول، یک ایجنت خروجی متنی می‌دهد و ایجنت بعدی همان متن را دوباره encode می‌کند. LatentMAS این مسیر را حذف می‌کند: هر ایجنت چند گام latent thought تولید می‌کند، یعنی به‌جای تولید token، hidden representation لایه آخر را به‌صورت autoregressive ادامه می‌دهد. سپس این اطلاعات از طریق latent working memory، یعنی KV cache لایه‌ها، به ایجنت بعدی منتقل می‌شود.برای اینکه hidden state لایه آخر دوباره به‌عنوان ورودی معتبر مدل استفاده شود، مقاله یک ماتریس هم‌ترازی خطی به نام Wa تعریف می‌کند. این ماتریس hidden vector را به فضای embedding ورودی نزدیک می‌کند تا مدل در گام‌های latent دچار activation خارج از توزیع نشود.

🔸 Latent Collaboration in Multi-Agent Systems

#مقاله #پردازش_زبان_طبیعی

☑️ @AI_DeepMind
@AI_Person
9👍2👌1
میگن امروز روز جهانی دختر هست خواستم توجهتون رو جلب کنم که در این روز چه مناسبت‌هایی داریم:

۵ تیر روز تجلیل از اسرا و مفقودان
روز صنعت ابزارآلات
روز جهانی مبارزه با مواد مخدر

روز جهانی دختر در مهر ماه هست.
23👍12
از صبح جمعه تا الان شبکه چنان اختلالی رو داره تجربه میکنه ک فک میکنم از اتفاقی نیفتاده داره اتفاقی میفته 😂

رادار اروان هم میگه اکثر دیتاسنترا خاموشن
👍73
در گفت‌وگوها، اگر نمی‌توانید کسی را با منطق و استدلال خود قانع کنید، به توهین، تحقیر یا جملاتی مانند «ساکت باش» و «حرف دهنت را بفهم» متوسل نشوید. یاد بگیرید که گاهی دو نفر ممکن است در اصلِ مسیر و ماهیت موضوع هم‌نظر باشند، اما در شیوه‌ی بیان، درک و برداشتشان از مسئله تفاوت داشته باشد. پیش از آنکه سخنی بگویید، ابتدا روشن کنید دقیقا چه می‌خواهید، چه می‌فهمید و چه می‌گویید؛ سپس نظر خود را بیان کنید.

کتاب بخوانید تا دایره واژگان شما در بیان احساسات و عقاید خودتان تا بتوانید به روشنی چیزی را بیان کنید.
👌25👍85
Forwarded from Hanif AI Co
🚀 به تیم ما در قلب فناوری ایران بپیوندید!

ما در شرکت فناوری هوشمند حنیف در برج فناوری شریف، در حال توسعه پلتفرم‌های مبتنی بر هوش مصنوعی مولد هستیم.
برای تکمیل تیم توسعه در موقعیت‌های زیر هم‌تیمی می‌پذیریم:

🧠 مهندس NLP / Agentic AI
طراحی و توسعه عامل‌های هوشمند با LangChain و LangGraph و بهینه‌سازی معماری‌های RAG برای درک عمیق اسناد تخصصی فارسی.
🔗لینک توضحات و ارسال رزومه

🎨 طراح UI/UX
طراحی تجربه‌ای روان و حرفه‌ای برای داشبوردها و سامانه‌های پیچیده؛ تسلط بر Figma
🔗لینک توضیحات و ارسال رزومه

💻 برنامه‌نویس Full-Stack (React & Django)
توسعه‌ی بک‌اند پایدار، امن و مقیاس‌پذیر و اتصال آن به رابط‌های کاربری پویا و تعاملی.
🔗لینک توضحات و ارسال رزومه

🔬 محقق هوش مصنوعی (AI Researcher)
طراحی بنچمارک‌های اختصاصی، کاهش توهم مدل‌ها، تحلیل عملکرد LLMها و توسعه روش‌های ترکیب خروجی مدل‌ها.
🔗لینک توضیحات و ارسال رزومه

📌 ارتباط با ما:
🌐 وب‌سایت: hanif-ai.com
📱 تلگرام و بله: @hanif_aitech

♻️ اگر کسی را می‌شناسی که این فرصت برایش مناسب است، این پست را برایش بفرست. ممنونیم! 🤝
6
این مقاله درباره‌ی VisualClaw است؛ یعنی یک عامل چندوجهی/بینایی‌ـ‌زبانی که برای دنیای واقعی طراحی شده: ویدئوی زنده را می‌بیند، فقط فریم‌های مهم را به مدل می‌فرستد، از تجربه‌های قبلی یاد می‌گیرد، و به‌مرور برای کاربر شخصی‌سازی می‌شود.

ایده‌ی اصلی مقاله این است که VLMها یا مدل‌های vision-language برای کارهای ویدئویی خیلی قوی شده‌اند، اما در استفاده‌ی واقعی سه مشکل دارند: پردازش فریم‌های زیاد و پرامپت‌های طولانی گران و کند است؛ عامل بعد از استقرار معمولاً ثابت می‌ماند و از شکست‌هایش یاد نمی‌گیرد؛ و بنچمارک‌های رایج ویدئو-QA معمولاً فقط جواب دادن به سؤال را می‌سنجند، نه انجام کار واقعی در یک workspace با فایل، ابزار، و شواهد تصویری.

نکته‌ی جالب این است که VisualClaw وزن‌های مدل اصلی را تغییر نمی‌دهد. یعنی مثلاً از Gemini 3 Flash یا GPT-5.2 به‌عنوان مدل frozen استفاده می‌کند، اما با حافظه، skill bank، انتخاب فریم، و evolution بیرونی باعث می‌شود عملکرد عامل بهتر شود. این برای کاربردهایی مثل عینک هوشمند، دستیار شخصی تصویری، یا agentهای دنیای واقعی مهم است، چون نمی‌توان همیشه همه‌ی ویدئو را کامل به مدل فرستاد.


روش فشرده‌سازی ویدئو در مقاله ساده ولی کاربردی است: سیستم ابتدا با perceptual hash فریم‌های تکراری را حذف می‌کند، بعد با یک encoder سبک ۱۲۸بعدی روی CPU تغییرات صحنه را می‌سنجد، و بعد با adaptive change gate تصمیم می‌گیرد کدام فریم واقعاً ارزش ارسال به cloud VLM را دارد. این یعنی سیستم لازم ندارد کل ویدئو را از قبل داشته باشد؛ می‌تواند روی stream زنده و نامحدود کار کند.

برای skill bank هم مقاله از مدل hot/cold injection استفاده می‌کند. مهارت‌های خیلی مرتبط با سؤال به‌صورت کامل وارد پرامپت می‌شوند؛ این‌ها بخش hot هستند. بقیه‌ی مهارت‌ها فقط با نام و توضیح کوتاه معرفی می‌شوند؛ این‌ها بخش cold هستند. هدف این است که با بزرگ شدن بانک مهارت‌ها، پرامپت خیلی طولانی و گران نشود.

▪️ VisualClaw: A Real-Time, Personalized Agent for the Physical World

#مقاله #علوم_پزشکی #هوش_مصنوعی #یادگیری_تقویتی #مدل_مولد #بینایی_ماشین #بینایی_زبانی

☑️ @AI_DeepMind
@AI_Person
9
ولی ژاپنی ها به ارزوشون رسیدن که بتونن با برزیل بازی کنن، یاد فوتبالیستا بخیر و چه روزگاری بود 🥹😄
22🆒1
بهینه‌سازی‌های مرحله‌ی Inference اگر می‌خواستید پاسخ‌های LLM را به زیر یک ثانیه برسانید این موارد رو مطالعه کنید.

1. KV-Caching
2. Speculative Decoding
3. FlashAttention
4. PagedAttention
5. Batch Inference
6. Early Exit Decoding
7. Parallel Decoding
8. Mixed Precision Inference
9. Quantized Kernels
10. Tensor Parallelism
11. Pipeline Parallelism
12. Sequence Parallelism
13. Graph Optimization (ONNX, TensorRT)
14. Dynamic Batching
15. Memory Offloading
16. Streaming Generation

#الگوریتمها #منابع #هوش_مصنوعی #پردازش_زبان_طبیعی #مقاله

☑️ @AI_DeepMind
@AI_Person
13👌2
Forwarded from DeepMind AI Expert
فروش فیلترشکن قابل ارایه و پشتیبانی برای تمام پلتفرمهای هوش مصنوعی و ... بدون ضریب

هرگیگ برای نت همراه اول 7 تومن
هرگیگ برای همه خطوط 11 تومن

آفر ویژه کانال روی نت همراه اول 200 گیگ 200 تومن


اشتراک نامحدود یک ماهه و دو کاربره برای زمان عادی 800 تومن به صورت محدود قابل فروش هست


بهم پیام بدید
@Farzadh1h
2👌1
این ریپو گیتهاب به ایجنت‌ها دسترسی Twitter/X، Reddit، YouTube، GitHub، LinkedIn و چندین پلتفرم دیگه رو میده بدون API Key و رایگان
برای کسایی که روی Agentها کار می‌کنن چیز جالبیه

https://github.com/Panniantong/Agent-Reach

#الگوریتمها #برنامه_نویسی

☑️ @AI_DeepMind
@AI_Person
9👌1
Forwarded from Amin
یک API رایگان برای GLM-5.2 منتشر شده!

سرویس glm.babel.town ادعا می‌کنه اولین API کاملاً رایگان این مدل رو ارائه داده.

بدون ثبت‌نام
بدون API Key
رایگان
سازگار با OpenClaw و Hermes

اگر روی AI Agentها کار می‌کنی، ارزش امتحان کردن داره.
4
DeepMind AI Expert
آفر ویژه کانال روی نت همراه اول 200 گیگ 200 تومن
آفر ویژه 200 گیگ کانال روی تمام شبکه ها اپتیمایز شد الان میتونید با قیمت 400 تومن تهیه کنید
1🍓1
پسادکترا #اپلای
3🔥1🍓1
آقای Sheldon Axler، نویسنده کتاب جبر خطی این کتاب توسط ایشان و نویسندگان ایرانی به فارسی ترجمه شده است

▪️ Linear Algebra Done Right

#ریاضی #منابع

☑️ @AI_DeepMind
@AI_Person
20👍1👌1
مدل Claude Sonnet 5 معرفی شد

☑️ @AI_DeepMind
@AI_Person
21