VIRSUN

🌊 پروتکل جدید ردیابی دینامیکی — ITTO از Caltech 🐠

محققان دانشگاه Caltech مجموعه‌بنچ‌مارک جدیدی به نام ITTO معرفی کرده‌اند —
سیستمی برای ارزیابی و تحلیل روش‌های ردیابی در حرکات پیچیده و بلندمدت 🔍

💡 ویژگی‌ها:

♻️طراحی‌شده برای حرکات طولانی، پیچیده و غیرخطی

♻️تمرکز بر ارزیابی پایداری در فریم‌های زیاد

♻️مناسب برای آموزش و تست الگوریتم‌های بینایی ماشین در سناریوهای واقعی

📘 مجوز: CC BY-NC 4.0 — استفاده‌ی آزاد برای اهداف پژوهشی

🔗 لینک‌ها:
📄 مقاله
🌐 پروژه
💾 کد منبع

@rss_ai_ir
#AI #Tracking #ComputerVision #Caltech #Research #OpenSource

❤1

295 views09:30

VIRSUN

🚀 NVIDIA
دوباره صحنه رو آتیش زد!

روش جدیدشون به نام GenCluster باعث شد برای اولین بار یک مدل متن‌باز بتونه به سطح مدل‌های بسته‌ی شرکت‌های بزرگ برسه 💥

🧠 مدل gpt-oss-120b موفق شد در المپیاد بین‌المللی انفورماتیک (IOI 2025) مدال طلا بگیره —
اولین باریه در تاریخ که این افتخار نصیب یک مدل open-source شده! 🥇

📊 چطور کار می‌کنه؟
مدل هزاران راه‌حل برنامه‌نویسی تولید می‌کنه،
اون‌ها رو تست و گروه‌بندی می‌کنه،
و بین بهترین‌ها یک «تورنمنت هوش مصنوعی» برگزار می‌کنه،
که داوری‌اش هم با یک مدل هوش مصنوعی دیگه‌ست 😎

📈 نتیجه:
۴۴۶.۷۵ امتیاز و مدال طلای رسمی IOI
یک جهش بزرگ در سمت استدلال و حل مسئله‌ی سطح انسانی توسط مدل‌های باز

📄 جزئیات مقاله:

🔗 arxiv.org/abs/2510.14232v1

#NVIDIA #GenCluster #AI #OpenSource #LLM #Research #MachineLearning #IOI2025

❤1👏1

1.51K viewsedited 09:31

VIRSUN

1:20

This media is not supported in your browser

VIEW IN TELEGRAM

🌏 Hunyuan World 1.1 (WorldMirror) —
نسخه‌ی جدید مدل متن‌باز تولید جهان سه‌بعدی از Tencent Hunyuan

در حالی‌که نسخه‌ی قبلی Hunyuan World 1.0 برای ساخت جهان‌های سه‌بعدی از متن یا تصاویر تک‌زاویه‌ای طراحی شده بود و روی GPUهای معمولی اجرا می‌شد، نسخه‌ی جدید 1.1 حالا از ویدیوها و تصاویر چندزاویه‌ای پشتیبانی می‌کند.

🎯 ویژگی‌های کلیدی:

ورودی آزاد (Any Input): از ویدیو، تصویر، نقشه عمق و پارامترهای دوربین پشتیبانی می‌کند و ساختار سه‌بعدی دقیق و بدون اعوجاج می‌سازد.

خروجی آزاد (Any Output): تولید هم‌زمان چندین نمای سه‌بعدی — از جمله نقشه عمق، ابر نقاط (Point Cloud)، نرمال سطوح و Gaussian Splatting.

سرعت بالا: مدل از نوع Feed-Forward است و تمام ویژگی‌های سه‌بعدی را تنها در چند ثانیه و در یک GPU تولید می‌کند.

⚙️ این مدل به‌نوعی ادامه‌ی مسیر تکاملی مدل‌های تولید ویدیو است — با این تفاوت که حالا می‌تواند جهان‌های کامل را بازسازی کند.
در حالی‌که گوگل با مدل GENIE-3 پاسخ داده، OpenAI هنوز هیچ معادل مستقیمی برای این فناوری ندارد.

💻 منابع:
🔹 کد: github.com/Tencent-Hunyuan/HunyuanWorld-Mirror
🔹 پروژه: 3d-models.hunyuan.tencent.com/world/
🔹 دمو: Hugging Face Space
🔹 مقاله: Tech Report PDF

@rss_ai_ir
#AI #3D #GenerativeAI #Hunyuan #Tencent #OpenSource #هوش_مصنوعی #سه‌بعدی #مدل_تولیدی

👍2🔥1👏1

1.6K views15:50

VIRSUN

⚡️ LMMs Engine –
موتور واحد برای آموزش مدل‌های چندوجهی (Multimodal)

فریم‌ورکی ساده، منعطف و قدرتمند از LMMs-Lab برای آموزش مدل‌هایی که هم‌زمان می‌توانند متن، تصویر، صدا و ویدیو را درک کنند — همه در یک محیط یکپارچه 🎛️

🎯 ویژگی‌ها:

پشتیبانی از بیش از ۱۹ معماری مختلف:

🧠 Qwen3-VL:
پردازش تصویر با رزولوشن اصلی و کانتکست بیش از ۱۰٬۰۰۰ توکن

🎧 Qwen2.5-Omni:
مدل واحد برای متن، تصویر و صوت

🎥 WanVideo:
تولید ویدیو از متن، تصویر یا ویدیو (T2V, I2V, V2V)

🌫 dLLM:
مدل‌های زبانی دیفیوژنی

🪄 LLaVA-OneVision، Bagel، SiT، RAE-SigLip و دیگر مدل‌های پیشرفته

📜 لایسنس: Apache 2.0 — قابل‌استفاده حتی در پروژه‌های تجاری

🔗 گیت‌هاب:
github.com/EvolvingLMMs-Lab/lmms-engine

@rss_ai_ir
#AI #Multimodal #OpenSource #DeepLearning #LLM #LMMsEngine

❤2

287 views16:17

VIRSUN

0:03

This media is not supported in your browser

VIEW IN TELEGRAM

🦄 مدل چندوجهی «PixelRefer»؛ فهم ناحیه‌ای دقیق در تصویر و ویدئو

🎯 چارچوب یکپارچه‌ی MLLM که به‌جای نگاه کلی به صحنه، روی ناحیه‌های مشخص تمرکز می‌کند؛ هم در تصاویر ثابت، هم در ویدئوهای پویا. نتیجه: دقت بالاتر در اشاره به ناحیه‌ها، رفع سوگیری صحنه‌محور، و رکوردهای SOTA.

چه می‌دهد؟

🎥🖼️ فهم ناحیه‌ای دقیق در تصویر/ویدئو (region-level grounding)

🧠 رفع bias مدل‌های قبلی که فقط صحنه‌ی کلی را می‌دیدند

🚀 نتایج SOTA + دموی آنلاین، دیتاست و کد متن‌باز

لینک‌ها:

Paper: arxiv.org/pdf/2510.23603
Project: circleradon.github.io/PixelRefer
Repo: https://github.com/alibaba-damo-academy/PixelRefer

@rss_ai_ir
#MLLM #Multimodal #VisionLanguage #Grounding #ReferringSegmentation #SOTA #OpenSource

1.42K views18:14

VIRSUN

🛠️📊 Dev3000 —
لاگ‌گیری هوشمند با پشتیبانی از هوش مصنوعی

ابزار Dev3000 تمام رویدادهای توسعه‌ی وب‌اپلیکیشن شما را به‌صورت زمانی ثبت می‌کند — از لاگ‌های سرور و رویدادهای مرورگر تا اسکرین‌شات‌های خودکار.
با این روش، ابزارهایی مثل Claude می‌توانند تمام داده‌ها را یکجا تحلیل کنند و در عیب‌یابی به شما کمک کنند. 🤖

🚀 ویژگی‌های کلیدی:

ذخیره‌ی لاگ‌ها با زمان‌بندی دقیق ⏱️

ثبت خودکار اسکرین‌شات‌ها هنگام خطا یا جابه‌جایی در صفحات 📸

پشتیبانی از تحلیل و دیباگ خودکار با هوش مصنوعی 🤖

جستجو و فیلتر سریع بین لاگ‌ها 🔍

رابط گرافیکی زیبا برای مرور آسان اطلاعات 💡

📎 GitHub:
github.com/vercel-labs/dev3000

@rss_ai_ir
#AI #DevTools #Debugging #JavaScript #WebDevelopment #Claude #OpenSource

1.39K viewsedited 18:18

VIRSUN

🤖 GaussGym:
انقلابی در آموزش ربات‌ها از طریق پیکسل‌ها — سریع، فتوواقع‌گرایانه و متن‌باز

فریم‌ورک جدید GaussGym معرفی شد — اولین پلتفرم open-source که سرعت بسیار بالا را با بینایی فتوواقعی (Photorealistic Vision) در شبیه‌سازی ربات‌ها ترکیب می‌کند. 🚀

این سیستم با استفاده از 3D Gaussian Splatting به‌عنوان یک رندرکننده‌ی تعبیه‌شده در شبیه‌سازهای وکتوریزه (مانند IsaacGym)، قادر است سیاست‌های بینایی-حرکتی (Visuomotor Policies) را تنها از تصاویر RGB با سرعتی بیش از ۱۰۰٬۰۰۰ گام در ثانیه آموزش دهد — حتی روی یک کارت RTX 4090! ⚡

🔹 ساخت دنیای تمرینی از ویدیوهای iPhone، دیتاست‌های GrandTour و ARKit یا حتی ویدیوهای مولد (مثل Veo)
🔹 بازسازی خودکار صحنه‌های فیزیکی دقیق با کمک VGGT و NKSR بدون نیاز به مدل‌سازی دستی سه‌بعدی
🔹 آموزش سیاست‌های حرکت و ناوبری مستقیم از پیکسل‌ها و انتقال آن‌ها به دنیای واقعی بدون هیچ تنظیم اضافی (Zero-Shot Sim2Real) — نمونه‌ی آزمایشی شامل بالا رفتن ربات از پله‌های ۱۷ سانتی‌متری
🔹 پشتیبانی از عمق، motion blur، randomization دوربین و سایر افکت‌های واقع‌گرایانه برای بهبود انتقال

تمامی کدها، داده‌ها، مدل‌ها و دیتاست‌ها به‌صورت کاملاً متن‌باز در دسترس هستند 👇
🔗 دمو: escontrela.me/gauss_gym
📄 مقاله: arxiv.org/abs/2510.15352
💾 داده‌ها: huggingface.co/collections/escontra/gauss-gym-datasets
💻 کد: github.com/escontra/gauss_gym

✨مدل GaussGym مرز بین سرعت و واقع‌گرایی را در رباتیک از بین برده و مسیر آموزش ربات‌ها از تصاویر را واقعاً مقیاس‌پذیر کرده است.

@rss_ai_ir
#AI #Robotics #Simulation #GaussGym #IsaacGym #3DGS #OpenSource

1.48K views17:39

VIRSUN

🚀 استفاده از مدل‌های زبانی در Go با کتابخانه‌ی جدید yzma

کتابخانه‌ی yzma امکان اجرای مدل‌های زبانی (LLM)، مدل‌های دید-زبان (VLM) و سایر معماری‌ها را به‌صورت بومی روی سخت‌افزار خودتان فراهم می‌کند — با پشتیبانی کامل از شتاب سخت‌افزاری و بدون نیاز به CGo! ⚙️

💡 ویژگی‌های کلیدی:
🔹 پشتیبانی از VLM، LLM، SLM و TLM در یک پکیج واحد
🔹 بهره‌گیری کامل از شتاب‌دهنده‌های سخت‌افزاری برای بیشترین سرعت
🔹 بدون نیاز به C compiler — نصب و اجرا تنها با Go
🔹 کاملاً سازگار با نسخه‌های جدید llama.cpp
🔹 همراه با نمونه‌کدهای آماده برای انواع مدل‌ها

📦 سیستم‌عامل‌های پشتیبانی‌شده:

Linux 🐧

macOS 🍎

Windows 💻

📌 سورس‌کد و مستندات:
github.com/hybridgroup/yzma

با yzma، زبان Go بالاخره ابزار قدرتمند و ساده‌ای برای استفاده مستقیم از مدل‌های هوش مصنوعی روی دستگاه محلی پیدا کرده است. 🚀

@rss_ai_ir
#Go #LLM #VLM #AI #yzma #MachineLearning #OpenSource

👍2

1.47K views03:15

VIRSUN

🎉 مدل Qwen3-VL حالا در llama.cpp اجرا می‌شود! 🤖💥

خبر عالی برای عاشقان اجرای محلی مدل‌ها —
حالا می‌توانید Qwen3-VL را مستقیماً روی دستگاه خود اجرا کنید، بدون نیاز به ابر یا سرویس‌های جانبی!

🚀 پشتیبانی کامل از:

✳️CPU
✳️CUDA
✳️Metal
✳️Vulkan
و سایر بک‌اندهای رایج.

📦 وزن‌های GGUF برای همه نسخه‌ها در دسترس است — از ۲B تا ۲۳۵B.
این یعنی از لپ‌تاپ تا ایستگاه کاری قدرتمند، می‌توانید نسخه‌ای مناسب اجرا کنید.

---

🔗 منابع:
🤗 Hugging Face
🤖 ModelScope
📌 PR در llama.cpp

📡 @rss_ai_ir
#هوش_مصنوعی #LLM #Qwen3 #LlamaCpp #AI #OpenSource

❤5

1.17K viewsedited 14:25

VIRSUN

0:54

This media is not supported in your browser

VIEW IN TELEGRAM

💻 در llama.cpp رابط وب شبیه Automatic1111 ساخته شد! 🤖⚙️

توسعه‌دهندگان llama.cpp حالا نسخه‌ای از WebUI مخصوص خودشان را ارائه کرده‌اند — چیزی شبیه Automatic1111 برای Stable Diffusion، اما این‌بار برای مدل‌های زبانی (LLM)!

برخلاف ابزارهای تولید تصویر که صدها پارامتر دارند، این رابط ساده‌تر است و بیشتر شبیه ChatGPT یا Qwen Chat عمل می‌کند.
کافی است:
1️⃣ سرور محلی خود را اجرا کنید،
2️⃣ آدرس 127.0.0.1 را در مرورگر باز کنید،
3️⃣ و از طریق رابط وب به صدها مدل بازمتن دسترسی پیدا کنید.

📂 همچنین می‌توانید تصاویر یا اسناد خود را آپلود کنید تا مدل مستقیماً با داده‌های شما کار کند.

📘 دستورالعمل کامل در گیت‌هاب:
👉 github.com/ggml-org/llama.cpp#hot-topics

📡 @rss_ai_ir
#هوش_مصنوعی #llamaCpp #LLM #OpenSource #AI #WebUI

🔥4❤1

1.16K views15:02

About

Blog

Apps

Platform