متخصصان علم داده ها data scientists
1.4K subscribers
1.5K photos
240 videos
281 files
481 links
ارتباط با ادمین @IDataScientist
صفحه لینکدین
https://www.linkedin.com/groups/6728779/
Download Telegram
🔍تعداد کاربران چت‌جی‌پی‌تی و گوگل‌جمینای از یک‌میلیارد نفر گذشت
#ChatGPT
#Google
@toobabigdatascience
👏2
🔍 رمزگشایی از رازهای رگرسیون
رگرسیون خطی شاید ساده به نظر برسد، اما پشت آن خطِ راست، دنیایی از مفاهیم و نکات نهفته است.

🔖در ادامه، ۷ نوع قدرتمند از رگرسیون را معرفی می‌کنیم که هر دانشمند داده‌ای باید در جعبه‌ابزار خود داشته باشد:

📈 رگرسیون خطی ساده (Simple Linear) – با فقط یک ویژگی ورودی، یک خط پیش‌بینی می‌سازد. برای تحلیل روندهای ساده و اولیه ایده‌آل است.

📊 رگرسیون خطی چندگانه (Multiple Linear) – از چندین متغیر پیش‌بین استفاده می‌کند و دقت بالاتری دارد. برای مدل‌سازی مسائل پیچیده‌تر دنیای واقعی بسیار مناسب است.

🧮 رگرسیون چندجمله‌ای (Polynomial) – وقتی داده‌ها یا روابط میان متغیرها خطی نیستند، به‌جای خط، از خم (منحنی) برای برازش استفاده می‌کنیم تا الگوهای غیرخطی را هم به‌خوبی کشف کنیم.

🎯 رگرسیون لجستیک (Logistic) – عه‌! صبر کنید مگر این یکی برای دسته‌بندی نبود؟ بله! نامش رگرسیون است، اما در اصل، یک طبقه‌بندی‌کننده محسوب می‌شود و برای مسائل دودویی (مثل قبول/رد، بیمار/سالم) کاربرد دارد.
...ادامه در ادامه :
#Regression
@toobabigdatascience
👏3
متخصصان علم داده ها data scientists
🔍 رمزگشایی از رازهای رگرسیون رگرسیون خطی شاید ساده به نظر برسد، اما پشت آن خطِ راست، دنیایی از مفاهیم و نکات نهفته است. 🔖در ادامه، ۷ نوع قدرتمند از رگرسیون را معرفی می‌کنیم که هر دانشمند داده‌ای باید در جعبه‌ابزار خود داشته باشد: 📈 رگرسیون خطی ساده (Simple…
🌀 رگرسیون غیرخطی (Non-linear) : همهٔ روابط، ساده و سرراست نیستند؛ این مدل برای الگوهای پیچیده‌تری که با چندجمله‌ای هم به‌خوبی برازش نمی‌شوند، طراحی شده است.

📉 رگرسیون ریج (Ridge) : با استفاده از منظم‌سازی L2 (یعنی جریمه‌کردن ضرایب بزرگ یا برخورد با دانه‌درشت ها🤓)، مشکل هم‌خطی (چندهم‌خطی) بین متغیرها را کنترل می‌کند و مانع از بیش‌برازش (Overfitting) می‌شود.

⚖️ رگرسیون لاسو (Lasso) : پادشاه انتخاب ویژگی است؛ چون با منظم‌سازی L1، ضرایب متغیرهای کم‌اهمیت را دقیقاً به صفر می‌رساند و در عمل آن‌ها را از مدل حذف می‌کند، که برای کاهش ابعاد داده عالی است.

هر یک از این مدل‌ها، مسئلهٔ خاصی از داده‌ها را حل می‌کنند پس هوشمندانه انتخاب کنید، مدام آزمایش کنید و از هر کدام در جای خودش استفاده کنید.

تذکره‌تُن : پست‌ها بعلت محدودیت کاراکتر، ادامه‌دار می‌شوند
#Overfitting
#LassoRegression
#RidgeRegression
@toobabigdatascience
👏2👌1
🏴با عرض تسلیت و تعزیت بمناسبت سالروز شهادت هشتمین ستاره‌ی آسمان امامت و ولایت، امام‌الرئوف، امام رضا ع
https://www.aparat.com/v/hztIT

#امام‌الر‌ئو‌ف
#امام‌رضا ع
@toobabigdatascience
😢2🎉2
آن شنیدم که ترامپِ بی‌حیا
گشته پنهان، از هراس ِ موشَکا
گاه زیر سینیِ چرخِ غذا
گاه هم در جعبه‌‌گیتار، بی‌نوا
گاه چون طفلی درون رُوروَک
می‌رود تا طی شود این ماجرا...

🤓این یک کارتون طنز است که قطعاً توسط بری بلیت (Barry Blitt)، کاریکاتوریست مشهور مجله نیویورکر، کشیده شده است. او به خاطر کاریکاتورهای آبرنگی‌اش شهرت دارد.

عنوان آن یعنی "WHERE'S BALDO?" (بالدو کجاست؟) یک جناس و اشاره به کتاب معروف معمای کودکان Where's Waldo? (والدو کجاست؟) دارد. با این تفاوت که به جای پنهان شدن در میان جمعیت شلوغ، سوژه‌ی کارتون (که کاریکاتوری از ترامپ است) در مکان‌های کاملاً مضحک و تحقیرآمیز پنهان شده است!
🫪طنز این تصویر از پوچ بودن مکان‌های مخفی‌شدن، وضعیت بدنی عجیب، و کلیشه‌ی رایج طنز سیاسی (که ترامپ را به عنوان یک شخصیت کودکانه، فربه و به طرز مسخره‌ای بی‌لیاقت در تلاش برای فرار از تهدید #انتقام ایرانی‌ها) ناشی می‌شود. سبک هنری آن نیز همان خط‌خطی‌های جوهر و آبرنگ غیرقابل‌انکار صفحات ادبی مجله نیویورکر است.
💨صاحب بزرگترین و مجهز‌ترین و قوی‌ترین💨
از ترس #مرگ به چه حال‌و‌روزی افتاده
#انتقام
#پاینده‌ایران
@toobabigdatascience
🥰2😴1
#حشیش و #گل به عنوان پرمصرف ترین ماده مخدر در ایران اعلام شدند!

🤯مغزهایِ کوچکِ زنگ‌زده ای که در حالیکه همچنان آکبند مانده‌اند، هرز می‌روند🥀
#رفتار‌کاوی، بالاخص در نسل Z ، اگر فقط یک‌ترم میهمانشان باشید ، از هر برهان و دلیل و آمار و ستاد مبارزه با مواد مخدری، بهتر به‌شما نشان می‌دهد که متاسفانه با چه #چیز های منگ و ملنگی روبرو هستید!
منگ‌و‌مَلَنگ ، را بیشتر وقتی در خیابان‌ها قدم بزنید و حصر و حصار و محدودیت دانشگاهی هم نباشد و کشور هم بالاخص در این زمینه بی‌سر‌و‌صاحب باشد ، می‌بینید!
معلوم است که طرف‌چی‌زده!؟ حاجت به استدلال آماری نیست وقتی جوان لخت‌و‌عور ی را می‌بینی که روی حرکات اندامش، اساسا کنترلی ندارد، کنترل ندارد روی رفتار و گفتارش! انگار #مخ ندارد...#مخ‌تعطیل است
کله را فرستاده سه‌ماه‌تعطیلی!
پدرسوخته‌ها معلوم نیست پول دلالی دلار و ارز و سکه و مسکن است یا پول رانت و اختلاس و رابطه و نفوذ! که اینجوری از خود بیخود‌شان کرده! هر چه هست، پول کار و زحمت و حق‌التدریس و عملگی و کارگری و زحمت‌کشی نیست


مصیبت اینجا نیست، همه مصیبت این که حشیشی و گل‌باز و شیشه‌خوار می‌خواهد دانشجو باشد! یا مدل باشد! یا روسپی خیابانی... نیست❗️
فاجعه آنجاست که این الدنگ بخواهد #سیاسی باشد و اکتِ سیاسی و اجتماعی هم داشته‌باشد
این مصیبت ِ عظما ست!

فاجعه آنجاست که این جانورِ اجتماعی بخواهد در مورد #دین و #مذهب ابراز فضل کند و مثلا خودش را روشنفکری بدون ِ ایدئولوژی نشان بدهد!

🤓نوشته بودند برای بنده :" بالاترین ابتذال این است که کسی بخواهد دیگران را عامدا و عالما غمگین کند! با اینهمه مشکلاتی که خودمان داریم" و منظورش سوگواری های آیینی و مذهبی بود! از اینکه 'کسی عامدا دیگران را غمگین کند...'
بوی تعفن روشنفکری (آنچنانکه در ایران دیده ایم و می‌شناسیم در صد‌سال اخیر) می‌آید و بقول کامو :" روشنفکر قطعا خیانت خواهد کرد!".
⭕️خلاصه اینکه: مواظب جوانان و نوجوانان مان باشیم اگر هنوز بعنوان پدر و مادر، زنده‌ایم و سِر و بی‌خاصیت نشده ایم! وگرنه از دست‌شان می‌دهیم بزودی...

#اعتیاد
#بازی_مرگ
#ابتذال
@toobabigdatascience



https://donya-e-eqtesad.com/fa/tiny/news-4288229
👍2
Threat_Hunting_Explained_The_Cybersecurity_Skill_That_Finds_Attackers.pdf
3.3 MB
مهارت امنیت سایبری که مهاجمان را قبل از حمله پیدا می‌کند : #شکار_تهدید

⭕️تصور کنید خانه‌ای دارید که توسط دوربین‌ها و دزدگیرها محافظت می‌شود.
اکثر سیستم‌های امنیتی صبر می‌کنند تا کسی پنجره را بشکند و سپس آژیر را به صدا درآورند.

🕸اما یک شکارچی تهدید متوجه ردپاهای گلی نزدیک پنجره، صداهای غیرمعمول در اتاق زیر شیروانی و نشانه‌هایی می‌شود که ممکن است کسی از قبل داخل خانه بوده باشد - حتی اگر هیچ زنگ خطری به صدا در نیامده باشد.

این دقیقاً نحوه‌ی عملکرد شکار تهدید در امنیت سایبری است.


⚠️امنیت سایبری دیگر فقط به ساختن دیوارهای قوی‌تر محدود نمی‌شود. مهاجمان امروزی مخفیانه، صبور و بسیار سازگار هستند. آن‌ها اغلب از سدهای دفاعی سنتی عبور می‌کنند و قبل از شروع حمله نهایی خود، برای مدت طولانی پنهان می‌مانند.
به همین دلیل است که شکار تهدید به یکی از مهمترین قابلیت‌ها در امنیت سایبری مدرن تبدیل شده است.
شکارچیان تهدید به جای انتظار برای هشدارها، به طور فعال به دنبال شواهدی از نفوذ می‌گردند، دشمنان پنهان را کشف می‌کنند و به سازمان‌ها کمک می‌کنند تا یک قدم جلوتر از مهاجمان باشند.
#ThreatHunting
@toobabigdatascience
👏1
2⃣4⃣
⭕️بیست‌وچهار تعریف ریاضی که در علوم داده،دانسته فرض می‌شوند!
#DataScience
@toobabigdatascience
👏1
https://ruc-deepanalyze.github.io/

#DeepAnalyze8B
این بزرگوار ،عامل‌محور و سرتاسری (end-to-end) است که به علم داده خودمختار (خودکار و مستقل) دست یافته است. این مدل از کل خط‌لوله (pipeline) علم داده و همچنین پژوهش‌های داده با اهداف باز (open-ended) پشتیبانی می‌کند.


⚠️توضیح و تذکره‌تُن:

موضوع، معرفی مدلی به نام DeepAnalyze-8B است. برای درک اهمیت آن، باید اصطلاحات کلیدی را بشکافیم:

۱. اولین مدل سرتاسری (End-to-End): یعنی برخلاف ابزارهای قبلی که فقط یک مرحله از علم داده (مثلاً فقط پاکسازی داده یا فقط ساخت مدل) را انجام می‌دادند، این مدل از ابتدا (دریافت داده خام) تا انتها (ارائه نتیجه نهایی و گزارش) را بدون نیاز به قطع شدن زنجیره توسط انسان، طی می‌کند.
۲. عامل‌محور (Agentic): به این معنی که این مدل صرفاً یک چت‌بات منفعل نیست که به سوالات پاسخ دهد. بلکه مانند یک عامل هوشمند عمل می‌کند؛ یعنی خودش تصمیم می‌گیرد که چه کدی بنویسد، چه ابزارهایی را فراخوانی کند، خطاها را اشکال‌زدایی (Debug) کند و حتی اگر نتیجه رضایت‌بخش نبود، استراتژی خود را تغییر دهد (مسیریابی خودکار).
۳. علم داده خودمختار (Autonomous Data Science): یعنی مدل می‌تواند به‌صورت مستقل تشخیص دهد که برای یک مجموعه داده خاص، بهترین آزمون آماری یا بهترین الگوریتم یادگیری ماشین کدام است و آن را بدون نیاز به راهنمایی قدم‌به‌قدم کاربر پیاده‌سازی کند.
۴. پشتیبانی از کل خط‌لوله (Pipeline): این خط‌لوله شامل تمام مراحل استاندارد علم داده است، از جمله:
· پاکسازی داده‌ها (رفع مقادیر گمشده و پرت)
· مهندسی ویژگی (Feature Engineering)
· انتخاب و آموزش مدل
· ارزیابی عملکرد (با معیارهایی مثل دقت، AUC و غیره)
· تفسیر نتایج
۵. پژوهش با اهداف باز (Open-ended): برخلاف سوالات بسته که جواب قطعی دارند (مثلاً «میانگین ستون X چقدر است؟»)، این مدل برای تحقیق‌های اکتشافی طراحی شده است. شما می‌توانید سوالات کلی مثل «آیا الگوی جالبی در این داده‌ها وجود دارد؟» یا «چه عواملی بیشترین تأثیر را روی فروش دارند؟» بپرسید و مدل خودش مسیر تحلیل را کشف کند.

⚠️اهمیت خبر:
تا پیش از این، مدل‌های زبانی بزرگ در علم داده بیشتر نقش «دستیار کدنویس» را داشتند (مثل GitHub Copilot) و انسان باید همه مراحل را مدیریت می‌کرد. اما DeepAnalyze-8B ادعا می‌کند که می‌تواند نقش یک دانشمند داده مجرب را به‌صورت خودکار و یکپارچه ایفا کند، که گامی بزرگ به سمت اتوماسیون کامل تحلیل داده‌ها محسوب می‌شود.

اهمیت دیگر خبر :
چون نیک نظر کرد پَرِ خویش در آن دید
گفتا ز‌که نالیم که 'از‌ماست که بر‌ماست..."🥹
شغل شریف‌تان بشدت تهدید شد؟
بله...از‌ماست که بر‌ماست
#AutonomousDataScience
@toobabigdatascience
🔥1
IMG_20260814_104943_602.jpg
207.6 KB
🪎۱۵ ریپوی گیت‌هاب برای مهندسین لرنینگ
#ML
#GithubRepositories
@toobabigdatascience
👏1
From_Prompt_Injection_to_Web_Exploitation.pdf
847.1 KB
#Research :

💉از تزریق فرمان (پرامپت) تا سوءاستفاده در وب:
بازبینی آسیب‌پذیری‌های کلاسیک در برنامه‌های یکپارچه‌شده با مدل‌های زبانی بزرگ (LLM)»، اوت ۲۰۲۶.
🤖این مقاله به معرفی حملات وب با واسطه‌گری LLM می‌پردازد؛ دسته‌ای از حملات که در آن، ورودی تحت کنترل مهاجم، توسط برنامه‌ی یکپارچه‌شده با LLM پردازش و تغییر شکل داده می‌شود و سپس به نقاط پایانی آسیب‌پذیر (sinks) برنامه‌های وب سنتی می‌رسد.
مقاله این سطح حمله را از طریق گونه‌های شاخص LLM2X نظام‌مند کرده که شامل موارد زیر می‌شود:

· #LLM2SQLi (تزریق به پایگاه داده‌ی SQL)
· #LLM2XSS (برنامه‌نویسی میان‌وب‌گاهی یا تزریق اسکریپت در وب)
· #LLM2SSTI (تزریق قالب سمت سرور)
· #LLM2CommandInjection (تزریق دستورات سیستمی)
· #LLM2IDOR (ارجاع مستقیم نامطمئن اشیا)
· LLM2CSRF (جعل درخواست )
· LLM2XXE (تزریق موجودیت خارجی در XML)
· LLM2SSRF (جعل درخواست سمت سرور)
در ادامه...
#LLMs
#Vulnerabilities
@toobabigdatascience
👏1
متخصصان علم داده ها data scientists
From_Prompt_Injection_to_Web_Exploitation.pdf
🪔تذکره‌تُن:
نکته‌ی هشداردهنده این است که توسعه‌دهندگان معمولاً فکر می‌کنند امنیت LLM فقط مربوط به «خروجی‌های نامناسب» خود مدل است، اما این مقاله نشان می‌دهد که خروجی یک LLM (که توسط مهاجم دستکاری شده) می‌تواند مستقیماً وارد بخش‌های حیاتی وب‌اپلیکیشن شود و آسیب‌پذیری‌های کلاسیک و قدیمی را با شدتی بالاتر و در قالبی جدید احیا کند. به عبارت دیگر، LLM به یک تولیدکننده‌ی خودکار پِی‌لود های مخرب تبدیل می‌شود که از فیلترهای سنتی عبور می‌کنند.

🪄کلمات و ترکیبات تازه
●Prompt Injection
تزریق فرمان (پرامپت) نوعی حمله است که در آن دستورات مخرب در ورودی مدل زبانی قاطی می‌شود تا رفتار مدل تغییر کند.

●LLM-mediated attacks
حملات با واسطه‌گری LLM حملاتی ست که مدل زبانی بزرگ نقش پل یا واسطه را بین ورودی مهاجم و خروجی مخرب ایفا می‌کند.
●Sinks
نقاط پایانی آسیب‌پذیر در امنیت نرم‌افزار، به توابع یا محل‌هایی در کد گفته می‌شود که داده‌های ورودی بدون اعتبارسنجی، در آنجا اجرا یا تفسیر می‌شوند (مثل تابع ()eval در جاوااسکریپت یا تابع ()system در سیستم عامل).
●Attack Surface
سطح حمله مجموع تمام نقاط ورودی و خروجی‌هایی که مهاجم می‌تواند از آنها برای نفوذ استفاده کند.
●Systematize
نظام‌مند کردن / دسته‌بندی ساختاریافته یعنی ارائه‌ی یک چارچوب منظم و طبقه‌بندی‌شده برای شناسایی و تحلیل این آسیب‌پذیری‌ها.

#PromptInjection
#LLMs
@toobabigdatascience
👏1
-2147483648_-214938.jpg
103.8 KB
💶 خسارت محض :خط تولیدِ زیان در سایپا؛ ضرر ۲۵ همتی در یک سال...

🚨 تذکره‌تُن :
یکنفر بیاید پاسخی عنایت بفرماید در کجای دنیا محصولی تولید می‌شود که :
هم تولید‌کننده زیان می‌دهد
هم واسطه‌ها زیان می دهند
هم مصرف‌کننده زیان می‌دهد
هم دولت ناتراز می‌شود!
هم ملت بی‌تراز می‌شوند


این چه #تولیدی ِ زیاندهِ بدبختی ست و سوال مهم‌تر اینکه با کدام توجیه اقتصادی،هنوز به تولیدِ ضرر‌و‌زیان ادامه می‌دهد؟
#اختصادی
#سايپا
#خودروساز_داخلی
#زیاندهی
@toobabigdatascience
😱1
71MdjXXXprL._AC_UF1000,1000_QL80_.jpg
138.8 KB
رسم شوم یهودیان باستان در کتاب :
📜"قربانیِ کودک، در اسرائيل باستان"

Child Sacrifice in Ancient Israel
Heath D. Dewrell
Series: Explorations in Ancient Near Eastern Civilizations
Volume: 5
Copyright Date: 2017
https://doi.org/10.5325/j.ctv2321hnd
Published by: Penn State University Press, Eisenbrauns
Pages: 236

با مطالعه این کتاب، شکی برای مخاطب باقی نمی‌ماند که جنایت در مدرسه میناب، دقیقا از سر عمد و به رسم حیوانات درنده‌ای بنام صهیونیست بوده است.
#ChildSacrifice
#DownWithIsrael
@toobabigdatascience
😱2🙏1💯1😴1
🤖یادگیری ماشینی چگونه کار‌می‌کند؟
#ML
@toobabigdatascience
👏2
🤖راه حلی برای حدس کروزیکس پس از ۲۰ سال آزگار ولی با کمک ChatGPT
https://arxiv.org/html/2608.03841v1?utm_source=chatgpt.com

🤖حل یک مسئله ریاضی ۲۰ ساله با کمک ChatGPT!

⭕️«جین شانمو»، پژوهشگر پسادکتری در کالج پزشکی اتحادیه پکن، موفق شده است حدس کرویزیکس را حل کند؛ مسئله‌ای ریاضی که بیش از دو دهه ذهن ریاضی‌دانان را به خود مشغول کرده بود.

⛔️جین در جریان پژوهش خود از ChatGPT، کمک گرفت؛ اتفاقی که نمونه‌ای تازه از ظرفیت هوش مصنوعی در یادگیری، پژوهش و کشف علمی به شمار می‌رود.

🪄حدس کرویزیکس که حدود ۲۰ سال پیش توسط ریاضی‌دان فرانسوی میشل کرویزیکس مطرح شد، به رفتار توابعی می‌پردازد که روی ماتریس‌ها اعمال می‌شوند.

🔥تذکره‌تُن مهم‌تر از خودِ مطلب و خودِ جین:
الان این افتخار باید بنام این محقق عزیزِ پَسا‌دکتری ثبت شود یا برادر جناب آقای ChatGPT 5.6 ؟
🫪در حالِ حاضر و از منظر ریاضی، اثبات به نام خود جین ثبت شده است؛ یعنی این‌طور نیست که "هوش مصنوعی به تنهایی حدس را اثبات کرده باشد". ولی آیا اینطور است که " جین به تنهایی این حدس را اثبات کرده است؟"❗️
وقتی پیچیده‌ترین محاسبات در اثبات یک مساله سخت یا یک حدس (مثلا حدس پوانکاره!) را که گاها سالهای سال طول می‌کشید را جناب هوش مصنوعی انجام می‌دهد، حق و حقوقش از نظر قانونی و هم از نظر اخلاقی! چه می‌شود؟
او اخلاق نمی‌داند...بله درست است
ولی ما که می‌دانیم! طراحان و توسعه دهندگانش که می‌دانند! سالها تلاش پیوسته و علمی به این تحول گرانقیمت انجامیده،گِل لقد نمی‌کرده اند که!
حق آنها چه می‌شود؟
آنچه فعلاً گزارش شده این است که هوش مصنوعی در فرایند کشف و توسعهٔ ایده‌ها نقش مهمی داشته است.
#حقوقی_اخلاقی
#حدس_پوانکاره
#Mathematics
#AI
#ChatGPT5.6
@toobabigdatascience
👏2🎉1
🤖 LLM Performance Evaluation

⚠️آماده برای دفاع سایبری.
🔑قابلیتهای کدنویسی و عامل‌محور در سطح بالا، که از طریق پس‌آموزش روی مدل پایه ۷۴۳ میلیاردی به دست آمده است
🏆جهشی بزرگ در امنیت سایبری، که استانداردی تازه در میان مدل‌های باز تعیین می‌کند!
#LLMs
#CyberDefence
#GLMs
@toobabigdatascience
🔥1👏1
https://www.math.uci.edu/~rvershyn/teaching/hdp/hdp.html

🆓 احتمال ابعاد بالا
و کاربردها در علوم داده

🆓 دوره شامل ۴۱ جلسه ویدیویی و ۱۳ مجموعه تمرین است.
دوره کاملا رایگان است.
#Mathematics
#DataScience
@toobabigdatascience
👏2