📚 6 کتابخانه برتر AutoML برای پروژهها
1️⃣ کتابخونه FLAML
💬 ساخت مایکروسافته و کلی وظیفه مثل دستهبندی و رگرسیون رو خودش سریع انجام میده. فقط با چند خط کد!
2️⃣ کتابخونه PyCaret
💬 از صفر تا صد مدلسازی رو برات آسون میکنه. با این کتابخونه، راحت مدل آموزش میدی و خروجی میگیری.
3️⃣ کتابخونه MLJAR-Supervised
💬 کافی یه دیتا بهش بدی، خودش بهترین مدل رو با هوشمندی انتخاب و آموزش میده؛ مهندسی ویژگی هم داره.
4️⃣ کتابخونه AutoGluon
💬 ساخت AWS و میتونی باهاش دیتای جدولی و سری زمانی رو هندل کنی و مدلهای پایه رو هم فاینتون کنی.
5️⃣ کتابخونه AutoViML
💬 با حداقل ویژگیها بهترین مدل رو پیدا میکنه و دیتا رو هم تمیز و آماده میکنه.
6️⃣ کتابخونه AutoKeras
💬 بر پایه Keras و برای کار با تصویر و متن خیلی کاربردیه.
@BIMining
1️⃣ کتابخونه FLAML
💬 ساخت مایکروسافته و کلی وظیفه مثل دستهبندی و رگرسیون رو خودش سریع انجام میده. فقط با چند خط کد!
2️⃣ کتابخونه PyCaret
💬 از صفر تا صد مدلسازی رو برات آسون میکنه. با این کتابخونه، راحت مدل آموزش میدی و خروجی میگیری.
3️⃣ کتابخونه MLJAR-Supervised
💬 کافی یه دیتا بهش بدی، خودش بهترین مدل رو با هوشمندی انتخاب و آموزش میده؛ مهندسی ویژگی هم داره.
4️⃣ کتابخونه AutoGluon
💬 ساخت AWS و میتونی باهاش دیتای جدولی و سری زمانی رو هندل کنی و مدلهای پایه رو هم فاینتون کنی.
5️⃣ کتابخونه AutoViML
💬 با حداقل ویژگیها بهترین مدل رو پیدا میکنه و دیتا رو هم تمیز و آماده میکنه.
6️⃣ کتابخونه AutoKeras
💬 بر پایه Keras و برای کار با تصویر و متن خیلی کاربردیه.
@BIMining
👍6❤1
ابزار ClickGraph v0.5.2 ؛ وقتی ClickHouse به یک موتور گراف تحلیلی تبدیل میشود:
تحلیل گرافی سالها در قلمرو دیتابیسهایی مثل Neo4j بود؛ اما در سازمانهایی که همهچیز روی ClickHouse متمرکز است، انتقال داده به یک موتور جداگانه هزینه و ریسک بالایی دارد. ClickGraph برای همین متولد شده است: یک لایه تحلیلی گراف، سبک و stateless که روی ClickHouse سوار میشود، کوئریهای Cypher را به SQL بهینه ترجمه میکند و آنها را مستقیماً روی همان دادههای موجود اجرا میکند؛ یعنی بدون مهاجرت داده، میتوان یک دید گرافی قدرتمند از دادههای ستونی ساخت و از اکوسیستم Neo4j مثل درایورها، cypher-shell، Browser و Bolt 5.8 استفاده کرد، در حالی که اجرا روی ClickHouse میماند.
نسخه 0.5.2 روی همین ایده سوار است و آن را به بلوغ اینترپرایزی نزدیک کرده: پشتیبانی از الگوهای پیچیدهٔ اسکیمای گراف از پلیمورفیک تا denormalized و coupled edges، بهینهسازی مسیرهای چندمرحلهای و حفظ همخوانی با ابزارهای Neo4j در کنار معماری سبک و تستشده، با تمرکز بر انعطاف در مدلسازی گراف و پرفورمنس قابلاتکا روی دیتاستهای بزرگ.
@BIMining
تحلیل گرافی سالها در قلمرو دیتابیسهایی مثل Neo4j بود؛ اما در سازمانهایی که همهچیز روی ClickHouse متمرکز است، انتقال داده به یک موتور جداگانه هزینه و ریسک بالایی دارد. ClickGraph برای همین متولد شده است: یک لایه تحلیلی گراف، سبک و stateless که روی ClickHouse سوار میشود، کوئریهای Cypher را به SQL بهینه ترجمه میکند و آنها را مستقیماً روی همان دادههای موجود اجرا میکند؛ یعنی بدون مهاجرت داده، میتوان یک دید گرافی قدرتمند از دادههای ستونی ساخت و از اکوسیستم Neo4j مثل درایورها، cypher-shell، Browser و Bolt 5.8 استفاده کرد، در حالی که اجرا روی ClickHouse میماند.
نسخه 0.5.2 روی همین ایده سوار است و آن را به بلوغ اینترپرایزی نزدیک کرده: پشتیبانی از الگوهای پیچیدهٔ اسکیمای گراف از پلیمورفیک تا denormalized و coupled edges، بهینهسازی مسیرهای چندمرحلهای و حفظ همخوانی با ابزارهای Neo4j در کنار معماری سبک و تستشده، با تمرکز بر انعطاف در مدلسازی گراف و پرفورمنس قابلاتکا روی دیتاستهای بزرگ.
@BIMining
👍4
✅نتفلیکس هر روز ۵ پتابایت لاگ (۱۰.۶ میلیون رویداد در ثانیه) را با ClickHouse پردازش میکند و نتایج را در کمتر از ۱ ثانیه برمیگرداند – مناسب برای ۴۰ هزار سرویس کوچک و ۳۰۰ میلیون کاربر.
📕سه ترفند کلیدی نتفلیکس
۱. ارسال سریع دادهها: به جای روش معمولی JDBC، کد مخصوص ساختند که دادهها را فشرده (LZ4) و با پروتکل native میفرستد. نتیجه: CPU و RAM کمتر، سرعت بیشتر از روشهای آماده.
۲. گروهبندی لاگها بدون تأخیر: regex جستجوی متنی پیچیده را با lexer کامپایلشده (JFlex) جایگزین کردند – ۸–۱۰ برابر سریعتر، چون regex در ۱۰ میلیون رویداد در ثانیه قفل میکند.
۳. جستجوی سریع در برچسبها: برچسبها مثل ID سرویس را در ۳۱ جدول کوچک با LowCardinality تقسیم کردند به جای یک map بزرگ . زمان جستجو از ۳ ثانیه به ۰.۷ ثانیه رسید.
✅ کاربرد برای بانکها
دادههای تازه (hot tier) در ClickHouse، دادههای قدیمی در Iceberg، و API هوشمند. برای ۴۰ میلیون تراکنش روزانه بانکی، همین ترفندها (ارسال سریع + schema بهینه + تقسیم داده) کلید fraud detection و تحلیل realtime است.
@BIMining
📕سه ترفند کلیدی نتفلیکس
۱. ارسال سریع دادهها: به جای روش معمولی JDBC، کد مخصوص ساختند که دادهها را فشرده (LZ4) و با پروتکل native میفرستد. نتیجه: CPU و RAM کمتر، سرعت بیشتر از روشهای آماده.
۲. گروهبندی لاگها بدون تأخیر: regex جستجوی متنی پیچیده را با lexer کامپایلشده (JFlex) جایگزین کردند – ۸–۱۰ برابر سریعتر، چون regex در ۱۰ میلیون رویداد در ثانیه قفل میکند.
۳. جستجوی سریع در برچسبها: برچسبها مثل ID سرویس را در ۳۱ جدول کوچک با LowCardinality تقسیم کردند به جای یک map بزرگ . زمان جستجو از ۳ ثانیه به ۰.۷ ثانیه رسید.
✅ کاربرد برای بانکها
دادههای تازه (hot tier) در ClickHouse، دادههای قدیمی در Iceberg، و API هوشمند. برای ۴۰ میلیون تراکنش روزانه بانکی، همین ترفندها (ارسال سریع + schema بهینه + تقسیم داده) کلید fraud detection و تحلیل realtime است.
@BIMining
👍11❤2
برگزاری پنل هوش مصنوعی با عنوان
سنجش داده تا سناریوسازی ،زیرساخت های فناورانه،داده کاوی و طراحی مدل های پیش بینی با هوش مصنوعی
دوشنبه 24 آذرماه 1404 پاویون هوش مصنوعی مصلی امام خمینی
ساعت 11-12:15
@BIMining
سنجش داده تا سناریوسازی ،زیرساخت های فناورانه،داده کاوی و طراحی مدل های پیش بینی با هوش مصنوعی
دوشنبه 24 آذرماه 1404 پاویون هوش مصنوعی مصلی امام خمینی
ساعت 11-12:15
@BIMining
👏2👍1
تحلیل داده ترکیبی متعادل از مبانی اصلی و مهارتهای پشتیبان است.
🔹اسکریپت SQL ستون فقرات تحلیل (31%)
دادههای کسبوکار عمدتاً در پایگاهدادهها ذخیره میشوند. تسلط بر SQL برای استخراج، پاکسازی و تبدیل داده ضروری است.
🔹 ابزارهای BI (15%)
ابزارهایی مثل Power BI یا Tableau دادههای خام را به داستانهای قابلفهم برای ذینفعان تبدیل میکنند.
🔹ابزار Excel (14%)
از تحلیل سریع تا گزارشگیری، Excel هنوز یک ابزار روزمره در سازمانهاست. یادگیری فرمولها، پیوتها و پاکسازی داده بسیار مفید است.
🔹زبان برنامه نویسی پایتون (14%)
پایتون از تحلیلهای پیچیده، خودکارسازی و کار با حجم بزرگ داده پشتیبانی میکند.
🔹زبان R (10%)
اغلب در نقشهای پژوهشی یا آماری استفاده میشود و برای مدلسازی عمیق مناسب است.
🔹ابزار و فرایند ETL (11% در مجموع)
درک جریان داده ETL و مبانی آماری، صحت و قابلیت اطمینان بینشها را تضمین میکند.
🔹 کنترل نسخه، NoSQL، SAS مهارتهای تکمیلی (%5 در مجموع)
این ابزارها در محیطها و پروژههای خاص، بهویژه در مقیاس بزرگ، ارزش افزوده دارند.
@BIMining
🔹اسکریپت SQL ستون فقرات تحلیل (31%)
دادههای کسبوکار عمدتاً در پایگاهدادهها ذخیره میشوند. تسلط بر SQL برای استخراج، پاکسازی و تبدیل داده ضروری است.
🔹 ابزارهای BI (15%)
ابزارهایی مثل Power BI یا Tableau دادههای خام را به داستانهای قابلفهم برای ذینفعان تبدیل میکنند.
🔹ابزار Excel (14%)
از تحلیل سریع تا گزارشگیری، Excel هنوز یک ابزار روزمره در سازمانهاست. یادگیری فرمولها، پیوتها و پاکسازی داده بسیار مفید است.
🔹زبان برنامه نویسی پایتون (14%)
پایتون از تحلیلهای پیچیده، خودکارسازی و کار با حجم بزرگ داده پشتیبانی میکند.
🔹زبان R (10%)
اغلب در نقشهای پژوهشی یا آماری استفاده میشود و برای مدلسازی عمیق مناسب است.
🔹ابزار و فرایند ETL (11% در مجموع)
درک جریان داده ETL و مبانی آماری، صحت و قابلیت اطمینان بینشها را تضمین میکند.
🔹 کنترل نسخه، NoSQL، SAS مهارتهای تکمیلی (%5 در مجموع)
این ابزارها در محیطها و پروژههای خاص، بهویژه در مقیاس بزرگ، ارزش افزوده دارند.
@BIMining
👍9👏3❤1
در پشت صحنۀ پلتفرمهایی که هر روز مورد استفاده قرار میگیرند، همواره این پرسش مطرح بوده است که چه رویدادهایی رخ میدهد. همچنین، این سؤال مطرح میشود که پلتفرمهای مشهور جهان با چه زبانهایی ساخته شدهاند.
@BIMining
@BIMining
👍8
🔺ورود چین به عصر ایجنتهای هوش مصنوعی
🔹شرکت چینی بایت دنس با معرفی مدل Doubao 2.0 رسماً به عصر ایجنتها وارد شده و تلاش دارد جایگاه خود را در بازار رقابتی هوش مصنوعی حفظ کند. این مدل فراتر از یک چتبات است و برای انجام وظایف پیچیده دنیای واقعی طراحی شده است. نسخه Pro آن با مدلهایی مانند OpenAI و گوگل رقابت میکند.
🔹بایتدنس میگوید هزینه استفاده از Doubao 2.0 حدود ۱۰ برابر کمتر از رقبا است و این موضوع برای پردازشهای پرمصرف مزیت مهمی به شمار میرود. این شرکت پس از غافلگیری از ظهور DeepSeek حالا میخواهد از تکرار آن تجربه جلوگیری کند. در بازار چین، Doubao با ۱۵۵ میلیون کاربر هفتگی در صدر قرار دارد و سایر رقبا نیز با سرعت در حال رشد هستند.
@BIMining
🔹شرکت چینی بایت دنس با معرفی مدل Doubao 2.0 رسماً به عصر ایجنتها وارد شده و تلاش دارد جایگاه خود را در بازار رقابتی هوش مصنوعی حفظ کند. این مدل فراتر از یک چتبات است و برای انجام وظایف پیچیده دنیای واقعی طراحی شده است. نسخه Pro آن با مدلهایی مانند OpenAI و گوگل رقابت میکند.
🔹بایتدنس میگوید هزینه استفاده از Doubao 2.0 حدود ۱۰ برابر کمتر از رقبا است و این موضوع برای پردازشهای پرمصرف مزیت مهمی به شمار میرود. این شرکت پس از غافلگیری از ظهور DeepSeek حالا میخواهد از تکرار آن تجربه جلوگیری کند. در بازار چین، Doubao با ۱۵۵ میلیون کاربر هفتگی در صدر قرار دارد و سایر رقبا نیز با سرعت در حال رشد هستند.
@BIMining
❤4👍1
در سال ۲۰۲۶، رویکرد اصلی در دیتا انجینیرینگ ELT است، نه ETL قدیمی.
- روش قدیمی (ETL): اول دیتا رو تبدیل (Transform) میکردی بعد بارگذاری (Load) میکردی، چون انبارهای داده قدیمی فقط دیتای ساختاریافته قبول میکردند.
- تغییر بزرگ: انبارهای مدرن مثل Snowflake و BigQuery الان دیتای نیمهساختاریافته (مثل JSON) و بدون ساختار (مثل لاگ) رو هم قبول میکنند. نیازی به تبدیل قبلی نیست.
- روش جدید (ELT): اول دیتا رو بارگذاری خام (Load) میکنی، بعد با DBT تبدیل (Transform) انجام میدی. سریعتر، سادهتر و ارزانتر.
- چرا DBT مهم شده؟ تو اکثر آگهیهای شغلی دیتا انجینیرینگ هست، SQL رو به یک فرآیند مهندسی نرمافزار تبدیل کرده (کنترل نسخه، تست، مستندات).
- کی هنوز ETL بهتره؟ توی خطوط بلادرنگ (مثل Kafka → Flink)، تبدیلهای سنگین غیر SQL، یا سیستمهای قدیمی که عوض کردنشان هزینهبالایی دارد.
نتیجه نهایی: پیشفرض ۲۰۲۶ برای اکثر پروژهها، ELT با DBT است، اما بسته به نیاز خاص خودت انتخاب کن.
@BIMining
- روش قدیمی (ETL): اول دیتا رو تبدیل (Transform) میکردی بعد بارگذاری (Load) میکردی، چون انبارهای داده قدیمی فقط دیتای ساختاریافته قبول میکردند.
- تغییر بزرگ: انبارهای مدرن مثل Snowflake و BigQuery الان دیتای نیمهساختاریافته (مثل JSON) و بدون ساختار (مثل لاگ) رو هم قبول میکنند. نیازی به تبدیل قبلی نیست.
- روش جدید (ELT): اول دیتا رو بارگذاری خام (Load) میکنی، بعد با DBT تبدیل (Transform) انجام میدی. سریعتر، سادهتر و ارزانتر.
- چرا DBT مهم شده؟ تو اکثر آگهیهای شغلی دیتا انجینیرینگ هست، SQL رو به یک فرآیند مهندسی نرمافزار تبدیل کرده (کنترل نسخه، تست، مستندات).
- کی هنوز ETL بهتره؟ توی خطوط بلادرنگ (مثل Kafka → Flink)، تبدیلهای سنگین غیر SQL، یا سیستمهای قدیمی که عوض کردنشان هزینهبالایی دارد.
نتیجه نهایی: پیشفرض ۲۰۲۶ برای اکثر پروژهها، ELT با DBT است، اما بسته به نیاز خاص خودت انتخاب کن.
@BIMining
🙏4❤2
معماری مدالیون(Medallion Architecture)، سیر تحول دادهها را از حالت خام اولیه تا نسخهای که آمادهٔ پشتیبانی از تصمیمگیری است، سازماندهی میکند.
لایهٔ برنز (Bronze)، فایلها، رویدادها و رکوردها را دقیقاً به همان صورتی که از سیستمهای مبدأ دریافت میشوند، حفظ میکند. این لایه، سطحی از جزئیات را نگهداری میکند که برای ردیابی خطاها و بازسازی فرایندها ضروری است.
لایهٔ نقره (Silver)، دادهها را پالایش، استانداردسازی، پاکسازی (deduplicate) و اعتبارسنجی میکند. در این مرحله، فرمتها اصلاح، کدها یکسانسازی و بررسیهای کیفی روی دادهها اعمال میشوند.
لایهٔ طلا (Gold)، قوانین کسبوکار را به دادهها اضافه کرده و جداول، معیارها و محصولات دادهای را برای داشبوردها، تحلیلها و مدلهای پیشبینی آماده میسازد.
@BIMining
لایهٔ برنز (Bronze)، فایلها، رویدادها و رکوردها را دقیقاً به همان صورتی که از سیستمهای مبدأ دریافت میشوند، حفظ میکند. این لایه، سطحی از جزئیات را نگهداری میکند که برای ردیابی خطاها و بازسازی فرایندها ضروری است.
لایهٔ نقره (Silver)، دادهها را پالایش، استانداردسازی، پاکسازی (deduplicate) و اعتبارسنجی میکند. در این مرحله، فرمتها اصلاح، کدها یکسانسازی و بررسیهای کیفی روی دادهها اعمال میشوند.
لایهٔ طلا (Gold)، قوانین کسبوکار را به دادهها اضافه کرده و جداول، معیارها و محصولات دادهای را برای داشبوردها، تحلیلها و مدلهای پیشبینی آماده میسازد.
@BIMining
👍4
ابزار dbt (Data Build Tool) در حال تسخیر دنیای مهندسی داده است. در ادامه لینک قیلمهای آموزشی در سال ۲۰۲۶ به شرح ذیل اعلام میگردد:
1. دوره جامع dbt (Data Build Tool) | از مبتدی تا پیشرفته | گام به گام
🔗 https://lnkd.in/gHVpEXZf
۲. دوره فشرده dbt برای مبتدیان | از صفر تا قهرمان در dbt Core
🔗 https://lnkd.in/g5e_R9DB
۳. راهنمای جامع dbt به همراه CI/CD | آموزش کامل ۵ ساعته
🔗 https://lnkd.in/gGNsGF_n
۴. تحلیل دادههای نتفلیکس | آموزش پروژه محور و سرتاسری (End-to-End) با dbt
🔗 https://lnkd.in/gZwqh_-y
۵. از مبتدی تا حرفهای در dbt | خط لوله (Pipeline) سرتاسری با Airflow + Snowflake
🔗 https://lnkd.in/gf7npsyp
۶. پروژه سرتاسری بازار بورس | Snowflake + dbt + Airflow
🔗 https://lnkd.in/gcDeGrbp
۷. پروژه مهندسی داده Airbnb | دیتابیس dbt + Snowflake + AWS (شش ساعت)
🔗 https://lnkd.in/g-yivU55
۸. سوالات و جوابهای مصاحبه dbt | آمادگی برای مصاحبه dbt + Snowflake
🔗 https://lnkd.in/gxthsqPv
1. دوره جامع dbt (Data Build Tool) | از مبتدی تا پیشرفته | گام به گام
🔗 https://lnkd.in/gHVpEXZf
۲. دوره فشرده dbt برای مبتدیان | از صفر تا قهرمان در dbt Core
🔗 https://lnkd.in/g5e_R9DB
۳. راهنمای جامع dbt به همراه CI/CD | آموزش کامل ۵ ساعته
🔗 https://lnkd.in/gGNsGF_n
۴. تحلیل دادههای نتفلیکس | آموزش پروژه محور و سرتاسری (End-to-End) با dbt
🔗 https://lnkd.in/gZwqh_-y
۵. از مبتدی تا حرفهای در dbt | خط لوله (Pipeline) سرتاسری با Airflow + Snowflake
🔗 https://lnkd.in/gf7npsyp
۶. پروژه سرتاسری بازار بورس | Snowflake + dbt + Airflow
🔗 https://lnkd.in/gcDeGrbp
۷. پروژه مهندسی داده Airbnb | دیتابیس dbt + Snowflake + AWS (شش ساعت)
🔗 https://lnkd.in/g-yivU55
۸. سوالات و جوابهای مصاحبه dbt | آمادگی برای مصاحبه dbt + Snowflake
🔗 https://lnkd.in/gxthsqPv
❤6👍1🙏1
۵ الگوی معماری داده برای ۲۰۲۶
بحث ابزار نیست، بحث الگوست. الگوی غلط = خط لولهٔ مرده.
۱. لامبدا — دستهای + جریانی
↳ کاربرد: دقت تاریخی + تازگی بیدرنگ
↳ هزینه: ۲ خط لوله = پیچیدگی دوبرابر
↳ مثال: تبلیغات دیجیتال
۲. کاپا — فقط جریانی
↳ کاربرد: وقتی جریانی به بلوغ کافی رسیده
↳ هزینه: بازپردازش سختتر، عملیات سادهتر
↳ مثال: تشخیص تقلب، IoT
۳. مدالیون — برنز→نقره→طلا
↳ کاربرد: دریاچهخانه (Databricks, Snowflake, BigQuery)
↳ هزینه: ۳× هزینه، اما کیفیت عالی
↳ مثال: Databricks مدرن
۴. مش داده — غیرمتمرکز، هر حوزه مالک داده
↳ کاربرد: تیمهای متعدد، پلتفرم مرکزی گلوگاه
↳ هزینه: تغییر سازمانی سنگین
↳ مثال: Netflix, Zalando
۵. معماری Lakehouse دریاچه + انبار
↳ کاربرد: SQL انبار با هزینهٔ دریاچه
↳ هزینه: اکوسیستم در حال بلوغ
↳ مثال: Databricks, Snowflake, BigLake
@BIMining
بحث ابزار نیست، بحث الگوست. الگوی غلط = خط لولهٔ مرده.
۱. لامبدا — دستهای + جریانی
↳ کاربرد: دقت تاریخی + تازگی بیدرنگ
↳ هزینه: ۲ خط لوله = پیچیدگی دوبرابر
↳ مثال: تبلیغات دیجیتال
۲. کاپا — فقط جریانی
↳ کاربرد: وقتی جریانی به بلوغ کافی رسیده
↳ هزینه: بازپردازش سختتر، عملیات سادهتر
↳ مثال: تشخیص تقلب، IoT
۳. مدالیون — برنز→نقره→طلا
↳ کاربرد: دریاچهخانه (Databricks, Snowflake, BigQuery)
↳ هزینه: ۳× هزینه، اما کیفیت عالی
↳ مثال: Databricks مدرن
۴. مش داده — غیرمتمرکز، هر حوزه مالک داده
↳ کاربرد: تیمهای متعدد، پلتفرم مرکزی گلوگاه
↳ هزینه: تغییر سازمانی سنگین
↳ مثال: Netflix, Zalando
۵. معماری Lakehouse دریاچه + انبار
↳ کاربرد: SQL انبار با هزینهٔ دریاچه
↳ هزینه: اکوسیستم در حال بلوغ
↳ مثال: Databricks, Snowflake, BigLake
@BIMining
❤3👍3