مرجع دیتاست فارسی
3.26K subscribers
27 photos
2 videos
22 files
359 links
لطفا برای معرفی و درج دیتاست خود داخل کانال به @data_hub پیام دهید.
Download Telegram
🗣 هوش مصنوعی پرسش و پاسخ صوتی فارسی!

پروژه Persian Question Answering Voice2Voice AI یه سیستم هوشمند حرفه‌ایه که به صورت صوتی با کاربر تعامل داره! یعنی شما سوالتون رو میپرسید و هوش مصنوعی به زبان فارسی جواب میده - هم به صورت صوتی و هم متنی.

✨ قابلیت‌های کلیدی:


مکالمه صوتی دوطرفه کاملاً به زبان فارسی

نسخه بومی شده و قابل اجرا بدون اینترنت

مدل آموزشی اختصاصی برای پردازش زبان طبیعی

جمع‌آوری داده‌ها با خزنده‌های اختصاصی


🔗 لینک پروژه:

https://github.com/M-Taghizadeh/Persian_Question_Answering_Voice2Voice_AI

امتحانش کن و نظراتت رو با ما به اشتراک بذار 👇

#هوش_مصنوعی_فارسی #پردازش_صوت #NLP #پرسش_و_پاسخ #پروژه_پایتون
❤6👍3
🎙 دیتاست گفتار غیررسمی فارسی برای ASR و TTS

اگه دنبال یه دیتاست کاربردی برای پروژه‌های تشخیص گفتار خودکار (ASR) یا تبدیل متن به گفتار (TTS) هستی، VirgoolInformal-Speech-Dataset دقیقاً همون چیزیه که لازم داری! این دیتاست شامل فایل‌های صوتی و متنی غیررسمی فارسیه که به‌طور کامل پردازش شده و آماده استفاده است.

✨ چی داره؟

🎧 فایل‌های صوتی و متنی خام جمع‌آوری‌شده از وبلاگ‌های فارسی

🛠 داده‌های پردازش‌شده برای هم‌ترازی صوت و متن

📒 دفترچه Jupyter برای پردازش خودکار داده‌ها

💡 به چه دردی می‌خوره؟

🚀 آموزش مدل‌های هوش مصنوعی فارسی

📊 تحلیل گفتار غیررسمی فارسی

✅ ارزیابی مدل‌های ASR با معیار CER

🔗 لینک پروژه:

https://github.com/MahtaFetrat/VirgoolInformal-Speech-Dataset

📥 امتحانش کن و اگه دیتاست جالبی پیدا کردی، برای ما هم بفرست! 😊

🎓 انجام پروژه | منتورشیپ | تدریس خصوصی

@Data_hub

📊 پرشین دیتا، مرجع دیتاست‌های فارسی!

@persian_data

#تشخیص_گفتار #TTS_فارسی #ASR_فارسی #پردازش_زبان #دیتاست #هوش_مصنوعی
👍6❤1
Media is too big
VIEW IN TELEGRAM
🎥 معرفی وبینار مسیر شغلی تحلیلگر داده - از زبان مدرس!

🌟 می‌خوای مسیر شغلی تحلیلگر داده رو شروع کنی ولی نمی‌دونی از کجا باید شروع کنی؟ یا شاید کلی ابزار و دوره دیدی ولی همچنان سردرگمی؟ این وبینار طراحی شده تا تمام سوالاتت رو جواب بده و نقشه راه شفاف و عملی رو جلوی پات بذاره!

✨ چی قراره یاد بگیری؟
– شناخت نیاز واقعی شرکت‌ها از طریق رمزگشایی آگهی‌های شغلی
– معرفی ابزارهای پولساز و نقشه راه یادگیری‌شون
– تشخیص منابع آموزشی خوب از محتوای زرد
– تکنیک‌های یادگیری سریع برای تبدیل شدن به Fast Learner

🎓 شرایط بورسیه ۱۰۰٪ دیتاهاب:
ما برای آدم‌های عملگرا و اهل یادگیری، این وبینار رو کاملاً رایگان کردیم! شرایط ساده و بدون قرعه‌کشیه، جزئیات کامل بورسیه رو تو لینک زیر ببین:
🔗 لینک ثبت‌نام و اطلاعات بیشتر:
https://zaya.io/gxxr0
📊 پرشین دیتا، مرجع دیتاست‌های فارسی!
@persian_data

#تحلیل_داده #بورسیه_رایگان #یادگیری_ماشین #مسیر_شغلی
❤1
🎙 دیتاست متن تولیدشده توسط هوش مصنوعی فارسی

اگه دنبال دیتاستی برای شناسایی متن‌های تولیدشده توسط هوش مصنوعی به زبان فارسی هستی، پروژه Persian AI-Generated Text Detection به کارت میاد! این پروژه هدفش استخراج متن‌های فارسی تولیدشده توسط کتابخانه OpenAI GPT و ساخت دیتاستی ارزشمند برای آموزش مدل‌های شناساییه.

✨ چی داره؟
🗂 ایجاد یک دیتاست بزرگ از متن‌های فارسی تولیدشده توسط هوش مصنوعی
🛠 فراهم کردن داده‌های آموزشی برای مدل‌های شناسایی متن‌های AI

🔗 لینک پروژه:
https://github.com/E-Ghafour/Persian_AI_generated_text_detection

📥 امتحانش کن و اگر دیتاست جالبی پیدا کردی، برای ما هم بفرست! 😊

🎓 انجام پروژه | منتورشیپ | تدریس خصوصی
@Data_hub
📊 پرشین دیتا، مرجع دیتاست‌های فارسی!
@persian_data

#تشخیص_متن_AI #هوش_مصنوعی_فارسی #دیتاست #پردازش_زبان #تولید_متن
❤3👍2
🤖 هوش مصنوعی داره شغل‌ها رو یکی یکی فتح می‌کنه - میدونی کی نوبت شغل تو میرسه؟

رفقا سلام!

یه الگوی جالب توی تاریخ فناوری وجود داره که نشون می‌ده هوش مصنوعی چطور یه حوزه رو کامل تسخیر می‌کنه. شطرنج بهترین مثالشه:

🏁 مرحله اول: کنترل کامل انسانی (قرن‌ها فقط انسان‌ها بازی می‌کردن)
⚙️ مرحله دوم: موتورهای ساده (Deep Blue و امثالهم با brute force)
🤝 مرحله سوم: فاز سانتور (انسان + ماشین = بهترین ترکیب)
🚀 مرحله چهارم: استقلال کامل AI (AlphaZero که حتی به انسان یاد می‌ده!)

حالا سوال مهم: مهندسی نرم‌افزار کجاست؟
الان دقیقاً توی فاز سانتوریم! GitHub Copilot، ChatGPT و ابزارهای مشابه ما رو به برنامه‌نویس‌هایی تبدیل کردن که بدون اینا نمی‌تونیم با همون کیفیت و سرعت کار کنیم.

⚠️ اما مرحله بعد چی؟
آیا هوش مصنوعی روزی می‌تونه کامل مستقل کد بنویسه، باگ رفع کنه، و حتی خودش رو بهبود بده؟

💡 راه حل؟ تحلیل داده!
توی این دنیای در حال تغییر، یکی از امن‌ترین و پولسازترین مسیرها، تبدیل شدن به تحلیلگر داده حرفه‌ایه. چون هوش مصنوعی بدون داده هیچیه!

🎯 وبینار "مسیر شغلی تحلیلگر داده"
اگه نمی‌دونی از کجا شروع کنی یا وسط این همه ابزار و دوره گم شدی، این وبینار نقشه راه شفاف و واقعی تو می‌شه.

✨ چی یاد می‌گیری؟
– رمزگشایی آگهی‌های شغلی و شناخت نیاز واقعی شرکت‌ها
– معرفی ابزارهای پولساز و مسیر یادگیری‌شون
– تشخیص منابع خوب از محتوای زرد
– تکنیک‌های یادگیری سریع برای Fast Learner شدن

🎓 بورسیه ۱۰۰٪ دیتاهاب:
فقط کافیه پوستر وبینار رو توی شبکه‌های اجتماعی حرفه‌ای خودت منتشر کنی و @DataHub_ir رو تگ کنی. کد تخفیف ۱۰۰٪ رو دریافت می‌کنی!

⏰ زمان: سه‌شنبه ۳۱ تیر، ساعت ۲۰:۰۰
🔗 ثبت‌نام: https://zaya.io/gxxr0

🤔 سوال برای شما: به نظرتون کدوم حوزه بعد از شطرنج، کاملاً به هوش مصنوعی واگذار می‌شه؟ پزشکی؟ حقوق؟ یا خود مهندسی نرم‌افزار؟

🎓 انجام پروژه | منتورشیپ | تدریس خصوصی @Data_hub
📊 پرشین دیتا، مرجع دیتاست‌های فارسی! @persian_data

#تحلیل_داده #هوش_مصنوعی #مسیر_شغلی #بورسیه
❤5👍4
🎯 Daanish Solution - راهکاری جامع برای داده‌کاوی و یادگیری ماشین

اگه دنبال یه فریم‌ورک قدرتمند و انعطاف‌پذیر برای ساده‌سازی پروژه‌های داده‌کاوی هستی، Daanish Solution بهترین گزینه است! این پروژه ابزارهایی برای تحلیل آماری، طبقه‌بندی، پیش‌بینی سری‌های زمانی و خوشه‌بندی ارائه می‌ده.

✨ ویژگی‌ها:

📊 تحلیل اکتشافی داده (EDA) با Sweetviz برای تولید گزارش‌های خودکار.

🤖 طبقه‌بندی با مدل‌هایی مثل Logistic Regression، XGBoost و LightGBM.

📈 پیش‌بینی سری‌های زمانی با ARIMA و LSTM.

⚙️ خوشه‌بندی داده‌ها با روش‌های K-Means و DBSCAN.

🛠 پیش‌پردازش داده‌ها شامل حذف پرت، مدیریت داده‌های گمشده و مهندسی ویژگی.

🔗 لینک پروژه:

https://github.com/soleimanihamed/Daanish

🎓 انجام پروژه | منتورشیپ | تدریس خصوصی

@Data_hub

📊 پرشین دیتا، مرجع دیتاست‌های فارسی!

@persian_data

#تحلیل_داده #یادگیری_ماشین #دیتاست #هوش_مصنوعی
👍4❤1
🎯 FarSSiM - دیتاست شباهت معنایی برای زبان غیررسمی فارسی

اگه دنبال یک دیتاست منحصر‌به‌فرد برای تحلیل شباهت معنایی در زبان غیررسمی فارسی هستی، FarSSiM اولین دیتاست STS فارسیه که شامل 1123 جفت متن کوتاه غیررسمیه. این دیتاست با شناسایی پارافریز‌ها بین توییت‌های فارسی جمع‌آوری شده و شامل امتیازدهی معنایی و ارتباط بین جملات است.

✨ ساختار فایل و ویژگی‌ها:

📂 فایل اکسل با داده‌های:

– متن اول و دوم

– امتیازدهی توسط 4 ارزیاب

– میانگین، انحراف معیار و واریانس امتیازها

📊 آمار دیتاست:

– تعداد کل جفت‌ها: 1123

🔗 لینک پروژه:

https://github.com/mojtabasajjadi/FarSSiM

🎓 انجام پروژه | منتورشیپ | تدریس خصوصی @Data_hub

📊 پرشین دیتا، مرجع دیتاست‌های فارسی! @persian_data

#پردازش_زبان #شباهت_معنایی #دیتاست_فارسی #هوش_مصنوعی
👍6❤2
این نکته‌ی کنکوری‌ای که می‌خوام بگم، دوتا پیش‌فرض خیلی ساده داره.

پیش‌فرض اول اینه که هر دلار آمریکا، قیمتش تقریباً برابره با ۳٫۶۷۳ درهم.
پس یه قانون ساده داریم برای محاسبه‌ی ارزش دلار از روی درهم.

پیش‌فرض دوم هم اینه که معمولاً (نه همیشه) قیمت دلار و تتر باید نزدیک به هم باشه.
معمولاً تتر حدود ۵۰۰ تا ۱۰۰۰ تومن گرون‌تر از دلار فیزیکیه.
مثلاً اگه کف بازار دلار فیزیکی ۱۰۰ هزار تومن باشه، انتظار داریم تتر حدود ۱۰۱ هزار تومن باشه.
.
حالا از این دو تا پیش‌فرض چه استفاده‌ای میشه کرد؟
خیلی راحت.

یه مثال عددی بزنم:
فرض کن قیمت درهم خیلی راحت از توی نت درمیاری و ضربدر ۳٫۶۷۳ می‌کنی و می‌رسی به عدد ۱۰۰ هزار تومن.
بعد می‌بینی دلار فیزیکی کف بازار ۹۰ هزار تومنه. (کلی کانال تلگرامی هست)

این یعنی دلار کف بازار ۱۰ هزار تومن عقب‌تره و به احتمال زیاد قراره برسه به ۱۰۰ هزار تومن.

پس اینجا یه فرصت برای خرید دلار فیزیکیه.

ولی نکته جذاب‌تر
حالا میری توی سایتی مثل نوبیتکس و می‌بینی تتر مثلاً ۸۰ هزار تومنه.
اینجا دیگه میشه گفت عالی‌ترین فرصت خرید تتر.
چرا؟
چون تتر حداقل قراره به ۹۰ هزار تومن برسه و احتمالاً حتی به ۱۰۰ هزار تومن هم برسه.

به این کاری که گفتم معمولاً میگن نوسان‌گیری.

من سعی کردم با یه مثال خیلی ساده توضیحش بدم.
❤10🔥1
Forwarded from MohammadAmin
پروژه Datayar مشکل پراکندگی جست‌وجوی دیتاست و ریپازیتوری بین چند منبع مختلف رو کمتر کنه.

امکانات اصلی:
جست‌وجوی هم‌زمان در Hugging Face، GitHub، Kaggle و OpenML
مقایسه نتایج از چند منبع
امکان سؤال پرسیدن درباره هر Dataset یا Repository به صورت اختصاصی
استخراج و ساختاردهی اطلاعات مهم قبل از ارسال به مدل
یکپارچه‌سازی مسیر جست‌وجو، بررسی و انتخاب منابع
کاهش توکن سوزی ایجنت ها برای مراحل ریسرچ پروژه ها

https://github.com/Elcapunnn/Datayar.git

نسخه آنلاین:
https://datayar.vercel.app/
❤15👍4
Forwarded from MohammadAmin
بنده این رو توسعه دادم در زمینه دیتاست ها
و یه تعدادی از دوستان در جاهای دیگه به کارشون اومد
گفتم ک شما چنل دیتاست دارید اگر مایل بودید تو چنل بزارید که بقیه هم بتونن استفاده کنن و شاید به کار کسی بیاد
اوپن سورسه همه چیز
❤12👍1
سلام، وقتتون بخیر

من اخیرا یک پروژه open-source به اسم Citeprobe ساختم برای بررسی و اعتبارسنجی referenceهای علمی به شکل static و بدون استفاده از LLM، مشابه اون‌چه در کنفرانس‌ها و ژورنال‌های آکادمیک رخ می‌ده

ایده اصلی اینه که صرفا چون یک citation توی یک دیتابیس پیدا نشده، نباید نتیجه بگیریم که جعلی یا hallucinated بوده. Citeprobe هر reference رو همزمان با چند منبع علمی مثل Crossref، OpenAlex، Semantic Scholar، arXiv، Europe PMC، DBLP و OpenReview بررسی می‌کنه و به‌جای یک جواب باینری، evidence و اختلاف بین sourceها رو هم نگه می‌داره.

علاوه بر title و DOI، اطلاعاتی مثل authorها، سال انتشار و venue و retraction/correction status و duplicate referenceها رو هم بررسی می‌کنه و مشخص می‌کنه نتیجه verified یا problematic یا inconclusive بوده و چرا.

ورودی هم فقط متن نیست. می‌تونه DOI، BibTeX، RIS، EndNot و یا PDF باشه و حتی PDF اسکن‌شده با OCR رو پشتیبانی می‌کنه. هم CLI و Python API داره و هم یه local web UI.

کل verification هم بدون LLM انجام می‌شه و پروژه open-source هست.

اگر فکر می‌کنید برای مخاطب‌های کانالتون مفیده، ممنون می‌شم یه نگاه بهش بندازید و در صورت مناسب بودن معرفی‌ش کنید:
https://github.com/Imanm02/citeprobe
❤14👍3🔥3
چت بات محرمانه سلامت روان فارسی

سلام رفقا!
یه پروژه کاربردی برای علاقه‌مندان به Agentic AI و فارسی‌زبان‌ها:
یه چت بات محرمانه فارسی برای کارمندان یه شرکت غذایی که در زمینه استرس، خواب و فرسودگی شغلی کمک می‌کنه، به سوالات خدمات مشاوره پاسخ می‌ده و می‌تونه جلسات مشاوره رو رزرو یا لغو کنه.
ساخته شده با LangGraph، Redis Stack و Streamlit. از RAG با جستجوی ترکیبی BM25 و vector روی اسناد استفاده می‌کنه، منابع پاسخ رو نشون می‌ده و حافظه مکالمات رو در Redis نگه می‌داره.
برای ساخت دستیارهای سازمانی با قابلیت tool calling می‌تونه الگوی خوبی باشه.

https://github.com/arminandtoo/health-care-agentic-ai

#دستیار_سلامت_روان #چت_بات_فارسی #هوش_مصنوعی
❤7
موتور فارسی ویدیوی کوتاه

سلام رفقا!
اگه می‌خواید ویدیوی کوتاه فارسی بسازید، این ریپازیتوری یه موتور کامل برای اسکریپت، پرامپت Veo/Kling، نریشن و زیرنویس خودکاره. با FastAPI، faster-whisper، edge-tts و ffmpeg کار می‌کنه و خروجی ویدیوی عمودی ۹:۱۶ با زیرنویس راست‌به‌چپ می‌ده. هم می‌شه روی Hugging Face Space رایگان اجرا کرد هم محلی.

https://github.com/alitelegram666/video-script-engine

نویسنده: alitelegram666

#ویدیو #فارسی #تولید_محتوا #هوش_مصنوعی
👍5❤1
تحلیل محبوبیت سایت‌های فارسی با کلیدواژه

یه پروژه Jupyter Notebook آوردم که داده‌های یکتانت رو تحلیل می‌کنه و از روی کلیدواژه‌های استفاده‌شده، محبوبیت سایت‌های فارسی رو نمایش می‌ده.
داده شامل کلیدواژه، دسته‌بندی تبلیغاتی و میانگین بازدید روزانه است.
با کتابخانه‌هایی مثل pandas، matplotlib و seaborn می‌شه کلمه‌های پرتکرار و روند بازدید رو دید.
اگه روی تبلیغات دیجیتال، سئو یا تحلیل داده‌های وب فارسی کار می‌کنید، می‌تونه مفید باشه.

https://github.com/mahajialirezaei/Yektanet-Data-Analysis


#تحلیل_داده #سئو #فارسی #تبلیغات_دیجیتال
🔥2
یه ابزار جدید و کاربردی براتون آوردم: Daanish. این پروژه یه هسته‌ی داده‌کاوی و یادگیری ماشین هست که با یه سری توابع آماده، کارتون رو برای پروژه‌های مختلف خیلی راحت‌تر می‌کنه.
از EDA و پیش‌پردازش داده تا مدل‌سازی برای طبقه‌بندی، سری‌های زمانی و خوشه‌بندی، همه‌چیز رو پوشش می‌ده. اگه می‌خواید سریع‌تر پروژه‌هاتون رو پیاده‌سازی کنید و وقتتون رو صرف کدنویسی از صفر نکنید، این ریپازیتوری می‌تونه کمکتون کنه.

https://github.com/soleimanihamed/Daanish


#داده_کاوی #یادگیری_ماشین #پایتون #تحلیل_داده
❤2
تشخیص و اصلاح سوگیری جنسیتی و نژادی در مدل‌های فارسی

یه نوت‌بوک جامع از دانشگاه شریف که سوگیری جنسیتی و نژادی رو در مدل‌های BERT و XLM-RoBERTa بررسی می‌کنه — با تمرکز خاص روی زبان فارسی. کدها هم ماسکینگ و هم اتنشن رو برای محاسبه وزن جنسیت در مشاغل مختلف استفاده می‌کنن و در نهایت دیتاست بی‌طرف‌سازی شده می‌سازن و bert-fa-zwnj-base رو فاین‌تیون می‌کنن تا سوگیری کم بشه. انگلیسی، پرتغالی، ایتالیایی، ژاپنی و ترکی هم پوشش داده شدن.

https://github.com/saaz742/NLP-Bias

#پردازش_زبان_طبیعی #سوگیری_مدل #فارسی #BERT #اخلاق_هوش_مصنوعی

اینجا خلاصه است؛ ادامهٔ ماجرا در اینستاگرام: dr.mohammad.dehghani
👍1
دیتاست و مدل خلاصه‌سازی گفتار فارسی

یه پروژه جالب برای خلاصه‌سازی گفتار فارسی منتشر شده. شامل دیتاستی از ضبط‌های گفتار غیررسمی — چت‌های روزمره، تماس‌ها و گفتگوهای طبیعی — با متادیتای غنی (اطلاعات گوینده، جزئیات ضبط، رونویسی و خلاصه‌های باکیفیت) که همه Segment و Align شده‌ان. علاوه بر دیتاست، یه مدل تست‌بنچ مبتنی بر معماری‌های پیشرفته یادگیری عمیق هم ارائه شده که روی همین داده‌ها فاین‌تیون شده. نکته مهم: دیتاست فعلا در دسترس نیست، اما کد و معماری مدل رو می‌تونید برای تحقیق و توسعه بررسی کنید.

https://github.com/ZahraArshia/Speech-Summarization

#پردازش_گفتار #خلاصه_سازی #فارسی #یادگیری_عمیق #NLP

اینجا خلاصه است؛ ادامهٔ ماجرا در اینستاگرام: dr.mohammad.dehghani
❤2
بانک کلمات ۱۰۹ زبان شامل فارسی

یه مخزن باحال برای پروژه‌های NLP و پردازش متن چندزبانه!
این ریپو لیست کلمات ۱۰۹ زبان رو داره (فارسی هم هست) که کلماتش با کاما جدا شده و راحت می‌شه به آرایه تبدیل کرد. برای پایتون و سی‌شارپ هم کتابخانه آماده داره.\nاگه روی کیبورد فارسی، بازی کلمه، تکمیل خودکار یا هر پروژه متنی کار می‌کنید، این دیتا خیلی وقتتون رو می‌گیره.
۱۸۹ ستاره گرفته و لیست زبان‌ها کامله از عربی و انگلیسی تا چینی و گرجی.

https://github.com/eymenefealtun/all-words-in-all-languages

#پردازش_زبان_طبیعی #دیتاست #پایتون #چندزبانه #فارسی

اینجا خلاصه است؛ ادامهٔ ماجرا در اینستاگرام: dr.mohammad.dehghani