Big Data AI
16.8K subscribers
832 photos
98 videos
19 files
833 links
@haarrp - админ

Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям

@data_analysis_ml - анализ данных

@ai_machinelearning_big_data

@itchannels_telegram - важное для программиста

РКН: clck.ru/3Fmqxe
Download Telegram
⚡️ Vchitect-2.0, модель генерации видео 2B, поддерживающая разрешение до 720x480 и генерацию 5-20 секунд.

👉 Сайт: https://vchitect.intern-ai.org.cn
👉 Код: https://github.com/Vchitect/Vchitect-2.0
👉 Демо: https://huggingface.co/spaces/Vchitect/Vchitect-2.0

@bigdatai
👍42
Forwarded from Machinelearning
💊 Machine Learning: Медицинский дайджест за период 7.09 - 14.09 2024 года

🟩 BrainWave: модель для анализа сигналов головного мозга.

BrainWave – модель, обученная на 40 000 часах инвазивных (iEEG) и неинвазивных (EEG) записей мозговой активности 16 тыс пациентов. Это первая фундаментальная модель для анализа сигналов мозга, объединяющая данные из разных источников.

🟩 DS-ViT: Visual Transformer для ранней диагностики болезни Альцгеймера.

Dual-Stream Vision Transformer (DS-ViT) -метод, который объединяет сегментацию и классификацию для улучшения точности обучения моделей, обрабатывающих снимки МРТ головного мозга.

Он использует FastSurfer в качестве обучающей модели для детальной сегментации для обучаемой ViT-модели ADAPT (модель диагностики болезни Альцгеймера).

🟩 EyeCLIP: фундаментальная VLM для офтальмологических изображений.

EyeCLIP, визуально-языковая фундаментальная модель (VLM), обученная на более чем 2,77 миллионах мультимодальных офтальмологических изображений и 11 180 текстовых описаний от 128 000 пациентов.

Модель может выполнять задачи классификации заболеваний глаз, прогнозирование системных заболеваний, поиск информации по изображению и тексту и ответы на вопросы, связанные с изображениями патологии глаз.

🟩 Возможности SAM для сегментации опухолей мозга.

В исследовании изучается эффективность SAM для сегментации опухолей головного мозга на основе набора данных BraTS2019, который содержит изображения четырех модальностей (T1, T1ce, T2, FLAIR). Авторы оценивают эффективность SAM с использованием двух типов маркирования - точки и рамки и анализируют влияние количества маркирования на точность сегментации.

Результаты показывают, что SAM с маркировкой в виде рамок превосходит по точности маркировку в виде точек. Увеличение количества точек улучшает производительность до определенного предела, после которого точность начинает снижаться. Комбинирование точечных и рамочных маркировок позволяет добиться наилучших результатов.

🟩 MEDIC: Оценка языковых моделей для клинического применения.

MEDIC использует пять ключевых измерений клинической компетентности: медицинское мышление, этические аспекты и предвзятость, понимание данных и языка, контекстное обучение и клиническая безопасность.

Оценка проводится тестированием на задачах: ответы на закрытые и открытые вопросы, суммирование медицинских текстов и создание клинических заметок. Для оценки безопасности моделей используется набор данных Med-Safety, содержащий 900 сценариев с потенциально опасными медицинскими запросами.

Приложения с использованием языковых моделей.


🟪 KARGEN: генерация отчетов рентгенографии грудной клетки с использованием графа знаний и больших языковых моделей.

KARGEN - фреймворк, объединяющий большие языковые модели с графом знаний, специально разработанным для анализа рентгенограмм грудной клетки.

Архитектура KARGEN: энкодеры визуальных признаков (Swin Transformer), модуль слияния (element-wise fusion + modality-wise fusion) и генератор отчетов.

Энкодер визуальных признаков извлекает признаки из рентгеновского изображения, граф знаний, построенный на основе взаимосвязей между 14 заболеваниями из набора данных Chexpert, используется для извлечения признаков, связанных с этими заболеваниями.

🟪 i-MedRAG: итеративный поиск информации для ответов на сложные медицинские вопросы.

i-MedRAG - архитектура RAG, предназначенная для ответов на сложные медицинские вопросы, требующие многоэтапных рассуждений. В отличие от традиционных RAG-систем, i-MedRAG использует итеративный подход к поиску информации.

Методики и техники

🟦 Автоматическая сегментация клеток с использованием UNet в DeepChem.


В статье описан эксперимент создания​​ интеграции модели UNet, архитектуры, известной своей эффективностью в задачах сегментации изображений, с python библиотекой DeepChem, предназначенной для машинного и глубокого обучения в биологии и химии, для задач автоматической сегментации клеток на различных наборах данных микроскопических изображений.

🔥Полный дайджест

@ai_machinelearning_big_data

#news #ai #ml #medtech
👍31
Узнайте, как обучать и развертывать модели с помощью контейнеров Deep Learning Containers.

https://huggingface.co/docs/google-cloud/index

@bigdatai
👍31🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Красивая визуализация нейронной сети, обученной на MNIST

Нейрона была написана с нуля на языке Odin и визуализирована с помощью Raylib.

https://github.com/bones-ai/odin-mnist-nn

@bigdatai
11❤‍🔥5🥰1
ИТМО назвал лидеров развития Open Source в России

Лидером среди российских компаний стал Яндекс, за ним — Сбер и Т-банк. Компании оценивались по количеству опенсорс-проектов, их популярности, качеству репозиториев и активности контрибьюторов.

Среди ключевых решений лидера рейтинга: CatBoost (библиотека для градиентного бустинга), YTsaurus (платформа для работы с большими данными) и YDB (распределённая SQL-база данных).

Ключевые выводы исследования:
— Большинство компаний ориентируются не только на внутренний, но и на международный рынок;
— GitHub остаётся стандартом, но растёт интерес к альтернативам (Gitee, GitVerse);
— Open source объединяет специалистов со всего мира;
— Конкуренция постепенно уступает место совместному развитию отрасли;
— Для развития опенсорс-проектов необходима финансовая поддержка;
— Несмотря на рост ИИ, роль человека в опенсорсе остаётся ключевой.
👍12👎2
Mistral выпустили улучшенную модель Small 22B - Многоязычную модель с контекстом 128K контекст

Промежуточная модель между Mistral NeMo 12B и Mistral Large 123B.

> Параметры 22B
>  Поддерживает вызов функций
> Длина контекста 128k
> Доступны веса

pip install --upgrade vllm

🤗Веса: https://huggingface.co/mistralai/Mistral-Small-Instruct-2409

@bigdatai
👍61🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Phidias

Генеративная модель для создания 3D-контента из текста, изображения и 3D-условий с помощью диффузии с добавлением ссылок

https://huggingface.co/papers/2409.11406

@bigdatai
👍31🔥1
🎮 GTA-Human II

Проект, который создан на основе GTA-V для оценки позы и движения человека.

В нем представлены сцены с участием нескольких человек с аннотациями.

В дополнение к цветным последовательностям изображений также предоставляются трехмерные ограничивающие рамки и обрезанные облака точек (созданные на основе синтетических изображений).

страница проекта: https://caizhongang.com/projects/GTA-Human/gta-human_v2.html

@bigdatai
Please open Telegram to view this post
VIEW IN TELEGRAM
4👏2🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Разработчики Kling AI представили новый инструмент Motion Brush, который позволяет анимировать отдельные объекты в видео. Пользователи могут загружать изображения и задавать пути движения, просто нарисовав траекторию ✍️. Это дает возможность точно управлять движением до шести элементов одновременно, что делает видео более динамичными и увлекательными 🎥.

Среди ключевых функций Kling AI 1.5 — поддержка 1080p HD для улучшенного качества изображений и возможность комбинирования статических и анимированных объектов. Это позволяет авторам фиксировать определенные области, предотвращая нежелательные движения в финальном видео 🌟.

Kling Motion Brush — это революция в создании видео, открывающая новые горизонты для контент-креаторов! 🚀

Пробуем здесь.

#KlingAI #MotionBrush #AI #VideoCreation #Animation #DigitalArt

@bigdatai
🔥101👍1👎1🤔1👌1
This media is not supported in your browser
VIEW IN TELEGRAM
3DTopia-XL GenAI Foundation

"3DTopia-XL", мощный трансформер создания 3D-PBR-объектов.

- Проект: https://3dtopia.github.io/3DTopia-XL/
- Код: https://github.com/3DTopia/3DTopia-XL
- Демо : https://huggingface.co/spaces/FrozenBurning/3DTopia-


@bigdatai
👍31
Большинство моделей от Mistral теперь доступны бесплатно по API 😱

Что за аттракцион невиданной щедрости? Вероятно, ваши запросы будут использованы для обучения новых моделей (хотя это не точно).

VPN не требуется, карта не нужна. Пользуйтесь!

@data_analysis_ml
👍7
⚡️ Шпаргалка по техникам регуляризации в машинном обучении

@bigdatai
👍6🔥3👌1
Forwarded from Python/ django
🖥 10 малоизвестных библиотек Python для работы с данными

PyGWalker: PyGWalker упрощает рабочий процесс анализа и визуализации данных в Jupyter Notebook, превращая фрейм данных pandas (или фрейм данных polars) в пользовательский интерфейс в стиле Tableau для визуального исследования.

SciencePlots: Создаёт профессиональные графики matplotlib для презентаций, исследовательских работ и т.д.

CleverCSV: Устраняет ошибки синтаксического анализа при чтении CSV-файлов с помощью Pandas.

Fastparquet: Ускоряет ввод-вывод pandas в 5 раз.

Bottleneck: ускоряет работу методов NumPy в 25 раз. Особенно, если массив имеет значения NaN.

Multipledispatch: предоставляет методы для перегрузку функций в Python.

Aquarel: дополнительные стили графиков matplotlib.

Modelstore: библиотека моделей машинного обучения для лучшего отслеживания работы моделей.

Pigeon: помогает анотировать данные щелчками мышки в Jupyter notebook.

Nbcommands: помогает легко выполнять поиск кода в Jupyter notebooks, а не выполнять это вручную.

📌Подробнее с примерами кода

@pythonl
Please open Telegram to view this post
VIEW IN TELEGRAM
👍113🔥1
🚀 Как распределить и оптимизировать нагрузку для моделей, использующих как GPU, так и CPU.

Руководитель группы автоматической генерации рекламы из Яндекса поделилась опытом генерации миллиардов рекламных объявлений с использованием YandexGPT и BERT-модели.

https://habr.com/ru/companies/yandex/articles/842024/

@bigdatai
5👍2
🖥 Энтузиаст сделал "альтернативу ChatGPT-o1" (По его заявлениям).

🌟 Модель успешно проходит тесты вроде количества "r" в "strawberry"

🌟 Автор отмечает, что она также хорошо справляется с логическими задачами, с которыми не могут справиться даже модели вроде o1, 4o или Claude

🌟 Модель разбивает комплексные задачи на более мелкие, что способствует более точному решению

🔐 Лицензия: не указана

👩‍💻 Написана на Python с использованием React для фронтенда

▪️Github

@bigdatai
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥21🎉1
🖥 Data Warehouse, Data Lake, Data Lakehouse, Data Fabric, Data Mesh – что это такое, и в чем разница?

💡В этой статье автор затрагивает историю появления баз данных, сравнивает концепции архитектур данных, их преимущества и недостатки

🔗 Ссылка: *клик*

@bigdatai
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🎉3🔥2👏1
Forwarded from Machinelearning
🌟 Emu3: набор MMLM, основанный на методе предсказании следующего токена.

Модели Emu3 разработаны для задач мультимодальной генерации и восприятия: генерации изображений и видео по текстовому описанию, понимание визуальных представлений и прогнозирования кадров в видео.

Модель использует токенизатор изображений SBER-MoVQGAN для преобразования видео и изображений в дискретные токены, RMSNorm для нормализации, GQA для механизмов внимания, SwiGLU для активации и RoPE для позиционного кодирования.

Процесс генерации в Emu3 начинается с обработки моделью начальной последовательности токенов (например, текстовое описание для генерации изображения).

Затем Emu3 авторегрессивно предсказывает наиболее вероятный следующий токен в последовательности. Этот процесс продолжается до тех пор, пока не будет сгенерирована вся последовательность, представляющая собой конечный результат (изображение или видео).

▶️ Представлены 3 модели:

🟢Emu3-Chat – модель-чат, анализирует входные изображения и генерирует текстовые ответы;

🟢Emu3-Gen – модель для генерации изображений по текстовому описанию;

🟢Emu3-VisionTokenizer – токенизатор изображений для преобразования изображений и видео в дискретные токены.

Для обучения использовались наборы данных Aquila, LAION-High-Resolution, InternVid, MSCOCO-30K, GenEval, T2I-CompBench, DPG-Bench, SEED-Bench, RealWorldQA, OCRBench и VBench.

Результаты тестирования показывают превосходство Emu3 над SDXL в генерации и сопоставимость с LLaVA-1.6 в задачах интерпретаций изображений.

Инференс моделей пока доступен только в СLI на Transformers, примеры для генерации или описания входного изображения можно найти в репозитории проекта.

⚠️ Информации о технических требованиях по GPU разработчиками Emu3 не предоставлено.

▶️Локальная установка:

# Clone the repository
git clone https://github.com/baaivision/Emu3
cd Emu3

# Install requirements
pip install -r requirements.txt


📌Лицензирование : Apache 2.0 License.


🟡Страница проекта
🟡Коллекция моделей на HF
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #MMLM #Text2Video #Text2Image
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1