This media is not supported in your browser
VIEW IN TELEGRAM
Одно из лучших репо-гайдов с тех пор, как
Karpathy
выпустил туториал по minGPT
🦾
GPT-Fast
: минималистичная реализация декодера на PyTorch с лучшими практиками: квантование int8/int4, декодирование, тензорный параллелизм и т.д. Увеличивает скорость LLM OS в 10 раз без изменения модели! Нам нужно больше minGPT и GPT-Fasts в мире открытого кода! Туториал создан разработчикои cHHillee из команды PyTorch.
pip install sentencepiece huggingface_hub
Блог: https://pytorch.org/blog/accelerating-generative-ai-2/
Код: https://github.com/pytorch-labs/gpt-fast
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21🔥6❤1
🦾 Записанные хардкодом переменные без описания могут ухудшить читаемость кода.
Использование Enum в #Python позволяет присваивать переменным осмысленные имена, повышая читаемость кода.
@data_analysis_ml
Использование Enum в #Python позволяет присваивать переменным осмысленные имена, повышая читаемость кода.
from enum import Enum
# class syntax
class Color(Enum):
RED = 1
GREEN = 2
BLUE = 3
# functional syntax
Color = Enum('Color', ['RED', 'GREEN', 'BLUE'])
🔗Подробнее@data_analysis_ml
🔥22👍8❤3
Суммаризация текстов с использованием LLM и LangChain 🚀
Знаете ли вы, что можно создать собственное приложение для суммаризации текстов, используя
На картинке полный исходный код.
@data_analysis_ml
Знаете ли вы, что можно создать собственное приложение для суммаризации текстов, используя
huggingface
модели и LangChainAI
менее чем за 20 строк кода? На картинке полный исходный код.
@data_analysis_ml
👍18❤3🔥3
🧠 Впервые ИИ смог восстановить изображения по активности мозга с точностью более 75%.
Японские исследователи совершили значительный прорыв в области создания изображений с помощью искусственного интеллекта, достигнув рекордной точности в 75 % при восстановлении изображений по активности мозга.
Это значительное улучшение по сравнению с предыдущими методами, которые достигали точности всего 50,4 %. Процесс включает в себя запись активности мозга испытуемых во время просмотра изображений и последующее восстановление этих изображений.
Используя нейронный транслятор сигналов и генеративный ИИ, исследователи смогли восстановить эти изображения с высокой точностью.
Эта технология открывает новые возможности для понимания человеческого разума и может привести к появлению новых форм невербальной коммуникации.
▪ Почитать подробнее
@data_analysis_ml
Японские исследователи совершили значительный прорыв в области создания изображений с помощью искусственного интеллекта, достигнув рекордной точности в 75 % при восстановлении изображений по активности мозга.
Это значительное улучшение по сравнению с предыдущими методами, которые достигали точности всего 50,4 %. Процесс включает в себя запись активности мозга испытуемых во время просмотра изображений и последующее восстановление этих изображений.
Используя нейронный транслятор сигналов и генеративный ИИ, исследователи смогли восстановить эти изображения с высокой точностью.
Эта технология открывает новые возможности для понимания человеческого разума и может привести к появлению новых форм невербальной коммуникации.
▪ Почитать подробнее
@data_analysis_ml
🔥30👍9😱7❤4
🦾 Отличный набор моделей диффузии текста в изображение, лучшие модели на данный момент (8 конвейеров.).
https://huggingface.co/collections/sayakpaul/assorted-text-to-image-diffusion-models-64f99f2b3ef7ea04c262c4b4
@data_analysis_ml
https://huggingface.co/collections/sayakpaul/assorted-text-to-image-diffusion-models-64f99f2b3ef7ea04c262c4b4
@data_analysis_ml
❤🔥10👍3❤1🔥1
Media is too big
VIEW IN TELEGRAM
🔥 Ego-Exo4D - новый большой датасет и набор бенчмарков, ориентированных на квалифицированную человеческую деятельность, для поддержки исследований в области видеообучения и мультимодального восприятия.
Это крупнейший публичный набор данных такого рода.
🔥 Dataset: https://ego-exo4d-data.org/
📚 Paper: https://ego-exo4d-data.org/paper/ego-exo4d.pdf
🌟 Project: https://www.projectaria.com/
🥩 Blog: https://ai.meta.com/blog/ego-exo4d-video-learning-perception
@data_analysis_ml
Это крупнейший публичный набор данных такого рода.
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15❤3🔥1
Возможно, это самый большой шаг Apple в области ИИ с открытым исходным кодом на сегодняшний день.
Некоторые ключевые особенности MLX включают:
▪API: MLX имеет Python API, который в точности повторяет NumPy. MLX также имеет полнофункциональный API C++. В MLX есть пакеты более высокого уровня, такие как mlx.nn и mlx.optimizers с API, близкими к PyTorch, чтобы упростить построени сложных моделей.
▪Композитные преобразования функций: В MLX есть композитные преобразования функций для автоматического дифференцирования, автоматической векторизации и оптимизации вычислительных графов.
▪Динамическое построение графов: Графы вычислений в MLX строятся динамически. Изменение моделей быстро компиллируются, а отладка проста и интуитивно понятна.
▪Операции могут выполняться на любом из поддерживаемых устройств (в настоящее время это CPU и GPU).
▪Унифицированная память: Заметным отличием MLX от других фреймворков является унифицированная модель памяти. Массивы в MLX находятся в общей памяти. Операции над массивами MLX могут выполняться на любом из поддерживаемых типов устройств без перемещения данных.
pip install mlx
Код
: https://github.com/ml-explore/mlx
Документация
: https://ml-explore.github.io/mlx/build/html/index.html
@data_analysis_mlPlease open Telegram to view this post
VIEW IN TELEGRAM
🔥32👍10❤3👏1🎉1
⚡️ SuperDuperDB: Добавьте искусственный интеллект в свою базу данных.
Проект, который позволяет интегрировать, обучать и управлять любыми моделями ИИ непосредственно для работы с базами данных и данными.
Поддерживает основные баы данных SQL и табличные форматы:
▪ Github
▪ Project
@data_analysis_ml
Проект, который позволяет интегрировать, обучать и управлять любыми моделями ИИ непосредственно для работы с базами данных и данными.
Поддерживает основные баы данных SQL и табличные форматы:
PostgreSQL, MySQL, SQLite, DuckDB, Snowflake, BigQuery, ClickHouse, DataFusion, Druid, Impala, MSSQL, Oracle, pandas, Polars, PySpark и Trino (а также MongoDB)
.▪ Github
▪ Project
@data_analysis_ml
👍20❤3👎1👏1😍1
С помощью DuckDB вы можете эффективно выполнять SQL-запросы на pandas
DataFrames без необходимости управления отдельным сервером СУБД. DuckDB - это высокопроизводительная аналитическая система баз данных.
Она разработана как быстрый, надежный, переносимый и простая в использовании база данных. DuckDB предоставляет богатый синтаксис SQL.
https://github.com/duckdb/duckdb
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍14❤3👎2🔥2🤨1
Будь то
Twitter
, показывающий посты для более чем миллиарда пользователей, или Netflix
, отслеживающий историю просмотров для предоставления персонализированных рекомендаций, - для работы с огромными объемами данных веб-приложениям требуются специализированные базы данных.Реляционные базы данных долгое время были стандартом для хранения структурированных данных. Однако появились новые типы баз данных, призванные удовлетворить растущие потребности в хранении данных.
Аналитические базы данных: Оптимизированы для сложных запросов бизнес-аналитики к большим массивам данных.
Модели хранения данных, ориентированные на столбцы, позволяют добиться высокого коэффициента сжатия и молниеносной скорости агрегирования. Благодаря хранению данных по столбцам, а не по строкам, аналитические базы данных могут выполнять быстрое сканирование для вычисления сумм, средних значений и других математических вычислений в огромных наборах записей.
Такое хранение данных по столбцам и оптимизированное агрегирование позволяет интерактивно запрашивать миллиарды строк для получения быстрых выводов.
Базы данных NoSQL: Обеспечивают гибкость, выходящую за рамки табличной реляционной модели. Различные базы данных
NoSQL
справляются с разными задачами:- Графовая база данных – это систематический набор данных, в котором подчеркиваются взаимосвязи между различными сущностями данных. База данных NoSQL использует математическую теорию графов для отображения связей с данными. В отличие от реляционных баз данных, которые хранят данные в жестких табличных структурах, графовые базы данных хранят данные в виде сети сущностей и отношений. В результате такие базы данных часто обеспечивают более высокую производительность и гибкость, поскольку лучше подходят для моделирования реальных сценариев.
- Базы данных «ключ — значение» работают совершенно иначе, чем более известные реляционные базы данных (РБД). В РБД предварительно определяют структуру данных в базе данных как последовательность таблиц, содержащих поля с четко определёнными типами данных. Экспонирование типов данных в базе данных позволяет применить ряд оптимизаций. Напротив, системы «ключ — значение» обрабатывают данные как одну непрозрачную коллекцию, которая может иметь разные поля для каждой записи. Это обеспечивает значительную гибкость и более точно следует современным концепциям, таким как объектно-ориентированное программирование. Поскольку необязательные значения не представлены заполнителями или входными параметрами, как в большинстве РБД, базы данных «ключ
- База данных документов – это тип баз данных NoSQL, предназначенный для хранения и запроса данных в виде документов в формате, подобном JSON. JavaScript Object Notation (JSON) – это открытый формат обмена данными, который читается как человеком, так и машиной.
-Колоночные базы данных - это тип баз данных, где данные хранятся и организуются по колонкам, в отличие от традиционных реляционных баз данных, где данные хранятся по строкам. В колоночных базах данных каждая колонка содержит данные одного типа, и они компактно хранятся в сжатом формате.
Объектно-реляционное отображение (ORM): Обеспечивает связь между объектно-ориентированным кодом и реляционными базами данных путем автоматического преобразования между представлениями данных. Это избавляет от утомительного ручного управления данными. Однако уровень абстракции может увеличивать нагрзку при сложных операциях чтения и записи. Отладка также может быть затруднена и приводить к нагрузке на систему.
Главное - выбрать правильную базу данных, соответствующую вашим конкретнымзадачам и моделям данных. Типичное приложение может использовать комбинацию реляционных, NoSQL и ORM-технологий для достижения наилучшей производительности при масштабировании.
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤12👍10🔥2
Чтобы определить собственный метод сравнения для экземпляров классов #Python, используйте метод
__eq__
.@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍24❤6🔥3😁1💯1
This media is not supported in your browser
VIEW IN TELEGRAM
🦾 С 13 декабря разработчики могут получить доступ к Gemini Pro через Google AI Studio или через Google Cloud.
С доступом можзно быстро создавать прототипы и запускать приложения с помощью API-ключа. → https://dpmd.ai/announcing-gemini #GeminiAI
https://dpmd.ai/announcing-gemini #GeminiAI
@data_analysis_ml
С доступом можзно быстро создавать прототипы и запускать приложения с помощью API-ключа. → https://dpmd.ai/announcing-gemini #GeminiAI
https://dpmd.ai/announcing-gemini #GeminiAI
@data_analysis_ml
❤8👍4🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🌐 Проект: https://ruoyidu.github.io/demofusion/demofusion.html
📄 Статья: https://arxiv.org/abs/2311.16973
🧬 Код: https://github.com/PRIS-CV/DemoFusion
🦒Colab https://modelslab.com: пожалуйст
🐣Github: https://github.com/camenduru/DemoFusion-colab
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍6🔥2👎1🤨1
scikit-learn
и предлагающая множество продвинутых алгоритмов для задач обучения, прогнозирования и классификации.https://github.com/aeon-toolkit/aeon
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13👏9❤5🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🎞️Reenact Any Character in Movie🎞️
🖥 (SMPLer-X): https://github.com/caizhongang/SMPLer-X
🖥 Код (Propainter): https://github.com/sczhou/ProPainter
🏆 Website: https://caizhongang.com/projects/SMPLer-X/
🥩 Demo: https://caizhongang.com/projects/SMPLer-X/
#NeurIPS2023
@data_analysis_ml
SMPLer-X
первая открытая модель для монокулярного 4D захвата движения. Объеденив MPLerX и Propainter
можно создать свой ЛА-ЛА Ленд!#NeurIPS2023
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤2🔥2
1. Репозиторий Awesome Data Github
В этом репозитории вы найдете ссылки на открыте наборы данных, которые содержат изображения, текст, аудио и табличные данные.
https://github.com/awesomedata/awesome-public-datasets
2. Kaggle
Более 1000 датасетов, которые можно легко скачать и работать с ними, совершенно бесплатно.
https://www.kaggle.com/datasets
3. Открытый реестр данных на AWS
Поиск и обмен датасетами х с помощью ресурсов AWS.
4. Open ML
Более 20K+ наборов данных на Open ML
https://openml.org
5. Papers with Code
Papers with Code содержит более 7000 открытыз наборов данных по всем возможным тематикам.
https://paperswithcode.com/datasets
6. Hugging Face
На Hugging Face вы можете найти 80K+ наборов данных.
https://huggingface.co/datasets
7. Dagshub
Много бесплатных даатсетов можно найти на Dagshub:
https://dagshub.com/datasets/
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤17👍10🔥5
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥14👍9❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Автор, показывает что понимание и сжатие данных для llm- это две стороны одной медали.🪙
И что интересно, когда мы имеем дело с предсказанием слов, cжатие данных с потерями, выглядит умнее, чем сжатие без потерь! 💡
Ниже приводится объяснение того, почему ChatGPT дает нам иллюзию понимания:
"Тот факт, что ChatGPT перефразирует материал из Сети, а не цитирует его слово в слово... создает иллюзию, что ChatGPT понимает материал".
У людей заучивание не является показателем подлинного обучения, поэтому неспособность ChatGPT выдавать точные цитаты сайтов, как раз и заставляет нас думать, что он чему-то научился.
Когда мы имеем дело с последовательностями слов, сжатие с потерями выглядит умнее, чем сжатие без потерь".
Полный текст статьи читайте здесь: https://newyorker.com/tech/annals-of-technology/chatgpt-is-a-blurry-jpeg-of-the-web
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍25🔥4❤2
▪GPT-4 + Medprompt -> SOTA MMLU
https://microsoft.com/en-us/research/blog/steering-at-the-frontier-extending-the-power-of-prompting/
▪Mixtral 8x7B @ MLX
https://github.com/ml-explore/mlx-examples/tree/main/mixtral
▪За пределами человеческих данных: Масштабирование самообучения для решения проблем с помощью языковых моделей
https://arxiv.org/abs/2312.06585
▪Phi-2 (2.7B), самая маленькая и самая впечатляющая модель
https://microsoft.com/en-us/research/blog/phi-2-the-surprising-power-of-small-language-models/
▪LLM360: На пути к полностью прозрачным LLM с открытым исходным кодом
https://arxiv.org/abs/2312.06550
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15❤2🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
RLHF - это одна из ключевых техник, которая привела к появлению современных LLM.
В этом курсе, который ведет Никита Намджоши, разработчик из
GenAI
в Google cloud, вы узнаете, как работает RLHF, в том числе как применить его для настройки LLM в собственных приложениях.
Вы также воспользуетесь библиотекой с открытым исходным кодом для настройки базового LLM и оцените настроенную модель, сравнив ее ответы до и после RLHF-настройки.
deeplearning.ai/short-courses/reinforcement-learning-from-human-feedback/
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18❤2🔥1