225K subscribers
3.89K photos
662 videos
17 files
4.5K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
⚡️ В России появился аналог LMSYS Chatbot Arena — LLM Arena

Платформу выкатил Роман Куцев в коллаборации с экспертами по нейросетям и бывшими разработчиками TrainingData.ru. В отличие от зарубежного бенчмарка, он дает возможность оценить и российские нейросети (YaGPT, GigaChat и другие).

В остальном принцип работы максимально схожий: пользователи бесплатно получают доступ к языковым моделям, взамен их просят оценивать ответы нейросетей, на основе которых формируется объективный независимый рейтинг. Сейчас для теста доступна 21 модель.

@ai_machinelearning_big_data
👍35🤣20🔥8😁3🥰2🙊2🦄1
🌟Adam-mini: облегченная версия оптимизатора Adam.

Основная идея Adam-mini заключается в том, что матрица Гессиана нейронных сетей, особенно трансформеров, имеет почти блочно-диагональную структуру. Такая структура подразумевает, что для оптимальной работы различных блоков может потребоваться разная скорость обучения.

Adam-mini решает эту проблему, разбивая параметры модели на блоки по наименьшим плотным подблокам в матрице Гессиана. Каждому блоку присваивается одна скорость обучения. Скорость обучения для каждого блока в Adam-mini определяется путем усреднения значений вектора импульса второго порядка Adam (v) в пределах этого блока.

Эта методика сокращает количество необходимых LR, что приводит к значительной экономии памяти. Например, на LLM Adam-mini может сократить до 90% LR, по сравнению с Adam, что в итоге экономит использования памяти на 45-50 %.

Эффективность Adam-mini была проверена сравнением с показателями AdamW в различных сценариях:

Pre-training: на Llama2-7B Adam-mini сокращает использование памяти на 48,04 %, сохраняя при этом сопоставимые с AdamW потери при проверке.

SFТ и RLHF: превосходит AdamW в задачах на основе LoRA и RLHF, удерживая низкое значение perplexity.

Non-LLM Tasks: в задачах, не связанных с LLM - модели СV, ResNet, диффузионные модели, GCN и GAT демонстрирует сравнимую или лучшую производительность, чем AdamW, при этом используя меньше памяти.

Пропускная способность: при предварительном обучении Llama2-7B на 2×A800-80GB Adam-mini показывает производительность на 49,6 % выше, чем AdamW, экономя при этом 33,1 % времени.

▶️Текущая реализация Adam-mini поддерживает популярные фреймворки:

🟢DDP distributed framework;
🟢FSDP distributed framework;
🟢DeepSpeed;
🟢Hugginface Trainer;
🟢Torchtitan.

В репозитории проекта представлены примеры кода для SFT и RLHF претрейна LLM:

🟠GPT2 (125M-1.5B), NanoGPT codebase на фреймворке DDP
🟠Llama3-8B, Torchtitan code base на фреймворке FSDP
🟠SFT и RLHF Llama2-7B, ReMax codebase на фреймворке DeepSpeed

▶️Локальный запуск :

# # import from source
git clone https://github.com/zyushun/Adam-mini
cd Adam-mini
pip install -e .

# Then use Adam-mini optimizer as follows
from adam_mini import Adam_mini

optimizer = Adam_mini(
named_parameters = model.named_parameters(),
lr = lr,
betas = (beta1,beta2),
eps = eps,
weight_decay = weight_decay,
model_sharding = True,
dim = model_config.dim,
n_heads = model_config.n_heads,
n_kv_heads = model_config.n_kv_heads,
)
# all the hyperparameters, including learning rate (lr), weight_decay, beta1, beta2, eps, its recommend using the same values as for AdamW



🟡Arxiv
🖥Github [ Stars: 226 | Issues: 8 | Forks: 9]


@ai_machinelearning_big_data

#AI #ML #Adam #Pytorch #Train
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍35🔥196😍1🐳1
Новостной дайджест

✔️Конкурент Neuralink интегрировал ChatGPT в мозговой имплантат человека.

Компания Synchron, конкурирующая с Neuralink, интегрировала ChatGPT от OpenAI в свой имплант с интерфейсом BCI, чтобы помочь людям с параличом легче управлять цифровыми устройствами.
BCI Synchron помогает больным с амиотрофическим склерозом предсказывать и предлагать ответы во время общения, которые они могут выбрать с помощью сигналов мозга. Стоимость имплантата Synchron оценивается в 50-100 тысяч долларов при среднем сроке ожидания в 6 месяцев.
newsbytesapp.com

✔️CRAM - новая технология памяти, позволяющая снизить потребление энергии при обработке данных ИИ в 1000 раз.

Исследователи из Университета Миннесоты разработали новую технологию Computational Random-Access Memory (CRAM) которая способна снизить энергопотребление при обработке данных. В отличие от традиционных решений, где данные перемещаются между памятью и процессором, CRAM позволяет обрабатывать данные непосредственно в ячейках памяти.
Это достигается за счет использования высокоплотной и перенастраиваемой спинтронной структуры, встроенной в ячейки памяти. Таким образом, данные не покидают память, что минимизирует задержки отклика и потребление энергии, связанные с передачей информации.
tomshardware.com

✔️AMD выпускает Fluid Motion Frames 2 с поддержкой искусственного интеллекта.

AMD представила техническое превью Fluid Motion Frames 2 (FMF2) в рамках обновления пакета драйверов Adrenalin. Эта новая версия включает "AI-оптимизированные улучшения", которые обеспечивают более плавную работу и сниженную задержку при генерации кадров.
FMF2 теперь совместима с режимами Vulkan и OpenGL, а также поддерживает полноэкранный режим без границ.
Fluid Motion Frames 2 доступен для видеокарт Radeon RX 7000 и 700M и совместим с RX 6000.
Пользователям доступно для скачивания превью версии 24.20.01.02 на сайте AMD.
pcworld.com

✔️Google DeepMind разработали JumpReLU Sparse Autoencoders с рекордной точностью восстановления.

Google DeepMind опубликовали исследование, в котором описали новую архитектуру нейронных сетей под названием JumpReLU Sparse Autoencoders (SAEs), которая значительно улучшает восстановление данных.
JumpReLU SAEs используют модифицированную активационную функцию JumpReLU, которая устраняет предактивации ниже определенного порога, что позволяет уменьшить количество активных нейронов и улучшить обобщающую способность модели. Это решение решает проблему компромисса между разреженностью и точностью восстановления, обеспечивая высокую эффективность в сравнении с традиционными Gated и TopK SAEs.
arxiv.org

✔️NVIDIA анонсирует генеративные AI модели и микросервисы NIM для OpenUSD, ускоряющие разработку цифровых двойников.

NVIDIA представила новые генеративные AI модели и микросервисы NIM для Universal Scene Description (OpenUSD), созданные для ускорения разработки приложений в области робототехники и промышленного дизайна. Они позволяют разработчикам генерировать OpenUSD-код, проводить поиск в библиотеках 3D и изображений с использованием естественного языка, а также проверять совместимость файлов с версиями OpenUSD. Микросервисы помогут создать высокоточные виртуальные миры и цифровые двойники, что откроет новые возможности для применения AI в различных отраслях.
Среди новых микросервисов, которые будут доступны в ближайшее время, — USD Layout для сборки сцен на основе текстовых подсказок и USD SmartMaterial для применения реалистичных материалов к CAD-объектам.
NVIDIA также анонсировала интеграцию OpenUSD с решениями Siemens для поддержки сложных симуляций и визуализации данных в реальном времени.
roboticstomorrow.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍177🔥2🗿1
Lite-Oute-1: семейство компактных base и instruct моделей

Oute AI представила в открытом доступе модели на 300М, 150M и 65М параметров в base и instruct вариантах и в GGUF-формате. Список релиза:

🟠Lite-Oute-1-300M Base
🟠Lite-Oute-1-300M-Instruct
🟠Lite-Oute-1-300M Base GGUF
🟠Lite-Oute-1-300M-Instruct GGUF
🟠Lite-Mistral-150M-v2-Instruct
🟠Lite-Mistral-150M-v2-Instruct GGUF
🟠Lite-Oute-1-65M Base
🟠Lite-Oute-1-65M-Instruct
🟠Lite-Oute-1-65M Base GGUF
🟠Lite-Oute-1-65M-Instruct GGUF

Lite-Oute-1-300M: "старшая" модель семейства на архитектуре Mistral с 300М параметров и контекстом в 4096 токенов. Эта модель специально разработана в качестве отправной точки для тонкой настройки при выполнении различных задач. Она обеспечивает баланс между компактными размерами и возможностями.
Некоторые оценки 0-shot: MMLU - 24.87, Winogrande- 53.35, OpenBookQA - 30.80

Lite-Oute-1-300M Base GGUF: диапазон квантования от FP16 (600 МВ) до Q2_K (176 MB), всего 15 вариаций.

Lite-Oute-1-300M-Instruct: instruct-версия 300М Base с теми же параметрами. Модель использует шаблон ChatML.
Некоторые оценки 0-shot: MMLU - 24.00, Winogrande- 53.75, OpenBookQA - 32.20

Lite-Oute-1-300M-Instruct GGUF: диапазон квантования от FP16 (600 МВ) до Q2_K(176 MB), всего 15 вариаций.
Модель использует шаблон ChatML

Lite-Mistral-150M-v2-Instruct: модель на основе архитектуры Mistral, включающая около 157М параметров. Основной целью создания этой модели была разработка компактной и эффективной модели, способной работать на широком спектре устройств, сохраняя при этом разумный уровень функциональности и согласованности для своего небольшого размера. Модель была обучена на ~ 8 миллиардах токенов.
Некоторые оценки 0-shot: MMLU - 25.28, Winogrande- 51.78, OpenBookQA - 28.40
⚠️ Модель чувствительна к используемому шаблону чата, уточните его на странице модели на HF.

Lite-Mistral-150M-v2-Instruct GGUF: диапазон квантования от FP16 (314 МВ) до Q2_K (68.5 MB), всего 15 вариаций.
⚠️ Модель чувствительна к используемому шаблону чата, уточните его на странице модели на HF.

Lite-Oute-1-65M Base: экспериментальная ультракомпактная базовая модель, построенная на архитектуре LLaMA и содержащая около 65М параметров.
Эта модель предназначена в качестве отправной точки для тонкой настройки под узкоспециальные задачи. Из-за своего чрезвычайно малого размера эта модель имеет базовые возможности генерации текста, но испытывает трудности с инструкциями или поддержанием связности тем.
Некоторые оценки 0-shot: MMLU - 23.05, Winogrande- 51.70, OpenBookQA - 27.60

Lite-Oute-1-65M Base GGUF: диапазон квантования от FP16 (131 МВ) до Q2_K (31.5 MB), всего 15 вариаций.

Lite-Oute-1-65M-Instruct: instruct-версия 65М Base с теми же параметрами.
Некоторые оценки 0-shot: MMLU - 23.45, Winogrande- 50.04, OpenBookQA - 28.60.
Модель использует шаблон ChatML.

Lite-Oute-1-65M-Instruct GGUF: диапазон квантования от FP16 (131 МВ) до Q2_K(31.5 MB), всего 15 вариаций.
Модель использует шаблон ChatML


🟡Страница проекта
🟡Все модели на HF


@ai_machinelearning_big_data

#AI #TinyLM #ML #OuteAI #GGUF
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1716🥰31
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 MindSearch: Мультиагентная система веб-поиска под управлением языковой модели

MindSearch - фреймворк от InternLM, объединяющий сильные стороны больших языковых моделей (LLM) и поисковых систем для решения задач поиска и агрегации информации в Интернете.

Привлекательность фреймворка складывается из способности эффективно управлять контекстом поиска, распределяя когнитивную нагрузку между несколькими агентами, навыком сокращения длины контекста для каждого агента и способностью к построению иерархии поисковых запросов.

Архитектура MindSearch состоит из двух частей:

🟢WebPlanner. Этот агент имитирует человеческие рассуждения, декомпозируя запрос пользователя в направленный ациклический граф (DAG). Каждый узел графа представляет собой подвопрос, который может быть решен независимо. WebPlanner динамически строит DAG, генерируя код Python для добавления узлов и связей, тем самым итеративно решет последовательность задач и параллельно выполняет подзадачи.

🟢WebSearcher выполняет иерархический поиск информации для ответа на подвопросы, заданные WebPlanner. Он начинает с генерации нескольких семантически похожих запросов, чтобы расширить область поиска и улучшить запоминание. Затем он выбирает наиболее релевантные веб-страницы для детального прочтения и использует LLM для создания ответа на основе собранной информации.

Эксперименты на задачах с закрытыми (GPT) и открытыми (InternLM) языковыми моделями показали эффективность MindSearch. По сравнению с существующими решениями для поиска (ChatGPT-Web и Perplexity Pro), MindSearch генерирует ответы с большей глубиной и широтой.

Целевая группа людей-экспертов предпочитали ответы от MindSearch, нежели ответы от Perplexity/ChatGPT или поисковую выдачу классической поисковой системы.

Локальная установка может взаимодействовать как с онлайн-сервисами AI (GPT, Claude), так и локально запущенные LLM, с помощью FAST API. Настройка моделей и указание API ключей для онлайн-сервисов Ai производятся в файле models по пути /mindsearch/agent/

В репозитории MindSearch в качестве локального фронтэнда предлагается на выбор UI на Gradio, React или Streamlit.

▶️Локальный запуск на примере локальной LLM InternLM2.5-7b-chat и UI Gradio:

# Dependencies Installation
pip install -r requirements.txt

# Setup FastAPI Server
python -m mindsearch.app --lang en --model_format internlm_server

# Run with Gradio
python frontend/mindsearch_gradio.pyW


📌Лицензирование : Apache 2.0 license


🟡Страница проекта
🟡Arxiv
🟡Demo Video
🟡Demo на китайским языке
🖥Github [ Stars: 61 | Issues: 0 | Forks: 7]


@ai_machinelearning_big_data

#AI #ML #LLM #AgentSearch
Please open Telegram to view this post
VIEW IN TELEGRAM
16👍9🔥4
⚡️ Gemma 2 2B: Релиз набора моделей и открытый набор автоэнкодеров к семейству Gemma

Спустя месяц после выхода Gemma 2 компания Google расширила набор моделей Gemma, добавив в него следующие новинки:

🟢Gemma-2-2B;
🟢Gemma-2-2b-it;
🟢Gemma-2-2b-pytorch;
🟢Gemma-2-2b-it-pytorch;
🟢Gemma-2-2b-GGUF;
🟢Gemma-2-2b-it-GGUF;
🟢ShieldGemma-2b;
🟢Shieldgemma-9b;
🟢Shieldgemma-27b;
🟠Gemma Scope для всех плотностей семейства Gemma.

✔️Gemma - это семейство легких современных открытых моделей от Google, созданных на основе тех же исследований и технологий, которые использовались при создании моделей Gemini. Это большие языковые модели, работающие только с декодером, доступные на английском языке, с открытыми весами как для предварительно обученных вариантов, так и для вариантов, настроенных по инструкции.

В этом релизе представлена версия Gemma 2 с параметрами 2.6B (базовая и instruct, версии GGUF и pytorch), как дополнение к вариантам 9B и 27B.
Gemma 2 2B имеет ту же архитектуру, что и другие модели семейства Gemma 2, и использует такие технические возможности, как sliding attention и logit soft-capping.

*️⃣Модели Gemma-2-2B можно запускать с помощью библиотеки Transformers и llama.cpp. GGUF-версии совместимы с llama.cpp, Ollama и LM Studio.

Gemma 2 2B была оценена на ряде тестов: BBH, IFEval, MATH Hard, GPQA, MuSR и MMLU-Pro. Результаты показали, что Gemma 2 2B превосходит другие модели того же размера в задачах, связанных с знаниями и инструкциями.
Кроме того, модель Gemma 2 2B может быть использована для ассистировании генерации текста, что позволит ускорить генерацию текста в 3 раза без потери качества.


✔️ ShieldGemma - это серия моделей модерации безопасного контента, построенных на основе Gemma 2, которые нацелены на несколько категорий цензурирования (включая откровенно сексуальный, опасный контент, ненависть или преследование).
Это крупные модели, работающие по принципу "текст в текст", только с декодером, доступные на английском языке, с открытыми весами и в 3 вариантах:
с параметрами 2B, 9B и 27B.
ShieldGemma предназначена для обнаружения нецензурных запросов к LLM, а также предотвращения таких же ответов от LLM. Краткая инструкция про составлению промпта.
Вы можете использовать его в качестве инструмента модерации в публичных развертываниях LLM, независимо от того, какую LLM вы развертываете.


✔️Gemma Scope - это открытый набор sparse autoencoders (SAE), обученных на каждом слое моделей Gemma 2 2B и 9B.
SAE - это новая техника, направленная на поиск интерпретируемых направлений в больших языковых моделях. Набор можно рассматривать как своеобразный "микроскоп", помогающий нам разложить внутренние активации модели на основополагающие понятия, подобно тому, как биологи используют микроскопы для изучения отдельных клеток растений и животных. Этот подход был использован при создании Golden Gate Claude, популярной исследовательской демоверсии от Anthropic, которая изучала интерпретируемость и активацию функций в Claude.

Поскольку SAE - это инструмент с выученными весами для интерпретации языковых моделей, а не сами языковые модели, их можно запустить с помощью SAELens, популярной библиотеки для обучения, анализа и интерпретации sparse autoencoders .
Чтобы узнать больше об использовании, ознакомьтесь с подробным руководством по работе с блокнотом Google Colab.


🟡Страница релиза на HF
🟡Семейство Gemma Scope на HF
🟡Gemma Scope technical report
🟡Семейство Gemma 2 2B на HF
🟡Семейство ShieldGemma на HF


@ai_machinelearning_big_data

#AI #Gemma2 #ML #LLM #GGUF
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍237🔥51
🗞 Новостной дайджест

✔️Саморазвивающийся ИИ от Baidu: конец "галлюцинирующих" языковых моделей.

Baidu представила "self-reasoning" фреймворк, направленный на повышение надежности и прослеживаемости моделей с расширенным поиском (RALM), позволяя им самостоятельно критически оценивать свои знания и процессы принятия решений. Этот инструмент поможет решить распространенную проблему "галлюцинаций" в ИИ, когда модели уверенно генерируют неверную информацию.
Структура self-reasoning состоит из трех ключевых процессов: оценка релевантности, выбор на основе доказательств и анализ траектории.
Этот метод позволяет языковой модели различать релевантную информацию, цитировать источники и анализировать свой путь рассуждений, что в конечном итоге улучшает точность и прозрачность его выводов.
venturebeat.com


✔️AES запускает первого робота для установки солнечных батарей с искусственным интеллектом.

Компания AES Corporation представила "Maximo", первого в мире робота для установки солнечных панелей, оснащенного ИИ.
Maximo автоматизирует тяжелые работы, что ускоряет сроки реализации проектов. Ожидается, что Maximo установит панелей примерно на 100 МВт солнечной энергии к 2025 году и поможет в строительстве крупных проектов, таких как 2 ГВт Bellefield в Калифорнии.
Maximo использует функции компьютерного зрения для точного размещения панелей, а также технологии непрерывного обучения для повышения своей эффективности.
prnewswire.com


✔️Perplexity запускает партнерскую программу для крупных СМИ после обвинений в плагиате.

Perplexity запустила программу "Publishers' Program", направленную на разделение рекламных доходов с партнерами после обвинений в плагиате.
В числе первых участников программы — Time, Der Spiegel и Fortune. При использовании контента этих издателей в ответах на запросы пользователей, они будут получать долю от рекламных доходов.
Запуск программы последовал за обвинениями, когда редакторы Forbes обнаружили, что их платные материалы были использованы в продуктах Perplexity без должного атрибута.
theverge.com


✔️Новые AI-инструменты Autodesk ускоряют рабочие процессы 3D в Maya и Flame.

На выставке SIGGRAPH 2024 Autodesk представила новые AI-функции для своих 3D-программ Maya и Flame.
ML Deformer для Maya позволяет художникам работать с анимацией и визуальными эффектами, обрабатывая сложные системы деформации с использованием машинного обучения.
В Flame добавлен ML Timewarp, который генерирует промежуточные кадры между двумя существующими кадрами, оптимизируя процесс редактирования и минимизируя необходимость в переносе файлов между различными инструментами.
Autodesk также анонсировала инструмент Flow Generative Scheduling, который ускоряет создание производственных графиков, учитывая переменные, такие как сроки, бюджеты и доступность команды.
creativebloq.com


✔️UrbanGPT: Пространственно-временной прогноз для проектирования городской среды.

HKU-SUSTech разработали UrbanGPT, языковую модель, предназначенную для планирования городских пространств и решения проблемы точного пространственно-временного прогнозирования в городских условиях с нехваткой данных.
UrbanGPT демонстрирует исключительную производительность при прогнозировании по нулевым снимкам, особенно в условиях разреженных данных и в задачах сложного прогнозирования.
Pre-trained модель доступна на Huggingface, код проекта опубликован на Github
weixin.qq.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2410🔥3❤‍🔥1
⚡️ Zamba2-2.7B: небольшая гибридная языковая модель на Mamba.

Zamba2-2.7B - это гибридная модель, состоящая из блоков пространства состояний (state-space) и трансформеров. Она сохраняет качество инференса модели 3-4В плотности, требуя при этом вычислительных ресурсов на уровне модели плотностью 1-2B.
Такие характеристики были получены за счет использования блоков Mamba2, чередования блоков внимания в схеме "А-В-А-В" и применения LoRA projector для каждого общего MLP-блока.

Zamba2-2.7B использует токенизатор Mistral v0.1 и была предварительно обучена на 3T токенов текста и кода, полученных из открытых источников, включая датасет Zyda.
По завершению обучения, модель была подвергнута дополнительной фазе агрессивного снижения скорости обучения на смеси из 100B высококачественных токенов.

Согласно заверению создателей, Zamba2-2.7B достигает лучших результатов среди моделей аналогичного масштаба, таких как Gemma2-2.7B, StableLM-3B, OpenELM-3B и Phi2-2.7B.

⚠️ Внимание:

🟠модель не имеет встроенной модерации и не подвергалась дополнительному цензурированию;
🟠модель не была дообучена для выполнения инструкций или выполнений функций чата, поэтому не стоит ожидать хороших результатов от нее в этих задачах;
🟠не рекомендуется использовать модель без поддержки Mamba, поскольку это приведет к значительному увеличению задержки и использования памяти.

Эксплуатация модели доступна с использованием Zyphra's fork of transformers или с помощью кода из репозитория разработчиков модели.

▶️Локальный запуск :

# Сlone and install
git clone https://github.com/Zyphra/Zamba2.git
cd Zamba2
pip install -e

# Install core mamba dependencies
pip install -U mamba-ssm causal-conv1d

# Inference
from mamba_model import MambaModel
from mamba_config import MambaConfig
import torch
from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("Zyphra/Zamba2-2.7B")
input_text = 'A funny prompt would be '
input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")["input_ids"].transpose(0,1)
model = MambaModel.from_pretrained(model_name = "Zyphra/Zamba2-2.7B").cuda().half()
tokens_to_generate = 20
model.eval()
with torch.no_grad():
for _ in range(tokens_to_generate):
out = model(input_ids)
out_last = out[:, -1]
idx = torch.argmax(out_last)[None, None]
input_ids = torch.cat((input_ids, idx), dim=0)
input_ids = input_ids.transpose(0, 1)[0]
print(repr(tokenizer.decode(input_ids.cpu().numpy().tolist())))


📌Лицензирование : Apache 2.0 license


🟡Страница проекта
🟡Arxiv
🟡Модель на HF
🖥Github [ Stars: 10 | Issues: 0 | Forks: 0]


@ai_machinelearning_big_data

#AI #ML #SLM #Mamba
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
20👍14🥰2🎉2🤔1
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 Нейросеть YandexART научилась восстанавливать архивные видеозаписи и кинохронику

Возможности нейросети были протестированы на материалах «Мосфильма» и Российского государственного архива кинофотодокументов при подготовке сериала «Игры» об Олимпиаде-80. YandexART улучшила качество изображения и восстановила некоторые утраченные детали, включая элементы одежды, архитектуры и транспортных средств.

Разработчики Яндекса научили модель не «галлюцинировать». Благодаря поэтапному обучению на материалах низкого качества, YandexART превращает размытые и сильно сжатые кадры в контент с высокой детализацией объектов и текстур.

@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥56👍213🥰3🤔3🌭2🥱1
🌟 InstantSplat: реконструкция больших 3D-сцен без Structure from Motion (SfM).

InstantSplat - подход к реконструкции 3D-сцены по исходным изображениям с помощью Multi-View Stereo (MVS) и 3D Gaussian Splatting (3D-GS).

Методика InstantSplat использует выборку из самых дальних точек (FPS) в каждом вокселе, чтобы сохранить только самые надежные гауссианы для построения точного представления сцены.
Одновременное уточнение гауссовых атрибутов и параметров камеры с помощью фотометрических потерь позволяет добиться высокого качества рендеринга и точной оценки положения камеры без использования Adaptive Density Control (ADC). Для решения проблемы overparameterization, присущей 3D-GS, InstantSplat применяет confidence-aware point downsampler.
Алгоритм оптимизации в InstantSplat позволяет исправлять ошибки, накопленные на этапе MVS, в результате чего получается относительно точная и плотная 3D-модель.

По сравнению с релевантными современными методами (Nope-NeRF и CF-3DGS), InstantSplat предлагает более высокое качество рендеринга, более высокую точность оценки положения камеры при низких значениях Absolute Trajectory Error (ATE) и Relative Pose Error (RPE), при этом требует меньшего количества обучающих просмотров.


▶️Локальный запуск с автозагрузкой модели на тестовом подготовленном датасете (около 8Gb) :

# Clone InstantSplat and download pre-trained model
git clone --recursive https://github.com/NVlabs/InstantSplat.git
cd InstantSplat
git submodule update --init --recursive
cd submodules/dust3r/
mkdir -p checkpoints/
wget https://download.europe.naverlabs.com/ComputerVision/DUSt3R/DUSt3R_ViTLarge_BaseDecoder_512_dpt.pth -P checkpoints/

# Install dependencies (modify CUDA version dep. of your system)
pip install pytorch torchvision pytorch-cuda=12.1 -c pytorch -c nvidia
pip install -r requirements.txt
pip install submodules/simple-knn
pip install submodules/diff-gaussian-rasterization

# modify the rasterizer
vim submodules/diff-gaussian-rasterization/cuda_rasterizer/auxiliary.h
'p_view.z <= 0.2f' -> 'p_view.z <= 0.001f' # line 154

# Optional but highly suggested, compile the cuda kernels for RoPE
cd submodules/dust3r/croco/models/curope/
python setup.py build_ext --inplace

# Data preparation OR download test pre-processed sample.
cd <data_path>

# InstantSplat train and output video (no GT reference, render by interpolation)
bash scripts/run_train_infer.sh

# InstantSplat train and evaluate (with GT reference)
bash scripts/run_train_eval.sh


📌Лицензирование : Apache 2.0 license


🟡Страница проекта
🟡Arxiv
🟡Tutorial Video
🟡Модель
🟡Demo на HF
🖥Github [ Stars: 228 | Issues: 1 | Forks: 8]


@ai_machinelearning_big_data

#AI #ML #3D #Gaussian
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥23👍144👏2😁1