Banger report from Microsoft.
They introduce a 4B coding agent trained on roughly 1,500 software engineering environments.
📘 Paper
@datascienceiot
They introduce a 4B coding agent trained on roughly 1,500 software engineering environments.
📘 Paper
@datascienceiot
📘 Hidden Markov Models (HMM)
Короткий материал от Stanford по одной из классических моделей машинного обучения для работы с последовательностями.
Внутри разбираются:
- состояния и наблюдения
- transition и emission probabilities
- вычисление вероятности последовательности
- декодирование скрытых состояний
- обучение параметров HMM
- применение к последовательным данным
Хороший компактный материал, если нужно быстро разобраться, как работают скрытые марковские модели без чтения огромного учебника.
https://web.stanford.edu/~jurafsky/slp3/A.pdf
Короткий материал от Stanford по одной из классических моделей машинного обучения для работы с последовательностями.
Внутри разбираются:
- состояния и наблюдения
- transition и emission probabilities
- вычисление вероятности последовательности
- декодирование скрытых состояний
- обучение параметров HMM
- применение к последовательным данным
Хороший компактный материал, если нужно быстро разобраться, как работают скрытые марковские модели без чтения огромного учебника.
https://web.stanford.edu/~jurafsky/slp3/A.pdf
Не отставайте от рынка — учитесь со скидкой 16%
Если чувствуете, что стоите на месте, и хотите освоить востребованную профессию, — сейчас хороший момент начать.
Потому что до 30 сентября на все курсы Практикума действует скидка 16%.
Выбрать курс
Вы сможете:
— получить актуальные навыки;
— освоить ИИ-инструменты для работы;
— перенять опыт экспертов, которые двигают индустрию;
— попасть в сообщество выпускников, где можно попросить совета и, возможно, найти будущих коллег.
Просто выберите курс, начните учиться бесплатно и получите скидку 16% — она автоматически появится в личном кабинете.
Учиться!
Erid: 2SDnjezu8Km
Название: ООО "ЯНДЕКС"
ИНН: 7736207543
Если чувствуете, что стоите на месте, и хотите освоить востребованную профессию, — сейчас хороший момент начать.
Потому что до 30 сентября на все курсы Практикума действует скидка 16%.
Выбрать курс
Вы сможете:
— получить актуальные навыки;
— освоить ИИ-инструменты для работы;
— перенять опыт экспертов, которые двигают индустрию;
— попасть в сообщество выпускников, где можно попросить совета и, возможно, найти будущих коллег.
Просто выберите курс, начните учиться бесплатно и получите скидку 16% — она автоматически появится в личном кабинете.
Учиться!
Erid: 2SDnjezu8Km
Название: ООО "ЯНДЕКС"
ИНН: 7736207543
🔥 DataLens Platform: что происходит, когда data stack собирают в одну систему
Yandex B2B Tech представила платформу, которая объединяет хранение, обработку, визуализацию и ИИ-аналитику данных.
Вместо связки из нескольких инструментов данные можно обрабатывать и анализировать в единой среде. Встроенный ИИ-помощник принимает запросы на обычном языке и помогает получать показатели без ручной сборки отчётов.
Отдельно интересна архитектура: storage и compute масштабируются независимо. Растет объем данных — увеличивается хранилище; растёт нагрузка на расчёты — добавляются вычислительные мощности.
По оценке Yandex B2B Tech, такой подход может сократить затраты на аналитику до 30%, а подготовку отчетов и дашбордов — ускорить в 3–5 раз.
📎 Подробнее о платформе — в материале СМИ.
Yandex B2B Tech представила платформу, которая объединяет хранение, обработку, визуализацию и ИИ-аналитику данных.
Вместо связки из нескольких инструментов данные можно обрабатывать и анализировать в единой среде. Встроенный ИИ-помощник принимает запросы на обычном языке и помогает получать показатели без ручной сборки отчётов.
Отдельно интересна архитектура: storage и compute масштабируются независимо. Растет объем данных — увеличивается хранилище; растёт нагрузка на расчёты — добавляются вычислительные мощности.
По оценке Yandex B2B Tech, такой подход может сократить затраты на аналитику до 30%, а подготовку отчетов и дашбордов — ускорить в 3–5 раз.
📎 Подробнее о платформе — в материале СМИ.
Physics-based Deep Learning: Combining Deep Learning with Physical Simulations
📘 Paper
@datascienceiot
📘 Paper
@datascienceiot
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.
Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.
Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.
В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.
Успей зарегистрироваться и пройти отборочный этап до 27 сентября
Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.
Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.
В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.
Успей зарегистрироваться и пройти отборочный этап до 27 сентября
Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀
🔸 Булат Шарипов расскажет, как в Авито обучают собственные языковые модели с помощью RL, а Владислав Воробьев — как BidCorrection меняет состав трафика, не трогая сами объявления.
🔸 Всеволод Викулин расскажет, как реально автоматизировать процессы с помощью AI-агентов, — этим и многим другим он поделится на Avito DS Meetup 7 октября.
После докладов будет нетворкинг с DS-сообществом. А ещё, если придёте офлайн, сможете найти прикольные тематические пасхалки, которые мы для вас спрятали👀
⚡️ Встречаемся в 18:30 7 октября.
Места в офлайне ограничены — регистрация обязательна.
➡️ Регистрируйтесь по ссылке и приходите!
После докладов будет нетворкинг с DS-сообществом. А ещё, если придёте офлайн, сможете найти прикольные тематические пасхалки, которые мы для вас спрятали
Места в офлайне ограничены — регистрация обязательна.
Please open Telegram to view this post
VIEW IN TELEGRAM
New Stanford+Together AI paper shows teams that learn to check each other's work solve problems none of them got right alone.
📘 Paper
@datascienceiot
📘 Paper
@datascienceiot
ML-проект не заканчивается на обучении модели
В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.
Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.
Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.
При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.
Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
В Data Science есть довольно знакомый момент: сначала всё работает почти идеально. Есть датасет, ноутбук, модель и несколько экспериментов. Но когда модель нужно использовать регулярно, внезапно выясняется, что сам алгоритм — только часть задачи.
Данные нужно где-то хранить, регулярно обновлять и обрабатывать. Пайплайны — запускать по расписанию. Результаты — отдавать в аналитические системы. А ещё нужно не потерять воспроизводимость всего процесса, когда экспериментов становится больше. По сути, вокруг модели постепенно появляется полноценная data-платформа.
Один из вариантов собрать такой контур внутри корпоративной инфраструктуры — использовать PaaS-компоненты Yandex Cloud в Stackland. В обновлении платформы появились ClickHouse и PostgreSQL для работы с данными, Object Storage и Trino для аналитического слоя, Airflow для оркестрации и DataLens для визуализации.
При таком подходе ML-процесс выглядит уже не как «модель + ноутбук», а как последовательный конвейер: данные поступают в хранилище, проходят обработку, используются для подготовки признаков и обучения, а результаты возвращаются в аналитический контур.
Таким образом, появляется одна из главных точек перехода от экспериментов к production: сложность постепенно смещается с самой модели на инфраструктуру, которая должна обеспечивать её работу.
"PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research"
📓 Read
@datascienceiot
📓 Read
@datascienceiot
5 октября начнется 19-й поток программы Data Engineer от Newprolab
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Shockingly Simple Self-retrospection Improves Agentic Models Without RL
"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."
📓 Read
@datascienceiot
"Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone."
📓 Read
@datascienceiot
📚 Классика, которую стоит прочитать: бесплатная книга Давида Кризеля о нейросетях
Если хочется разобраться, как нейросети устроены на уровне основ, а не только вызывать API, есть отличный бесплатный материал: A Brief Introduction to Neural Networks Давида Кризеля. Книга выросла из семинара в Боннском университете, первая версия вышла ещё в 2005 году, и с тех пор её дорабатывали.
Книга разделена на три большие части. Первая ведёт от биологии к формализации: биологический нейрон, компоненты искусственных сетей и основы обучения. Вторая посвящена обучению с учителем: перцептроны, backpropagation, RBF-сети и рекуррентные сети. Третья про обучение без учителя: сети Хопфилда, самоорганизующиеся карты Кохонена и теорию адаптивного резонанса.
Отдельно есть экскурсы в кластеризацию, предсказание временных рядов и обучение с подкреплением.
Главное достоинство книги в подаче. Каждое понятие объясняется сначала простыми словами, а потом строго математически, поэтому её одинаково удобно читать и новичку, и тому, кто хочет формул. Иллюстрации автор рисовал сам, в конце глав есть упражнения, а примеры связаны с его Java-библиотекой SNIPE.
Про трансформеры и LLM здесь ничего нет. Зато это хороший фундамент, без которого современные архитектуры понимаются хуже. Распространяется бесплатно по лицензии Creative Commons.
https://dkriesel.com/_media/science/neuronalenetze-en-zeta2-2col-dkrieselcom.pdf
Если хочется разобраться, как нейросети устроены на уровне основ, а не только вызывать API, есть отличный бесплатный материал: A Brief Introduction to Neural Networks Давида Кризеля. Книга выросла из семинара в Боннском университете, первая версия вышла ещё в 2005 году, и с тех пор её дорабатывали.
Книга разделена на три большие части. Первая ведёт от биологии к формализации: биологический нейрон, компоненты искусственных сетей и основы обучения. Вторая посвящена обучению с учителем: перцептроны, backpropagation, RBF-сети и рекуррентные сети. Третья про обучение без учителя: сети Хопфилда, самоорганизующиеся карты Кохонена и теорию адаптивного резонанса.
Отдельно есть экскурсы в кластеризацию, предсказание временных рядов и обучение с подкреплением.
Главное достоинство книги в подаче. Каждое понятие объясняется сначала простыми словами, а потом строго математически, поэтому её одинаково удобно читать и новичку, и тому, кто хочет формул. Иллюстрации автор рисовал сам, в конце глав есть упражнения, а примеры связаны с его Java-библиотекой SNIPE.
Про трансформеры и LLM здесь ничего нет. Зато это хороший фундамент, без которого современные архитектуры понимаются хуже. Распространяется бесплатно по лицензии Creative Commons.
https://dkriesel.com/_media/science/neuronalenetze-en-zeta2-2col-dkrieselcom.pdf
Стать специалистом по Data Science всего за 10 недель — это реально!
Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.
Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.
И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.
Что вас ждёт:
➖ необходимые для старта навыки: Python, ML, статистика, работа с данными и AI-инструментами;
➖ практика на реальных задачах и проектах;
➖ понятный ежедневный план обучения и поддержка менторов;
➖ еженедельные живые занятия, а не старые записи;
➖ подготовка к собеседованиям уже с первых недель — групповые интервью, разбор вопросов и подготовка резюме.
А что после 10 недель? Буткемп — это только первый этап.
После него можно продолжить углублять экспертизу и двигаться к уровню middle:
➖ продвинутый Python;
➖ Git;
➖ продвинутая статистика и A/B-тестирование;
➖ Airflow;
➖ MLOps и развёртывание ML-моделей.
Кому подойдёт:
Тем, кто хочет войти в Data Science системно и не тратить год на самостоятельный поиск правильного маршрута.
Тем, кто начинал учиться самостоятельно, но терял темп без структуры и дедлайнов.
Тем, кто хочет не просто изучать теорию, а как можно раньше начать готовиться к выходу на рынок.
Тем, кому важно учиться на практике и получать обратную связь от менторов.
🔥 ВАЖНО: Симулейтив сейчас дают возможность получить грант на обучение и гарантию трудоустройства своих студентов! Количество грантов, ограничено!
Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!
🔗 ЗАБРОНИРОВАТЬ МЕСТО
Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.
Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.
И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.
Что вас ждёт:
А что после 10 недель? Буткемп — это только первый этап.
После него можно продолжить углублять экспертизу и двигаться к уровню middle:
Кому подойдёт:
Тем, кто хочет войти в Data Science системно и не тратить год на самостоятельный поиск правильного маршрута.
Тем, кто начинал учиться самостоятельно, но терял темп без структуры и дедлайнов.
Тем, кто хочет не просто изучать теорию, а как можно раньше начать готовиться к выходу на рынок.
Тем, кому важно учиться на практике и получать обратную связь от менторов.
Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!
🔗 ЗАБРОНИРОВАТЬ МЕСТО
Please open Telegram to view this post
VIEW IN TELEGRAM
AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems
📓 Read
@datascienceiot
📓 Read
@datascienceiot
📚 Обновили огромный учебник по математике для Computer Science и Machine Learning - 2220 страниц.
Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.
Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/
@datascienceiot
Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.
Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/
@datascienceiot