Spark in me
2.69K subscribers
1.57K photos
83 videos
119 files
3.09K links
Lost like tears in rain. DS, ML, a bit of philosophy and math. No bs or ads.
Download Telegram
Запостить эту статью на Хабр?

1 Да – 63
👍👍👍👍👍👍👍 90%

2 Нет – 6
👍 9%

3 В личку (свое или детали) – 1
▫️ 1%

👥 70 people voted so far.
Forwarded from Boletskaya
Акар опубликовал цифры по рынку рекламы за 1 квартал: ТВ-реклама - плюс 10%. Хотя до этого крупные телеканалы мне жаловались что у них плохой первый квартал. Интернет - плюс 23%. Очень даже неплохо. А печатная пресса продолжает лететь как фанера - минус 18%. Кажется, ещё немного и от печатной прессы останется пшик.
Давно не читал рассылки про архитектуру моделей от Kaggle.

Вот то, что показалось реально интересным (не стекинг 15 моделей, а реально умные мысли или подходы):
- Предсказания в спорте - https://goo.gl/JZn5aq.
-- Про важность мотивации - https://goo.gl/4H3t2g
-- Оказывается можно использовать такие модели - https://goo.gl/s1VaaN
-- Как-то знакомый по фану давал мне доступ к своей большой базе по спортивным предсказаниям - но используя логистические регрессии я не смог найти модель с R^2 больше 1% и вообще мне показалось, что спорт это бизнес, который мало предсказуем

- Полезная копи-паста на питоне
-- Простые визуализации https://goo.gl/2yZH5J
-- Разные линейные регресии https://goo.gl/LaaXZX

- Про соревнования про листья - в топовом нейросети народ не использотвал (а странно, вероятно видеокарты нет) - https://goo.gl/FtjF70
-- Ссылка на гайд по open-cv по поиску контуров - может пригодится для гребешков кур (!) - https://goo.gl/p2hhBH
-- Архитектура через PCA и инжиниринг фич - https://goo.gl/WoIu5p
-- Тут есть копипаста по визуализации внутренних слоев нейросети (!!!) - https://goo.gl/pzPiIE
(что забавно этот код удалили из документации Keras почему-то)

#data_science
15% писем через Google Inbox (автоответы) - сочиняются нейросетями Гугла.
Nuff said.
Случайный факт - solver (поиск решения) в Excel использует метод градиентного спуска (gradient descent).
Сравнение и пояснение методов градиентного спуска от fast.ai:
- Видео - https://youtu.be/V2h3IOBDvrA?t=688
- Файл в экселе с пояснениями - https://goo.gl/XdlGbN
- Статья в блоге с подобными и более подробными пояснениями - https://goo.gl/twWZyv

#data_science
Дайджест за неделю.
Forwarded from Ivan Begtin
Instacart, онлайн сервис заказа и доставки еды на дом опубликовал датасет из 3 миллионов заказов за 2017 год . Подробнее в блоге Jeremy Stanley [1]

В наборе данных информация о времени заказа, его идентификатор и купленный продукт плюс дополнительная информация. Структуру данных можно посмотреть тут [2], а сами данные выгрузить тут [3].

В очередной раз привожу это как пример того что открытые данные публикует не только государство. Для исследовательских целей их предоставляют многие крупные интернет компании заинтересованные в том чтобы наиболее талантливые разработчики использовали их данные.

Ссылки:
[1] https://tech.instacart.com/3-million-instacart-orders-open-sourced-d40d29ead6f2
[2] https://gist.github.com/jeremystan/c3b39d947d9b88b3ccff3147dbcf6c6b
[3] https://tech.instacart.com/3-million-instacart-orders-open-sourced-d40d29ead6f2

#opendata #instacart
Forwarded from O digital
Свежие данные по Facebook из отчета за Q1 2017:

— DAUs (активных пользователей в день), март: 1,28 млрд (+18% за год)
— MAUs (активных пользователей в месяц), март: 1,94 млрд (+17% за год)
— Рост прибыли по сравнению с Q1 2016: 66%
— Доля мобильной рекламы в выручке — 85%

Отчет здесь: https://investor.fb.com/investor-news/press-release-details/2017/Facebook-Reports-First-Quarter-2017-Results/default.aspx

P.S. WhatsApp — 1,2 млрд. MAUs, Messenger — 1,2 млрд. Такие дела.
Отличные материалы, чтобы быстро ознакомиться с популярным функционалом.
Forwarded from yara
отлично, я убила все терминалы в курятник, процесс работает все равно, ура!
Forwarded from yara
Forwarded from yara
это уже из бекграунда пришло
Тут простыми словами поясняется почему нейросети тяжело тренировать, если использовать 'обычные' методы градиентного спуска (без модификаций для ускорения их тренировки)
- https://neuralnetworksanddeeplearning.com/chap5.html

А тут и тут пояснения почему другие методы работают быстрее
-- xls - https://goo.gl/XdlGbN
-- Видео - https://youtu.be/V2h3IOBDvrA?t=688
Подписчик нашел в интернете cheat-sheet'ы по основным библиотекам для работы с данными. Первый из них - про pandas.
- https://goo.gl/tgnXST

Как правило у таких библиотек не очень подробная документация с малым количеством примеров + очень много неструктурированных вопросов на stack overflow. Если для вас это новый инструмент - то это сразу боль.

Забавно увидеть знакомые ответы на такие тематики, которые приходилось "выковыривать" из документации / ответов / курсов:
- Базовое описание модели данных
- Загрузка, выгрузка, преобразования из листов и словарей
- Описательные методы сгруппированные в одном месте
- Бинарные маски, выборки данных, работа с колонками и описательными метриками для колонок
- Сводные таблицы и аналоги join-ов, union
- Работа с датами (каждый инструмент имеет свой геморрой, что немало бесит)
- Работа со строками (не сразу можно догадаться, что надо использовать .str плюс apply)

В общем, если вы хотите сделать что-то очень тупое, но не знаете как, то сначала заходите в pdf, потом в документацию, потом на Stack Overflow =)

#data_science
Добавил на сайт RSS
- прямая ссылка - https://spark-in.me/main.rss
- как найти на самом сайте https://prntscr.com/f5x40t