Рациональные числа
25.7K subscribers
7.31K photos
263 videos
233 files
3.58K links
Понимание мира через данные

Статистика и данные из разных областей. Минимум оценок и интерпретаций, максимум данных и фактов

Чат: @rationalchat

https://rationalnumbers.ru

По рекламе: @kgreenmedia
В реестре: vk.cc/cKf8WS

Автор: @kirillgreen
Download Telegram
Какую долю верхних строк занимают продолжения в кино, на ТВ, в музыке, книгах и играх (Experimental History)

До 2000 года продолжениями, ремейками и спиноффами были около четверти самых кассовых фильмов. С 2010 года — больше половины каждый год, в последние годы доля подходит к 100%. Это первая картинка: по горизонтали годы с 1977-го, по вертикали доля таких фильмов в кассовой двадцатке

Вторая картинка про то же кино с другой стороны: какую долю всех сборов забирает верхняя двадцатка. С конца 1980-х по середину 2000-х держалось около 35–40%, дальше пошёл рост, и в 2021 году вышло около 65%

Телевидение на третьей картинке — с 1950 года. Доля спиноффов и повторных показов одного шоу в тридцатке самых смотримых выросла с нуля до трети

В музыке две картинки. На четвёртой — сколько разных исполнителей попадает в Hot 100 за год: на рубеже шестидесятых и семидесятых их бывало около 460, в 2010-е — примерно 260–310. На пятой то же самое с другого конца: сколько песен в среднем приходится на одного попавшего в чарт исполнителя. Величина падала до конца девяностых, до примерно 1,25, а потом развернулась и к концу 2010-х дошла до 2,6

Книги — на двух следующих картинках. Авторов, у которых в топ-10 за год стоит сразу несколько книг, до середины 1970-х почти не было — теперь их доля около трети. А доля книг, написанных автором, который уже попадал в топ-10 за последние десять лет, выросла примерно с половины в тридцатые до 70% сейчас

Игры на последней картинке — самая концентрированная индустрия из пяти. В 1995 году частями франшиз были около 65% топ-20, с середины 2000-х — стабильно около 90%

Автор считает причиной не сговор студий, а изобилие: чем больше выбор, тем охотнее человек берёт знакомое. Проверить это по одним только долям нельзя — данные показывают концентрацию, но не её причину

Ещё мы писали про индустрию развлечений:
Доля оригинальных фильмов в десятке самых кассовых в мире, 1990–2024
Эволюция параметров музыки, 1920–2010
Кассовые сборы в кинотеатрах и выручки игровых компаний в США, 2013–2023
8😢6👍2👎1
Уже в понедельник начинается лаба, где я буду вести одну из недель в качестве спикера. Ещё не поздно присоединиться. Приходите!
🔥5
Forwarded from AI Mindset
This media is not supported in your browser
VIEW IN TELEGRAM
〰️ поток агента
или отказ от идеи продуктивности

мы собрали летнюю лабу по-другому. s26 summer flow стартует в ПН. до старта мы сделали то, чего не делали ни в одной лабе раньше.

открыли публичный репозиторий лабы → github.com/ai-mindset-org/s26-lab

внутри программа (уже или будет пополняться каждым спикером), принципы работы и отдыха, гайд по сборке личного контекста, глоссарий, скиллы и схемы с html-исходниками.

что показано на сайте лабы, то лежит в репозитории открыто. забирайте, форкайте, приносите своё.

четыре открытых эфира прошли, каждый оставил там артефакт. даша воронкина – flow compass, плагин собран вживую при зрителях. александр васильев – гайд по личному контексту. кирилл олейниченко – одиннадцать файлов личной конституции. серёжа рис – недельный цикл планирования и ретро с агентом. запись всех эфиров на youtube

дальше 40 с лишним часов живых занятий и личное кураторство. три недели, 10–31 августа. девять человек ведут, два субботние хакатона по четыре часа, demo day 31-го.

хакатоны, кстати, будут открытые и бесплатные. приходите все. собирать harness с пустого места, без контекст и с 1й заданной моделью.

мы на AI Mindset исследуем, как подавать образование взрослым, у которых нет времени на курс ради курса. открытый репозиторий, эфир с артефактом в кадре и живая сборка при зрителях – часть этого эксперимента.

до встречи в понедельник → https://s26.aimindset.org

🤖 alex p
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1
Из чего состоит дневное питьё американцев разного возраста (USAFacts)

На первой картинке — состав выпитого за день по объёму, стаканами показаны три возрастные группы. У детей до 12 лет треть объёма приходится на молоко (32%), у подростков молока уже 13%, у взрослых — 6%. Место молока занимает вода: у взрослых 29% из-под крана и ещё 19% бутылированной

У взрослых в стакане появляются кофе (13%) и алкоголь (7%), которых у младших групп нет. Газировка держится у всех примерно на одном уровне — 8% у детей, 17% у подростков, 13% у взрослых

Вторая и третья картинки сравнивают 2005–2006 годы с 2017–2020: слева старое значение, справа новое, линиями показаны отдельные напитки в граммах на человека в день. У детей вниз идёт молоко, вверх — бутылированная вода. У подростков газировка падает почти втрое и пропускает вперёд обе линии воды

В цифрах за эти пятнадцать лет: бутылированной воды стали пить на 56% больше, молока — примерно вдвое меньше во всех возрастах, газировки у подростков — на 60% меньше. У взрослых кофе остался на месте, около 1,3 чашки в день

Внутри алкоголя перестановка сильнее, чем в целом по нему: коктейли выросли на 375%, вино — на 16%, а пиво и крепкое упали на 18% и 23%

Данные собраны опросами о питании CDC, то есть это то, что люди сами вспомнили и назвали, а не замеренное потребление

Ещё мы писали про напитки:
Потребление алкоголя в России, 2023
Сколько стоит кофе из Старбакса в странах мира, 2023
Справочник цен на напитки и мороженое в Москве, 1938
👍115
Коэффициент рождаемости и реальное число детей у женщин, Швеция, 1891–2024 (Our World in Data)

Синяя линия — привычный коэффициент рождаемости, тот самый, про который пишут «рождаемость упала». Красная — сколько детей женщины в среднем родили на самом деле, когда их детородный возраст закончился. Красная сдвинута на 30 лет вперёд, чтобы совпасть с возрастом матери

Разница видна сразу. Синяя мечется: 4,1 ребёнка в 1891 году, около 1,5 в середине 1930-х, всплеск до 2,6 в сороковые, подъём к 2,1 в начале девяностых, 1,4 в 2024-м. Красная почти стоит на месте — весь век между 1,8 и 2,1

Причина проста. Коэффициент рождаемости — не число детей, а снимок одного года: берут, сколько детей рожают в этом году женщины каждого возраста, и складывают

Отсюда и подвох. Допустим, поколение решило рожать не в 25, а в 30 — детей столько же, просто позже. Пять лет подряд молодые не рожают, снимок показывает обвал. Потом они рожают, и снимок показывает всплеск. Ни того, ни другого на самом деле не было

Поэтому по годовому коэффициенту нельзя судить, сколько детей будет у поколения. Это разные величины, и первая ошибается каждый раз, когда меняется возраст материнства

Ещё мы писали про демографию:
Беби-бум в семи графиках
Факторы низкой рождаемости в России
Как менялась ожидаемая продолжительность жизни в мире и на континентах, 1900–2021
🔥232💩2🤡2❤‍🔥1👎1👌1
Как менялась тональность заголовков новостей, 2000–2019 (PLOS ONE)

Средняя тональность заголовка за двадцать лет перешла из плюса в минус: с +0,08 в 2000 году до −0,16 в 2019-м. На первой картинке по вертикали отложена оценка от отрицательной к положительной, светлой полосой показан разброс между изданиями

Выборка — 23 миллиона заголовков из 47 популярных в США изданий, от Fox News и Breitbart до The New York Times и Vox. Тональность размечали языковой моделью

На второй картинке те же заголовки разложены по политическому крену изданий: синим левые, зелёным центристские, красным правые. Правые весь период отрицательнее остальных, центристские — положительнее, но снижаются все три линии сразу, а левые и правые движутся почти синхронно: коэффициент корреляции между ними 0,82. То есть в минус уехала вся выборка, а не один лагерь

На третьей картинке — доля заголовков с конкретной эмоцией. Страх вырос с 5,7% до 14,3%, злость — с 5,9% до 12,0%, печаль — с 7,7% до 11,9%. Доля нейтральных заголовков упала с 68,5% до 48%. Радость вела себя иначе: росла до пика в 2013 году, потом снижалась

Стоит помнить, что модель для тональности угадывает разметку человека в 75% случаев, а для эмоций — только в 39%. Поэтому общему развороту в минус верить можно, а точным долям отдельных эмоций — с оговоркой

Отдельно любопытно, как авторы подписали главный график: «изменение −314%». Так считать нельзя — средняя тональность по дороге прошла через ноль, и относительное изменение здесь величина без смысла. Абсолютные значения на осях говорят ровно то же самое и честнее

Ещё мы писали про медиа:
Как менялась степень доверия к СМИ в США, 1972–2023
150 лет развития газеты The New York Times за 55 секунд
Тиражи ежедневных газет и число сотрудников газетных издательств в США
1👍197🔥2👎1
Самая частая причина смерти в каждом возрасте, США (FlowingData)

По горизонтали годы — с конца 1960-х по начало 2020-х, — по вертикали возраст от 0 до 85 лет. Цвет показывает, какая причина смерти в этом возрасте и в этом году была самой частой, а насыщенность — какую долю всех смертей она собрала: бледный оттенок это около 30%, самый плотный — больше 50%

Причин на карте четыре:
— зелёная полоска у самого низа — перинатальные состояния, риск высок при рождении и до него
— жёлтое поле молодых возрастов — внешние причины: когда умирает молодой человек, причина обычно внешняя, а не болезнь
— розовый верх — болезни системы кровообращения, то есть сердца, артерий и крови
— голубая область — злокачественные новообразования

Главное на карте — как голубое вытесняет розовое. В начале наблюдения болезни кровообращения были самой частой причиной начиная с середины четвёртого десятка жизни. К началу 2000-х рак стал ведущей причиной примерно с 45 до 75 лет, а кровообращение осталось ведущим только у тех, кто старше

Стоит помнить, что карта отвечает на вопрос «какая причина самая частая», а не «сколько людей умирает». Голубое поле выросло не потому, что рака стало больше, а потому, что от болезней сердца стали умирать позже. Уровни смертности по такой карте не читаются вовсе

Отдельно отмечена вертикаль 1979 года — там сменилась международная классификация болезней, и часть переходов на карте у этой линии объясняется бухгалтерией, а не медициной

Источник данных — CDC WONDER

Ещё мы писали про смертность:
Как менялась ожидаемая продолжительность жизни в мире и на континентах, 1900–2021
Как войны и образ жизни влияют на смертность
Выраженность проблемы ВИЧ в регионах России, 2014–2023
👍13🔥7👎2
Сколько текста пользовательских соглашений человек принимает за десять лет (Henry)

Автор десять лет, с 21 апреля 2016 года по 21 апреля 2026-го, записывал каждое пользовательское соглашение, которое принимал на компьютере и телефоне. Набралось 821 соглашение и 3 066 332 слова — в среднем 839,63 слова в день

Если читать их со скоростью 238 слов в минуту, как в исследованиях скорости чтения, уйдёт 214,73 часа. Это 8,95 суток непрерывного чтения без сна, или 3,53 минуты каждый день десять лет подряд

Самые длинные документы:
— условия Apple Developer — 57 293 слова
— лицензия Apple Developer Program — 54 710
— условия сервисов AWS — 41 303

Читаются они тяжелее обычного текста, и это измеримо: в среднем 1,74 слога на слово против 1,62 у конституции Австралии и 1,38 у «Великого Гэтсби». Самые частые слова — information (1,95% всех словоупотреблений), services (1,48%) и terms (0,98%)

Три оговорки, без которых цифры выглядят точнее, чем они есть. Это опыт одного человека, а не выборка. Не учитывались баннеры о cookie, обновления уже записанных соглашений и документы, на которые соглашения ссылаются, — то есть настоящий объём больше. И скорость 238 слов в минуту взята для обычной прозы: юридический текст читают заметно медленнее, если читают

Любопытно, что величина сошлась с оценкой, которую мы приводили шесть лет назад: тогда среднему американцу насчитывали около 250 часов на все соглашения его сервисов. Здесь — 214,73 часа, но не расчётом, а по десятилетнему журналу

Ещё мы писали про пользовательские соглашения:
Сколько времени займёт чтение пользовательских соглашений IT-гигантов
Крупнейшие штрафы, выписанные компаниям за нарушение GDPR
12😁9🔥8🤯3👎1🌚1
Сколько лет нобелевским лауреатам по науке, 1901–2025 (Nobel Prize)

Медианный возраст лауреата научных премий — по физике, химии, медицине и экономике — вырос с 49 лет в первой четверти XX века до 69 в первой четверти XXI. Премию мира и литературу мы не считали: там награждают не за проверяемый результат, и возраст лауреата меряет другое

Росло неравномерно: за первые 75 лет медиана прибавила пять лет, за последние полвека — четырнадцать. Сильнее всего постарела физика: 46 лет до 1950 года, 72 — после 2001-го. Уильям Лоренс Брэгг получил премию по физике в 25 лет, Поль Дирак — в 31, Фредерик Бантинг — в 32, по медицине, за открытие инсулина. С 2016 по 2025 год из 102 научных награждений моложе пятидесяти были всего три

В чём причина? Премию не вручают посмертно и не вручают за неподтверждённый результат — а подтверждение фундаментальной теории стало занимать десятилетия, и это время целиком уходит в возраст лауреата. Питер Хиггс описал механизм возникновения массы элементарных частиц в 1964 году, бозон нашли на Большом адронном коллайдере в 2012-м, премию вручили в 2013-м — автору было 84 года. Сюкуро Манабэ получил премию в 90 лет за климатические модели, построенные в шестидесятых. Джон Гуденаф — в 97, за литий-ионный аккумулятор, успевший к церемонии лечь в каждый карман

Ещё мы писали про возраст и признание:
Обладатели Нобелевской премии по стране происхождения и научной деятельности, 1900–2024
Средний календарный и проспективный возраст членов Конгресса США, 1933–2023
Подтверждённое число доживших до 110 лет мужчин и женщин по году рождения, 1890–1915
👍242👎2😱1🤡1
Где в человеческом мозге лежат нейроны (Herculano-Houzel, Frontiers in Human Neuroscience)

Кора больших полушарий — это больше 80% массы мозга, но только 19% его нейронов. Четыре нейрона из пяти лежат в мозжечке: при массе 154 грамма против 1233 у коры он вмещает 69 миллиардов нейронов против 16 у неё

Расхождение объясняется размером клеток. Нейрон коры вместе со своими отростками занимает в десятки раз больше места: на миллиард нейронов кора расходует около 77 граммов вещества, мозжечок — около двух

Примечательно, что скромная доля коры — не человеческая особенность: у других млекопитающих она примерно такая же, а примату с мозгом в полтора килограмма кора нашего размера даже положена по расчёту. Особенность в правилах упаковки, общих для всех приматов. У грызунов с числом нейронов растут и сами нейроны, поэтому каждый следующий миллиард обходится всё дороже по объёму; у приматов средний размер нейрона от роста мозга не зависит. Мозг грызуна, увеличенный до человеческих полутора килограммов, вместил бы 12 миллиардов нейронов — вместо наших 86

То есть человеческий мозг не особая конструкция, а самый большой из собранных по экономным приматским правилам

Сами числа получены прямым подсчётом — изотропной фракционацией: мозг растворяют до взвеси клеточных ядер и считают ядра, вместо того чтобы экстраполировать плотность нескольких срезов на весь орган. Этот же подсчёт закрыл ещё одно привычное число: глиальных клеток не в десять раз больше, чем нейронов, — их примерно поровну, 85 миллиардов против 86

Ещё мы писали про мозг и большие числа:
Мозг — самый энергозатратный орган
Человеческий мозг плохо воспринимает разницу между миллионом, миллиардом и триллионом
Как видеоигры могут влиять на мозг пожилых людей
👍197👎2
Какая доля детей не доживала до пяти лет, 1751–2024 (Our World in Data)

В 1800 году до пяти лет не доживали 42,8% новорождённых мира, в 1900-м — 40,9%, в 2024-м — 3,74%. Почти всё снижение уложилось в последние сто двадцать лет

Это оценка, а не перепись: до середины двадцатого века ряд восстановлен Gapminder по историческим источникам, современную часть считает межагентская группа ООН. Чем глубже в прошлое, тем шире неопределённость

Ещё мы писали про то, как менялась жизнь:
Возраст смерти и детская смертность
Как изменился человек за последние 150 лет
Оценка примерного числа жертв крупнейших пандемий в истории человечества
8👍5👎1
Статистика по буквам русского языка (настенька и графики)

К сожалению, в источнике для первой диаграммы буква «ё» подпадала под «е». Наша редакция питает очень тёплые чувства к этой букве, поэтому советуем посмотреть инфографику ТАСС про «ё»

Также хотим напомнить про проект Нади Адриановой и Владимира Терентьева, в котором они анализировали частотность букв в разных частях слов, длину слов и двухбуквенные сочетания

Другие наши публикации с лингвистическими данными:
Соотношение скорости и информативности речи в языках мира
Самые распространённые языки в мире и в интернете, 2023/2024
Число носителей крупных языков мира, 2023
Первый и второй по популярности язык для изучения в Дуолинго в странах мира, 2022
10👍4🔥3❤‍🔥1🤡1