О разделе
Длинные листинги (от ~15 строк) вынесены в каталог code.spirzen.ru и подгружаются в статьях через ExternalCodeEmbed — так HTML энциклопедии не раздувается, а код остаётся с подсветкой, вкладками и сериями "шаг 1…N". Короткие фрагменты (одна формула DAX, пара строк pandas, SQL до staging) по-прежнему прямо в markdown. Диаграммы mermaid и интерактив — на месте или в play.spirzen.ru.
Раздел выстроен от общей картины к инструментам и прикладным сценариям. Если вы ещё не уверенно работаете с ПК, файлами и браузером — сначала Основы компьютерной грамотности.
Рекомендуемый порядок для первого прохода:
- Старт из Excel — Работа с Microsoft Excel — основы → Excel и Google Sheets — формулы — формулы с разбором → Разведочный анализ данных в Excel — EDA в Excel → Основы статистики — статистика → Маршрут Excel → R → Python — маршрут Excel → R → Python → ветка Python для анализа данных — Python или 5-23-r/103 — R.
- Анализ данных — OLTP/OLAP, семантика, DAX, жизненный цикл аналитики.
- Data Science — роли, стек и подготовка данных для ML (нормализация, split, аугментация); до Pandas — Python — файлы и CSV (stdlib); NumPy — массивы и матрицы; типовые операции Pandas; примеры pandas с разбором; практикум — Pandas Data Viewer (Tkinter + pandas — загрузка CSV/Excel, поиск, статистика); текст как признаки — TF-IDF; практикум — распознавание цифр на PyTorch (MNIST, CNN, GUI-инференс); практикум — тональность отзывов на PyTorch; SQL — реальные кейсы (groupby, join, суммы — тот же смысл, что в SQL); напоминалка Pandas / Polars / SQL / PySpark / Excel; очистка в Pandas.
- Пакетная работа с данными — теория batch, bulk, chunk, транзакции, идемпотентность, разбиение тяжёлых операций (хаб перед ETL и потоком).
- Big Data (в т. ч. Data Warehouse, Data Lake и Data Mesh), ETL/ELT, потоковая аналитика — масштаб, конвейеры, события в реальном времени.
- Дата-майнинг, причинно-следственный анализ, ошибки интерпретации — закономерности, корреляция и критическое мышление.
- Python для анализа (очистка таблиц — Очистка и подготовка данных в Pandas), ИИ в аналитике (промпты — библиотека), Power BI — практика и self-service. Числовые массивы — NumPy — массивы и матрицы — NumPy; текст отчёта с формулами — LaTeX — формулы для отчётов; символьная математика (уравнения, производные) — SymPy — уравнения и производные; графики из Python — Matplotlib — графики.
Углубление по тому же маршруту — Вероятность для аналитика данных — вероятность, Линейная регрессия — Excel, R и Python — регрессия в Excel, R и Python.
Прикладные кейсы: технологии в спорте, умный дом (IoT и телеметрия). Итоги — в Анализ данных — итоги, самопроверка — в Анализ данных — чек-лист.
Анализ данных
Основы анализа данных - сбор, очистка, визуализация, статистические методы, интерпретация результатов и инструменты для бизнес-аналитики.
Big Data
Big Data — это относительное состояние, при котором объём данных превышает возможности традиционных систем хранения и обработки с точки зрения производительности, стоимости или масштабируемости.
Data Science
Data Science - междисциплинарный подход к извлечению знаний из данных через статистику, моделирование и предметную экспертизу.
Дата майнинг
Методы извлечения знаний из больших массивов информации, полный цикл KDD от постановки задачи до интерпретации выявленных закономерностей.
Ошибки интерпретации и манипуляции статистикой
Принципы критического мышления при анализе данных, выявление ошибок интерпретации статистики и защита от манипуляций численными показателями.
Умный дом
Архитектура систем умного дома, принципы интеграции инженерных и бытовых устройств, автоматизация сценариев и управление жилым пространством.
Технологии в спорте
Применение информационных технологий в спорте для мониторинга физической активности, анализа тренировочных нагрузок и контроля состояния спортсменов.
Основы статистики
Базовые статистические показатели, методы работы с распределениями данных и принципы интерпретации результатов для аналитических задач.
Как использовать ИИ для анализа данных
ИИ в анализе данных - автоматизация поиска закономерностей и поддержка решений с помощью машинного обучения и нейросетевых моделей.
Причинно-следственный анализ
Методы выявления причинно следственных связей в данных, построение выводов на основе измеримых результатов и условий проведения экспериментов.
Потоковая аналитика в реальном времени
Архитектура потоковой аналитики, методы обработки событий в реальном времени и извлечения полезных сигналов без долгосрочного хранения сырых данных.
Python для анализа данных
Применение языка Python для анализа данных, использование описательной статистики, библиотек визуализации и методов обобщения наборов информации.
Первые шаги в анализе табличных данных в Jupiter Notebook
Практический анализ - создание файлов Jupiter, работа в VS Code и обработка базовых данных.
ETL-ELT и оркестрация
Архитектура конвейеров данных ETL и ELT, принципы оркестрации задач загрузки и трансформации информации в распределённых аналитических системах.
Табличные данные — Pandas, Polars, SQL и PySpark
Сравнительный анализ инструментов обработки табличных данных Pandas, Polars, SQL и PySpark с разбором типовых операций фильтрации и объединения.
Очистка и подготовка данных в Pandas
Методы очистки и подготовки табличных данных в Pandas, обработка пропусков, дубликатов, фильтрация и объединение таблиц перед статистическим анализом.
Pandas — типовые операции при анализе данных
Основные операции библиотеки pandas для работы с табличными данными, фильтрации, группировки, статистического анализа и очистки данных.
Разведочный анализ данных в Excel
Методы exploratory data analysis в Excel, работа с наблюдениями, переменными, сводными таблицами и визуализацией перед переходом к языкам программирования.
Power BI и self-service аналитика
Возможности платформы Microsoft Power BI для создания интерактивных дашбордов, подключения источников данных и публикации отчётов для бизнес пользователей.
Маршрут Excel → R → Python
Как перенести аналитику из электронных таблиц в R и Python — стек инструментов, этапы маршрута и ссылки на материалы энциклопедии.
Вероятность для аналитика данных
Выборочное пространство, дискретные и непрерывные распределения, симуляции в Excel и связь с проверкой гипотез.
Линейная регрессия — Excel, R и Python
Корреляция, линия тренда и линейная модель в электронных таблицах, R (lm) и Python (statsmodels / sklearn) на одном примере.
Пакетная работа с данными
Теория и практика пакетной обработки данных, массовые операции с базами данных, транзакционная целостность, идемпотентность и архитектура ETL процессов.
Анализ данных — итоги
Итоги раздела анализа данных - ключевые методы, инструменты визуализации, статистические модели, типичные ошибки и пути углубления знаний.
Анализ данных — чек-лист
Чек-лист по анализу данных - этапы обработки, выбор метрик, работа с pandas, визуализация, проверка гипотез и подготовка отчётов.
Анализ данных — о разделе
Обзор раздела анализа данных - методы обработки, визуализация, статистика, инструменты Python и R, практика работы с реальными наборами данных.
В подборках
Статья входит в тематические подборки и блок "С чего начать?" на главной. Соседние шаги того же маршрута:
Аналитика данных — Продвинутые операции с данными — о разделе, Python — о разделе, NoSQL — о разделе, R — о разделе, SQL — о разделе, Основы баз данных — о разделе.