Section outline

  • Заняття 2. Формати, структури та підготовка даних

    Мета: формування у студентів комплексу знань, аналітичних здібностей та практичних інженерних умінь у галузі вибору форматів збереження даних, реалізації архітектурних процесів ETL, нормалізації та очищення даних (Data Cleaning), а також автоматизації інженерних сценаріїв підготовки інформації за допомогою No-Code / Low-Code інструменту Power Query. Студент має засвоїти класифікацію форматів даних (структуровані, напівструктуровані, неструктуровані), глибоко зрозуміти фізичну, синтаксичну та порівняльну специфіку форматів CSV, XLSX, JSON, XML, а також осягнути фундаментальну концепцію ETL (Extract, Transform, Load) / ELT і правило GIGO (Garbage In, Garbage Out). У процесі навчання особлива увага приділяється практичному засвоєнню методів виявлення й усунення дефектів даних (кодування UTF-8, обробка пропусків, дедуплікація, очищення текстового шуму), опануванню принципів нормалізації Tidy Data та атомарності значений, а також вивченню процедур трансформації форм таблиць (Pivoting та Unpivoting). Важливим практичним результатом є формування вміння проєктувати відтворювані детерміновані алгоритми обробки даних у середовищі Power Query: налаштовувати коннектори до різнорідних джерел, виконувати об'єднання (Merge / Append), комбінувати файли з папок та читати/редагувати автоматично згенерований код на декларативній функціональній мові M (Advanced Editor) для створення автоматизованих пайплайнів підготовки даних, що оновлюються в один клік без пошкодження вихідних файлів-джерел.