Перейти до вмісту

Machine Learning

Матеріал з K2 ERP Wiki
Версія від 19:49, 8 травня 2026, створена R (обговорення | внесок) (Створена сторінка: {{SEO |title=Machine Learning — машинне навчання, моделі, алгоритми, дані, навчання, оцінювання і MLOps |description=Machine Learning — Wiki-стаття про машинне навчання як напрям штучного інтелекту. Розглянуто supervised learning, unsupervised learning, reinforcement learning, classification, regression, clustering, datasets, features, traini...)
(різн.) ← Попередня версія | Поточна версія (різн.) | Новіша версія → (різн.)

Embeddings

Суть target: це відповідь, яку модель повинна навчитися давати для нових даних.; У supervised learning dataset зазвичай містить вхідні інформаційні дані та правильні відповіді.; Machine Learning — це напрям штучного інтелекту, у якому моделі навчаються на даних і використовують знайдені закономірності для прогнозів, класифікації, рекомендацій, сегментації, аналізу й автоматизації.; інформаційні дані: історичний розвиток продажів, сезонність, ціни, промо, складські залишки.; * очищення даних;

  • заповнення пропусків;
  • scaling;
  • normalization;
  • encoding categorical variables;
  • видалення дублікатів;
  • роботу з outliers;
  • feature engineering;
  • text vectorization;
  • image resizing;
  • tokenization.;
X,

Головна думка: Machine Learning надає можливість системам навчатися на даних і робити прогнози, але успішне сфера застосування потребує якісних даних, правильної постановки задачі, чесної оцінки, безпеки й людського контролю.; * Матеріали з Data Science, MLOps, model evaluation і responsible AI.;

Практична роль: сучасний ML зазвичай будується не одним інструментом, а стеком: інформаційні дані, моделі, експерименти, deployment і моніторинг.; * Документація PyTorch.; * Довідкові матеріали щодо bias, fairness, explainability, privacy і ML security.; PyTorch — популярний фреймворк для deep learning.;</syntaxhighlight>

Algorithm

  • neural networks;
  • production ML;
  • training;
  • inference;
  • mobile і edge deployment;
  • TensorFlow Lite;
  • TensorFlow Serving;
  • computer vision;
  • NLP.; Machine Learning є собою одним із інструментів Data Science.; Значення

Джерела

  • отримати стабільнішу оцінку якості;
  • зменшити залежність від одного split;
  • краще порівнювати моделі;
  • виявляти overfitting;
  • ефективніше використовувати невеликий dataset.;

Перевага: PyTorch часто обирають за гнучкість, зручність експериментів і популярність у research.;== Supervised learning ==

Результат: список подій для перевірки.;

Див.; додатково

Якість даних впливає на якість моделі.; Machine Learning має окремі ризики безпеки.; Monitoring — це спостереження за моделлю після впровадження.;== Типові сценарії використання == Приклади features: Поширені помилки:

Deep Learning

Algorithm — це метод, за яким модель навчається або робить прогноз.; * висока якість на train;

  • низька якість на test;
  • надто складна модель;
  • нестабільність на нових прикладах;
  • модель запам’ятала шум.;

Test set

Приклади target:

Metrics

Прогноз продажів

Модель має змогу бути: |- | Artificial Intelligence | Широкий напрям створення систем, які виконують задачі, пов’язані з інтелектом |- | Machine Learning | Підхід, де платформа навчається на даних |- | Deep Learning | Піднапрям ML на основі глибоких нейронних мереж |- | Generative AI | AI, який створює новий контент: текст, код, зображення, відео, музику |}

Як функціонує Machine Learning

Тип: recommendation.;

  • ігри;
  • робототехніка;
  • оптимізація стратегій;
  • симуляції;
  • керування ресурсами;
  • рекомендаційні системи в окремих сценаріях;
  • autonomous systems.; * чітко визначати задачу;
  • перевіряти якість даних;
  • вибирати правильну метрику;
  • тестувати модель;
  • перевіряти bias;
  • документувати модель;
  • контролювати explainability;
  • моніторити після запуску;
  • мати human review для важливих рішень;
  • дотримуватися приватності;
  • перевіряти юридичні вимоги;
  • не використовувати модель за межами її призначення.; y,
  • низька якість на train;
  • низька якість на test;
  • модель занадто проста;
  • недостатньо features;
  • поганий preprocessing;
  • неправильна постановка задачі.;

Validation — це перевірка моделі на даних, які не використовувалися безпосередньо для навчання.;

Regression

завдяки наявності Практична роль: dimensionality reduction користувачі можуть зробити складні інформаційні дані компактнішими й зрозумілішими.;

Практична роль: feature engineering сприяє моделі побачити корисні закономірності, які не лежать прямо в raw data.; Machine Learning

Clustering

Практична роль: data drift має змогу поступово зменшувати якість моделі, навіть якщо код не змінювався.; PyTorch застосовується для:

  • зображень;
  • текстів;
  • аудіо;
  • відео;
  • speech recognition;
  • machine translation;
  • recommendation systems;
  • генеративного AI;
  • deep learning;
  • складних nonlinear задач.;
Model deployment — це впровадження моделі в робоче середовище.; * Документація Scikit-learn.;

Accuracy зручна, коли класи збалансовані.; Приклади:

Monitoring

Neural networks

Суть training: модель поступово зменшує помилки на навчальних прикладах.; * MAE;

  • MSE;
  • RMSE;
  • R²;
  • MAPE;
  • median absolute error.;

PyTorch

Методи:

Основна ідея: у машинному навчанні платформа не отримує всі правила вручну, а вчиться на даних і потім застосовує знайдені закономірності до нових випадків.;
  • рядки;
  • колонки;
  • ознаки;
  • цільову змінну;
  • мітки класів;
  • приклади;
  • metadata;
  • часові позначки;
  • текстові поля;
  • зображення або файли.; * вибору моделі;
  • конфігурація гіперпараметрів;
  • порівняння алгоритмів;
  • виявлення overfitting;
  • оцінки стабільності;
  • вибору threshold;
  • перевірки preprocessing.; TensorFlow — фреймворк для machine learning і deep learning.;
    === Рекомендаційна платформа ===
    
    '''Просте пояснення:''' dataset  це матеріал, на якому модель навчається розпізнавати закономірності.; # Модель навчається на training data.;</div>
    
    == Data drift ==
    
    * кредитного скорингу;
    * медицини;
    * права;
    * HR;
    * security;
    * business decisions;
    * регуляторних вимог;
    * довіри користувачів;
    * debugging моделі.;== TensorFlow ==
    інформаційні дані: активність, платежі, звернення в підтримку, історичний розвиток використання.;</div>
    
Приклад: якщо 99% заявок нормальні, модель, яка завжди каже “нормальна”, матиме 99% accuracy, але не буде корисною для пошуку шахрайства.; * Документація Hugging Face.; Суть: algorithm — це спосіб навчання, а model — результат сфера застосування цього способу до конкретних даних.;

Алгоритми clustering: Просте пояснення: модель — це навчена платформа, яка перетворює вхідні інформаційні дані на прогноз або рішення для бізнесу.;</syntaxhighlight>

Feature engineering

MLOps охоплює:

Accuracy

Scikit-learn — популярна Python-бібліотека для класичного machine learning.; Для regression використовують:

Професійний підхід: ML має допомагати приймати кращі рішення для бізнесу, але відповідальність за наслідки залишається за людьми й організацією.; Задача: знайти незвичні транзакції або події.;

Просте пояснення: embeddings перетворюють складний об’єкт на набір чисел, де схожі об’єкти мають близькі представлення.; * REST API;

  • batch inference;
  • streaming inference;
  • embedded model;
  • mobile deployment;
  • edge deployment;
  • cloud service;
  • database scoring;
  • real-time prediction;
  • internal tool.; # Результати моніторяться після впровадження.;
Overfitting — це ситуація, коли модель занадто добре запам’ятала training data і погано функціонує на нових даних.; Reinforcement learning або навчання з підкріпленням — це підхід, де агент навчається діяти в середовищі через винагороди й покарання.;

Висновок

Data leakage — це ситуація, коли модель під час навчання отримує інформацію, якої не буде в реальному використанні.;

|- | Основна задача | Прогноз, класифікація, аналіз, виявлення закономірностей | Створення нового контенту |- | Результат | Клас, число, ймовірність, сегмент, anomaly score | Текст, код, зображення, відео, музика, голос |- | Типові моделі | Regression, trees, boosting, clustering, neural networks | LLM, diffusion models, audio/video generative models |- | Приклад | Прогноз відтоку клієнта | Написання статті або генерація зображення |}

Хороші практики Machine Learning

Model deployment

  • Python;
  • NumPy;
  • pandas;
  • scikit-learn;
  • TensorFlow;
  • PyTorch;
  • JAX;
  • XGBoost;
  • LightGBM;
  • CatBoost;
  • Hugging Face;
  • Ray;
  • MLflow;
  • Kubeflow;
  • Weights & Biases;
  • Apache Spark;
  • Dask.;== Underfitting ==
  • вік акаунта в днях;
  • середній чек;
  • кількість покупок за місяць;
  • день тижня;
  • сезонність;
  • співвідношення показників;
  • категорії з тексту;
  • агрегати по історії;
  • поведінкові метрики;
  • embeddings.;

Задача: знайти групи схожих клієнтів.;

інформаційні дані: транзакції, суми, час, поведінка, географія.; Transformers — це технічна архітектура нейронних мереж, яка стала основою багатьох сучасних мовних і мультимодальних моделей.; Задача: передбачити продажі та реалізація на наступний місяць.;

Тип: anomaly detection.; * замовник купить або не купить;

  • ціна товару;
  • клас документа;
  • ймовірність відтоку;
  • категорія зображення;
  • кількість замовлень;
  • ризик несплати;
  • оцінка якості;
  • наступна дія користувача.; * Linear Regression;
  • Ridge;
  • Lasso;
  • Decision Tree Regressor;
  • Random Forest Regressor;
  • Gradient Boosting Regressor;
  • Support Vector Regression;
  • Neural Network.; * вік клієнта;
  • місто;
  • сума покупки;
  • кількість замовлень;
  • дата реєстрації;
  • категорія товару;
  • довжина тексту;
  • кількість входів у систему;
  • середній чек;
  • історичний розвиток платежів;
  • колір пікселя;
  • embedding документа.; Критерій

Приклади використання:

  • один клас трапляється дуже часто;
  • важливі помилки різного типу;
  • false positive і false negative мають різну ціну;
  • dataset незбалансований.;=== Прогноз відтоку клієнтів ===

Regression — це задача передбачення числового значення.; Deep Learning — це піднапрям machine learning, який використовує глибокі нейронні мережі з багатьма шарами.; * табличними;

  • текстовими;
  • числовими;
  • категоріальними;
  • часовими рядами;
  • зображеннями;
  • аудіо;
  • відео;
  • логами;
  • транзакціями;
  • поведінковими подіями;
  • документами;
  • сенсорними даними.; це напрям штучного інтелекту, у якому комп’ютерні системи навчаються знаходити закономірності в даних і використовувати їх; додатково реалізовано класифікації, рекомендацій, виявлення аномалій, аналізу, автоматизації або прийняття рішень виступає ключовою рисою прогнозів забезпечується через Machine Learning або машинне навчання.; * K-Means;
  • DBSCAN;
  • Agglomerative Clustering;
  • Mean Shift;
  • Gaussian Mixture Models;
  • Spectral Clustering.; Explainability — це здатність пояснити, чому модель зробила певний прогноз.;== Тематичні мітки ==

Приклад: якщо є собою інформаційні дані клієнтів, але немає готових сегментів, unsupervised learning має змогу знайти групи схожих клієнтів.; * навчання;

  • підбору гіперпараметрів;
  • вибору моделі;
  • частих експериментів;
  • ручного підлаштування рішення для бізнесу.; Але accuracy має змогу бути поганою метрикою, якщо:

Transformers

Data Science охоплює:

Необхідно контролювати:

  • data poisoning;
  • model stealing;
  • adversarial examples;
  • privacy leakage;
  • prompt injection у ML/AI-системах;
  • insecure model serving;
  • exposed model endpoints;
  • supply chain attacks;
  • unsafe generated code;
  • leakage через logs.; Найбільшу роль часто відіграють якість даних, постановка задачі, метрики, тестування й контроль після впровадження.; Методи:

Validation

Суть clustering: модель сама шукає групи в даних без готових міток.;== JAX ==

  • classification;
  • regression;
  • ranking;
  • прогнозування ймовірності;
  • scoring;
  • prediction.; Feature engineering — це створення корисних ознак із raw data.; Типові задачі:

Суть: precision відповідає на питання “наскільки точні позитивні прогнози”, а recall — “скільки потрібних випадків ми знайшли”.; Результат: сегменти для маркетингу або продукту.; Потрібно контролювати:

Для старту: Scikit-learn часто є собою найкращою першою бібліотекою для вивчення класичного machine learning.; Machine Learning можна використовувати у різних сценаріях.;

Головне правило: успішний Machine Learning — це не “найскладніша модель”, а правильні інформаційні дані, правильна задача, чесне оцінювання й контроль у production.; Критично: погані, неповні, упереджені або неправильно зібрані інформаційні дані можуть зробити модель некорисною, навіть якщо алгоритм обраний правильно.; Fairness — це справедливість і контроль того, щоб модель не шкодила окремим групам людей.; * вхідні features;

  • target;
  • багато прикладів;
  • зв’язок між вхідними даними й відповідями.; Практична роль: JAX сильний там, де потрібні gradients, JIT, functional programming і високопродуктивні обчислення.; )

Explainability важлива для:

<div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">

* research;
* gradients;
* optimization;
* scientific computing;
* neural networks через Flax, Haiku або Equinox;
* accelerator-based computing;
* custom ML experiments.; JAX застосовується для:

* прогноз продажів;
* прогноз відтоку клієнтів;
* fraud detection;
* recommendation engine;
* customer segmentation;
* document classification;
* image recognition;
* text classification;
* sentiment analysis;
* anomaly detection;
* lead scoring;
* demand forecasting;
* predictive maintenance;
* dynamic pricing;
* risk scoring;
* personalization.; '''Clustering''' — це групування об’єктів за схожістю.; '''Практична роль:''' validation сприяє зрозуміти, як модель функціонує не лише на даних, які вона бачила під час навчання.;<div style="background:#eafaf1; border-left:6px solid #2ecc71; padding:12px; margin:12px 0;">
Задача: рекомендувати користувачу товари або контент.; * semantic search;
* рекомендацій;
* clustering;
* RAG;
* similarity search;
* classification;
* пошуку дублікатів;
* порівняння текстів;
* multimodal search.; * Документація JAX.; '''Embeddings''' — це числові представлення об’єктів: текстів, зображень, товарів, користувачів або документів.; test_size=0.2,
'''Небезпека:''' overfitting створює ілюзію хорошої моделі, яка провалюється в реальному використанні.;== Model ==

<syntaxhighlight lang="text">

* training data — для навчання;
* validation data — для конфігурація;
* test data — для фінальної перевірки.;<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">

</div>

* прогноз ціни;
* прогноз попиту;
* прогноз витрат;
* прогноз часу доставки;
* оцінка доходу;
* прогноз кількості замовлень;
* передбачення температури;
* оцінка ризику у вигляді числа.; '''Практична роль:''' explainability сприяє не лише користувачам, а й розробникам знаходити помилки в моделі.; '''Висновок:''' Data Science відповідає за роботу з даними загалом, а Machine Learning — за навчання моделей на цих даних.; Для classification використовують:
<div style="background:#eef2ff; border-left:6px solid #4f46e5; padding:12px; margin:12px 0;">
'''Bias''' — це упередження в даних, моделі або процесі прийняття рішень.; # Модель покращується.;<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">

'''Dimensionality reduction''' — це зменшення кількості ознак або вимірів.; * computer vision;
* speech recognition;
* machine translation;
* LLM;
* генеративного AI;
* text-to-image;
* text-to-video;
* recommendation systems;
* autonomous systems.;<div style="background:#f0eaff; border-left:6px solid #8e44ad; padding:12px; margin:12px 0;">

Тип: regression або time series forecasting.; Форми deployment:
X_train, X_test, y_train, y_test = train_test_split(

'''Classification''' — це задача передбачення класу або категорії.;

!; Training або навчання моделі — це бізнес-процес, під час якого модель підлаштовує свої параметри під інформаційні дані.; Train/test split — це розділення dataset на training і test частини.;== Unsupervised learning ==

Embeddings використовуються для:

'''істотно:''' машинне навчання — це не лише вибір алгоритму.; # Обирається модель або алгоритм.; * clustering;
* dimensionality reduction;
* anomaly detection;
* pattern discovery;
* grouping;
* segmentation;
* exploratory data analysis.; * spam або not spam;
* замовник купить або не купить;
* документ належить до категорії;
* заявка ризикована або безпечна;
* товар належить до групи;
* зображення містить певний об’єкт;
* користувач системи залишиться або піде.; Dataset містить:

Приклади:

== інформаційні дані ==

'''Критично:''' модель, яка добре працювала під час запуску, має змогу з часом погіршитися через зміну даних, поведінки користувачів або бізнес-процесів.;</div>
Machine Learning потрібно використовувати відповідально.; Метрики: ROC AUC, recall, precision, business lift.; Generative AI

</div>

'''Preprocessing''' — це підготовка даних перед навчанням.; Machine Learning є собою частиною ширшого поняття '''Artificial Intelligence'''.; * Logistic Regression;
* Decision Tree;
* Random Forest;
* Gradient Boosting;
* Support Vector Machine;
* K-Nearest Neighbors;
* Naive Bayes;
* Neural Network.;=== Сегментація клієнтів ===
== Target ==
'''Практична роль:''' features є собою способом представити реальний об’єкт у вигляді даних, з якими має змогу працювати модель.; Приклади:
'''Recall''' показує, яку частку реальних позитивних випадків модель знайшла.; Deep Learning лежить в основі:
Transformers використовуються в:
Dataset має змогу містити:
</div>
<div style="background:#eafaf1; border-left:6px solid #2ecc71; padding:12px; margin:12px 0;">
== Precision і Recall ==

Machine Learning і Data Science

Training

Загальний характеристика

Вона застосовується для: Рекомендовано:

Підказка: формулювання ML-задачі має містити тип задачі, інформаційні дані, target, метрику й спосіб перевірки результату.;

!; Суть classification: модель вибирає категорію для нового об’єкта.;== Інструменти Machine Learning ==

  • візуалізації;
  • зменшення шуму;
  • пришвидшення моделей;
  • стиснення даних;
  • пошуку структури;
  • роботи з високовимірними embeddings;
  • підготовки features.; Preprocessing має змогу включати:

Test set не можна використовувати для:

інформаційні дані — основа машинного навчання.; Приклади алгоритмів:

Features або ознаки — це вхідні характеристики, які модель використовує для прогнозу.; Практична роль: хороший ML-процес шукає баланс між overfitting і underfitting.; Суть Deep Learning: модель сама вчиться будувати складні внутрішні представлення даних, а не покладається лише на вручну створені ознаки.;

Приклади:

  • персональні інформаційні дані;
  • consent;
  • data minimization;
  • anonymization;
  • pseudonymization;
  • data retention;
  • доступи;
  • encryption;
  • logs;
  • model outputs;
  • training data governance.;

Приклад: якщо є собою історичний розвиток клієнтів і відомо, хто купив програмний продукт, модель має змогу навчитися прогнозувати ймовірність покупки для нових клієнтів.; * Large Language Models;

  • машинному перекладі;
  • text generation;
  • summarization;
  • code generation;
  • embeddings;
  • vision-language models;
  • multimodal AI;
  • генеративному AI.;

Критично: ML-моделі, які впливають на людей, потрібно перевіряти на bias, fairness, прозорість і можливість оскарження рішення для бізнесу.;

Validation потрібен для:

Приклади:

Train/test split

Тип: classification.;

Практична користь: cross-validation дає надійнішу оцінку моделі, ніж одна випадкова перевірка.; Приклади:

інформаційні дані: частота покупок, середній чек, категорії товарів, активність.;
</div>

== Reinforcement learning ==

== Data leakage ==

інформаційні дані: перегляди, покупки, рейтинги, схожість товарів, поведінка.; * сегментація клієнтів;
* групування товарів;
* пошук схожих документів;
* кластеризація поведінки користувачів;
* групування географічних точок;
* пошук типових патернів.; * PCA;
* t-SNE;
* UMAP;
* TruncatedSVD;
* Autoencoders;
* feature selection.; '''Перевага:''' хороший preprocessing часто покращує модель сильніше, ніж перехід на складніший алгоритм.;<div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">

<div style="background:#ecfdf5; border-left:6px solid #10b981; padding:12px; margin:12px 0;">

!; '''Precision''' показує, яка частка позитивних прогнозів справді правильна.; '''Небезпека:''' ML-проєкт має змогу мати високі метрики в notebook, але бути марним у бізнесі через неправильну задачу, погані інформаційні дані або відсутність deployment-процесу.;<div style="background:#fef2f2; border-left:6px solid #ef4444; padding:12px; margin:12px 0;">
</div>
Основні поняття:

== Machine Learning і Generative AI ==

<div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">

'''Просте правило:''' модель потрібно перевіряти на даних, яких вона не бачила під час навчання.; Алгоритми classification:

* якість прогнозів;
* data drift;
* concept drift;
* latency;
* errors;
* model confidence;
* distribution changes;
* business metrics;
* fairness;
* resource usage;
* cost;
* feedback loop.; Ознаки underfitting:
'''Model''' — це математична структура або алгоритм, який навчається на даних і робить прогноз.; '''Висновок:''' Generative AI — це сучасна й дуже помітна частина AI, але Machine Learning охоплює значно ширший набір задач.; {| class="wikitable"

Тип: clustering.; Ці метрики важливі для:

* прогнозування попиту;
* класифікація клієнтів;
* рекомендації товарів;
* виявлення шахрайства;
* аналіз текстів;
* розпізнавання зображень;
* прогноз відтоку клієнтів;
* оцінка ризиків;
* сегментація користувачів;
* автоматичне сортування документів;
* прогноз ціни;
* аналіз поведінки;
* виявлення аномалій;
* оптимізація бізнес-процесів.; * змінилася поведінка клієнтів;
* з’явився новий тип товару;
* змінився ринковий сегмент;
* змінилися канали продажів;
* змінився інтерфейс збору даних;
* змінилася сезонність.; '''Суть різниці:''' AI — найширше поняття, ML — навчання на даних, Deep Learning — глибокі нейронні мережі, Generative AI — створення нового контенту.; Висока accuracy має змогу бути оманливою, якщо класи незбалансовані.; Поняття

<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">

Рекомендовано:

* classification;
* regression;
* clustering;
* preprocessing;
* model selection;
* metrics;
* pipelines;
* cross-validation.; '''Критично:''' якщо test set використовувати для підбору моделі, оцінка якості стане завищеною й нечесною.; * feature importance;
* SHAP;
* LIME;
* partial dependence;
* counterfactual explanations;
* interpretable models.; Він сприяє:
<div style="background:#fff4e5; border-left:6px solid #f39c12; padding:12px; margin:12px 0;">
'''Практична роль:''' transformers стали однією з ключових технологій сучасного AI, зокрема LLM і генеративних моделей.;<div style="background:#fff7ed; border-left:6px solid #fb923c; padding:12px; margin:12px 0;">

!; Приклади:

* отримує приклади;
* робить прогноз;
* порівнює прогноз із правильною відповіддю;
* обчислює помилку;
* змінює параметри;
* повторює бізнес-процес багато разів.; Задача: передбачити, які клієнти можуть припинити користування сервісом.; from sklearn.model_selection import train_test_split

== Приватність даних ==
<div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">
Machine Learning лежить в основі багатьох сучасних AI-систем: від простих predictive models до deep learning, генеративного AI, рекомендаційних систем, computer vision, NLP і AI-агентів.; '''Underfitting''' — це ситуація, коли модель занадто проста й не вловлює закономірності.;== Explainability ==

'''Neural networks''' або '''нейронні мережі''' — це клас моделей, натхненний ідеєю багатошарової обробки сигналів.; * Linear Regression;
* Logistic Regression;
* Decision Tree;
* Random Forest;
* Gradient Boosting;
* K-Means;
* SVM;
* KNN;
* Neural Networks;
* Transformers.;== Overfitting ==

'''Accuracy''' — це частка правильних прогнозів.; # Модель застосовується для прогнозів.;== Безпека Machine Learning ==
{{SEO
|title=Machine Learning — машинне навчання, моделі, алгоритми, дані, навчання, оцінювання і MLOps
|description=Machine Learning — Wiki-стаття про машинне навчання як напрям штучного інтелекту. Розглянуто supervised learning, unsupervised learning, reinforcement learning, classification, regression, clustering, datasets, features, training, validation, testing, metrics, overfitting, underfitting, model deployment, MLOps, neural networks, deep learning, scikit-learn, TensorFlow, PyTorch, JAX, переваги, обмеження, безпеку, приватність і відповідальне використання ML.
|keywords=Machine Learning, машинне навчання, ML, штучний інтелект, AI, supervised learning, unsupervised learning, reinforcement learning, classification, regression, clustering, dataset, features, model training, validation, testing, metrics, overfitting, underfitting, neural networks, deep learning, scikit-learn, TensorFlow, PyTorch, JAX, MLOps, model deployment, data science
|alternativeTo=ручне створення правил для кожного випадку; статичні алгоритми без навчання на даних; ручний аналіз великих datasets; Excel-моделі для складного прогнозування; евристики без перевірки на даних; ручне сегментування користувачів; ручне виявлення закономірностей; прості if-else правила там, де потрібне навчання на прикладах
}}

'''Test set''' — це окремий набір даних для фінальної перевірки моделі.; '''Правило:''' модель не повинна отримувати більше даних, ніж потрібно для задачі.; '''Практична роль:''' нейронні мережі особливо сильні там, де інформаційні дані складні: текст, зображення, звук, відео або великі embeddings.;<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">

'''істотно:''' deployment — це не кінець ML-проєкту.; Типові задачі supervised learning:
<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">
</div>
<div style="background:#eafaf1; border-left:6px solid #2ecc71; padding:12px; margin:12px 0;">

Під час training модель:

'''Unsupervised learning''' або '''навчання без учителя''' — це підхід, коли модель функціонує з даними без готових правильних відповідей.; Після запуску модель потрібно моніторити й оновлювати.; інформаційні дані можуть бути:
<div style="background:#fff4e5; border-left:6px solid #f39c12; padding:12px; margin:12px 0;">

'''Data Science''' ширше за machine learning.; # Визначається задача.; Метрики: CTR, conversion rate, precision@k, recall@k.; * agent;
* environment;
* action;
* state;
* reward;
* policy;
* episode.;== Classification ==

'''MLOps''' — це практики керування життєвим циклом ML-моделей у production.; Загальна схема machine learning така:
</div>
== Dimensionality reduction ==

<div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">

<div style="background:#e7f3ff; border-left:6px solid #2b7cff; padding:12px; margin:12px 0;">

</div>

* neural networks;
* research;
* computer vision;
* NLP;
* LLM;
* custom architectures;
* GPU training;
* experiments;
* production inference.; * accuracy;
* precision;
* recall;
* F1-score;
* ROC AUC;
* confusion matrix;
* log loss.; '''Target''' або '''цільова змінна''' — це те, що модель має навчитися передбачати.;== Scikit-learn ==

Метрики: MAE, RMSE, MAPE.;</div>

== Bias і fairness ==

'''Суть regression:''' модель повертає число, а не клас.;<div style="background:#fdecea; border-left:6px solid #e74c3c; padding:12px; margin:12px 0;">

</div>

</div>

* лінійною;
* деревоподібною;
* ансамблевою;
* нейронною;
* probabilistic;
* kernel-based;
* distance-based;
* transformer-based.;</div>
'''Суть MLOps:''' модель потрібно не лише навчити, а й безпечно, стабільно й контрольовано використовувати в реальному середовищі.; '''Критично:''' data leakage має змогу зробити метрики дуже високими, але модель буде погано працювати в реальному світі.; '''Supervised learning''' або '''навчання з учителем''' — це підхід, коли модель навчається на прикладах із правильними відповідями.; Це потрібно для:
{| class="wikitable"

</div>

'''істотно:''' reinforcement learning складний у налаштуванні, з цієї причини що потрібно правильно визначити середовище, дії, винагороду й спосіб оцінювання.; # Якість перевіряється на validation або test data.; Він застосовується для:

Популярні інструменти:
'''Cross-validation''' — це метод оцінювання моделі на кількох розбиттях даних.;<div style="background:#fff7ed; border-left:6px solid #fb923c; padding:12px; margin:12px 0;">

== MLOps ==

* збір даних;
* очищення;
* аналіз;
* статистику;
* візуалізацію;
* machine learning;
* інтерпретацію;
* бізнес-висновки;
* експерименти;
* dashboards;
* data storytelling.;=== Виявлення аномалій ===
== Відповідальне використання ML ==

Ризики:

'''Практична порада:''' найкраще починати ML-проєкт із задачі, де є собою інформаційні дані, зрозуміла метрика й можливість перевірити результат.; * нерівномірна якість для різних груп;
* дискримінація;
* історичні упередження в даних;
* неправильні proxy variables;
* непрозорі рішення для бізнесу;
* погана якість даних для меншин;
* непропорційні помилки.; # інформаційні дані очищуються й готуються.; Нейронні мережі використовуються для:

<div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">

Типовий підхід:

<div style="background:#e8f8f5; border-left:6px solid #16a085; padding:12px; margin:12px 0;">

* versioning даних;
* versioning моделей;
* experiment tracking;
* training pipelines;
* deployment;
* monitoring;
* drift detection;
* rollback;
* model registry;
* reproducibility;
* CI/CD для ML;
* governance;
* security.; Machine Learning застосовують, коли потрібно там, де важко або неможливо вручну описати всі правила.;== Приклади задач ==

* нечітка постановка задачі;
* погана якість даних;
* неправильна метрика;
* data leakage;
* overfitting;
* відсутність test set;
* відсутність monitoring;
* вибір складної моделі без потреби;
* ігнорування bias;
* недостатня документація;
* відсутність бізнес-інтерпретації;
* запуск у production без MLOps;
* використання моделі поза її призначенням.; Алгоритми regression:

== Типові помилки користувачів ==

'''Практична роль:''' TensorFlow корисний для масштабних deep learning і production-сценаріїв.; '''Перевага:''' машинне навчання надає можливість знаходити закономірності в даних там, де ручні правила були б занадто складними, неточними або дорогими в підтримці.; * fraud detection;
* медичної діагностики;
* пошуку ризиків;
* moderation;
* security alerts;
* lead scoring;
* spam filtering.;== Cross-validation ==
'''істотно:''' метрика має відповідати бізнес-задачі.; !; Приклад:

На відміну від класичного програмування, де розробник явно описує всі правила, у machine learning модель навчається на прикладах.; * Документація TensorFlow.;

<syntaxhighlight lang="text">

  • preprocessing виконаний на всіх даних до split;
  • test set використаний під час вибору моделі;
  • у features потрапила майбутня відомості;
  • target випадково закодований у feature;
  • дублікати потрапили і в train, і в test;
  • статистики пораховані на всьому dataset.; Приклади:
JAX — бібліотека для високопродуктивних числових обчислень, automatic differentiation і JIT-компіляції.; Водночас якість ML-рішення залежить не лише від алгоритму, а й від даних, метрик, тестування, відсутності leakage, fairness, explainability, privacy, deployment і monitoring.;

Критично: ML-система — це software system, з цієї причини вона потребує security review, access control, monitoring і захисту даних.; Data drift — це зміна розподілу вхідних даних після запуску моделі.;== Machine Learning і Artificial Intelligence ==

Preprocessing

Generative AI зазвичай базується на machine learning і deep learning.; Ознаки overfitting:

random_state=42

Dataset — це набір даних, на якому навчається або перевіряється модель.; # Збираються інформаційні дані.; * починати із простої baseline-моделі;

  • перевіряти інформаційні дані;
  • робити train/validation/test split;
  • використовувати cross-validation;
  • контролювати data leakage;
  • правильно вибирати метрики;
  • документувати features;
  • використовувати pipelines;
  • аналізувати помилки;
  • перевіряти bias і fairness;
  • моніторити модель після deployment;
  • мати rollback;
  • регулярно переоцінювати модель;
  • узгоджувати ML із бізнес-цілями.; ML часто функціонує з великими datasets, з цієї причини приватність критично важлива.;== Dataset ==

Features

Metrics — це показники якості моделі.; Приклади: