Pour une utilisation optimale, veuillez visiter numiqo sur votre PC de bureau !

Calculate
Dependent Variable
Independent Variable

Comment faire

Calculateur de Gradient Boosting

Données d'exemple pour une classification par Gradient Boosting Données d'exemple pour une régression par Gradient Boosting

Le calculateur de Gradient Boosting crée un modèle prédictif à partir d'une variable dépendante et de deux variables prédictives ou plus. Si la variable dépendante est catégorielle, numiqo effectue une classification par Gradient Boosting. Si la variable dépendante est métrique, numiqo effectue une régression par Gradient Boosting.

Pour calculer un Gradient Boosting en ligne, ouvrez l'analyse prédictive, sélectionnez Gradient Boosting, choisissez la variable dépendante, puis sélectionnez les variables indépendantes à utiliser comme prédicteurs.

Qu'est-ce que le Gradient Boosting ?

Le Gradient Boosting est une méthode d'ensemble qui construit de nombreux petits arbres de décision successivement. Chaque nouvel arbre se concentre sur les erreurs de prédiction actuelles du modèle existant. Le modèle ajoute ensuite le nouvel arbre avec un taux d'apprentissage, de sorte que la prédiction finale se construit progressivement au lieu de provenir d'un seul grand arbre.

Il s'agit de la méthode générale d'apprentissage automatique qui sous-tend les modèles d'arbres boostés de type TreeNet utilisés dans les logiciels d'analyse prédictive. Dans ce calculateur, la fonctionnalité utilise le nom générique Gradient Boosting plutôt qu'un nom de produit de marque.

Fonctionnement du calculateur de Gradient Boosting

Le calculateur entraîne des arbres de décision peu profonds sur des pseudo-résidus. Pour la régression, le pseudo-résidu est la différence entre la valeur observée et la valeur prédite actuelle. Pour la classification, le calculateur utilise les probabilités de classe et ajuste des arbres qui améliorent le score de chaque catégorie.

  1. Prédiction initiale : la régression commence avec la moyenne de la variable dépendante. La classification commence avec les proportions des classes.
  2. Arbres séquentiels : chaque arbre est ajusté à l'erreur actuelle du modèle.
  3. Taux d'apprentissage : le taux d'apprentissage contrôle l'ampleur avec laquelle chaque nouvel arbre modifie le modèle existant.
  4. Petits arbres : la profondeur maximale de l'arbre contrôle la complexité possible de chaque arbre individuel.
  5. Partition de validation : le calculateur indique la performance sur les lignes de validation qui ont été exclues de l'entraînement lorsque le jeu de données sélectionné est suffisamment grand.

Résultats du Gradient Boosting

Les résultats du Gradient Boosting comprennent un tableau de méthode, la performance de validation et l'importance relative des variables. Les modèles de classification incluent également une matrice de confusion. Les modèles de régression indiquent le RMSE, le MAE et le R carré.

Performance de validation

La performance de validation estime dans quelle mesure le modèle d'arbres boostés prédit les lignes qui n'ont pas été utilisées pour ajuster les arbres. Les modèles de classification indiquent l'exactitude. Les modèles de régression indiquent le RMSE, le MAE et le R carré.

Matrice de confusion

La matrice de confusion compare la catégorie observée avec la catégorie prédite. Les lignes indiquent les catégories réelles et les colonnes indiquent les catégories prédites. Le pourcentage correct de chaque ligne indique la fréquence à laquelle les observations de cette catégorie réelle ont été correctement classées.

Importance des variables

L'importance des variables résume dans quelle mesure chaque prédicteur améliore les divisions des arbres boostés. Une importance relative plus élevée signifie que la variable a davantage contribué à réduire l'erreur du modèle dans l'ensemble. L'importance est utile pour classer les prédicteurs, mais elle ne doit pas être interprétée comme une preuve de causalité.

Gradient Boosting ou Random Forest

Une Random Forest construit de nombreux arbres indépendamment et combine leurs prédictions. Le Gradient Boosting construit les arbres de manière séquentielle, chaque arbre améliorant le modèle actuel. Random Forest est souvent plus facile à paramétrer, tandis que le Gradient Boosting peut atteindre une forte performance prédictive lorsque le nombre d'arbres, le taux d'apprentissage et la profondeur des arbres sont choisis avec soin.

Quand utiliser le Gradient Boosting

Utilisez la classification par Gradient Boosting lorsque la variable dépendante est catégorielle et que l'objectif est de prédire l'appartenance à un groupe. Utilisez la régression par Gradient Boosting lorsque la variable dépendante est métrique et que l'objectif est de prédire une valeur numérique. Les applications courantes comprennent la prédiction de l'attrition, l'évaluation des risques qualité, la prévision de la demande, la surveillance des processus et la segmentation des clients.

Limites

Les lignes contenant des valeurs manquantes dans les variables sélectionnées sont exclues du calcul. L'implémentation actuelle utilise des arbres peu profonds de type CART, des divisions par erreur quadratique sur les pseudo-résidus et une partition interne entraînement/validation. Elle n'inclut pas encore la prédiction pour de nouvelles lignes, les graphiques de dépendance partielle ni la recherche automatisée d'hyperparamètres.

Cité numiqo: numiqo Team (2026). numiqo: Online Statistics Calculator. numiqo e.U. Graz, Austria. URL https://numiqo.com