Les renforçateurs

Les renforçateurs

Les quatre cadrans du conditionnement opĂ©rant, leurs dĂ©finitions exactes, et surtout la thĂšse qui traverse tout le module : on se sert des quatre. Se limiter Ă  un ou deux, c’est se priver d’outils et se retrouver dĂ©muni le jour oĂč la situation dĂ©passe la friandise.

Renforcement, punition, positif, négatif

Les définitions

Un renforcement est la consĂ©quence d’un comportement qui rend plus probable sa reproduction. Une punition est la consĂ©quence d’un comportement qui rend moins probable sa reproduction.

L’un comme l’autre peut ĂȘtre positif (ajout d’un stimulus agissant sur l’organisme) ou nĂ©gatif (retrait d’un stimulus). Attention au piĂšge de vocabulaire : positif et nĂ©gatif ne signifient pas agrĂ©able et dĂ©sagrĂ©able, mais ajout et retrait.

D’oĂč les quatre cadrans, formulĂ©s proprement :

  • R+ : la frĂ©quence du comportement augmente par ajout d’un stimulus appĂ©titif. Exemple, une rĂ©compense, des fĂ©licitations.
  • R- : la frĂ©quence augmente par retrait d’un stimulus aversif. Exemple, la levĂ©e d’une contrainte ou d’une douleur.
  • P+ : la frĂ©quence diminue par ajout d’un stimulus aversif.
  • P- : la frĂ©quence diminue par retrait d’un stimulus appĂ©titif, d’un privilĂšge, d’un droit.

Retenez la mécanique globale : avec les renforcements, la réponse augmente en fréquence et en intensité ; avec les punitions, elle diminue.

Les quatre cadrans sur un seul exercice

L’exemple de la marche en laisse suffit Ă  tout dĂ©montrer. Le chien marche Ă  la jambe, vous donnez une friandise : R+. Il vous dĂ©passe, vous vous immobilisez : P-. Vous mettez un Ă -coup sur la laisse : P+. Il marche, la laisse est dĂ©tendue, il n’y a plus d’à-coup : R-.

Maintenant regardez une sĂ©ance rĂ©elle. Le chien tire, vous mettez un Ă -coup et vous faites demi-tour : P+. Au bout de quelques allers-retours, ne comprenant pas encore, il s’immobilise, et vous vous arrĂȘtez avec lui : P-. Puis il finit par se trouver au niveau de votre jambe, et vous rĂ©compensez : R+. Trois cadrans sur la mĂȘme action, sans effort et sans conflit, et le quatriĂšme Ă©tait disponible.

Pourquoi il est absurde de les opposer

L’usage veut qu’on range P+ et R- d’un cĂŽtĂ©, R+ et P- de l’autre, et qu’on se batte entre camps. C’est une erreur, et une erreur coĂ»teuse pour le chien.

La limite du tout-R+ est facile Ă  voir : le jour oĂč la stimulation extĂ©rieure vaudra plus que votre rĂ©compense, le chien partira. Il aura appris que rester Ă  la jambe est agrĂ©able quand il ne se passe rien, pas que partir est interdit. Si en revanche il sait que partir est interdit, que marcher Ă  la jambe est la bonne rĂ©ponse, et qu’en plus la bonne rĂ©ponse est rĂ©compensĂ©e, vous obtenez un chien Ă©quilibrĂ©.

La limite du tout-punition est aussi nette : des chiens anxieux, peureux, fragiles, des comportements dĂ©gradĂ©s, et surtout la fin de la collaboration. Passer son temps Ă  punir est une Ă©norme erreur. Passer son temps Ă  rĂ©compenser en est une autre : le chien n’apprend alors ni la frustration, ni le renoncement, ni les autocontrĂŽles, ni ses propres limites.

Si le chien Ă©tait bĂȘte, un seul cadran suffirait. Il est intelligent, alors mettez-vous Ă  son niveau et servez-vous des quatre.

L’efficacitĂ© comparĂ©e

Une phrase Ă  connaĂźtre, et Ă  peser. Du point de vue de l’apprentissage, les renforcements ont une efficacitĂ© supĂ©rieure aux punitions. Et l’apprentissage par renforcement nĂ©gatif s’installe plus vite et rĂ©siste mieux Ă  l’extinction que l’apprentissage par renforcement positif.

Autrement dit, le chien apprend plus vite ce qu’il n’a pas le droit de faire que ce qu’il a le droit de faire, et cet acquis-lĂ  est plus solide. La conclusion pratique n’est pas de tout miser sur ce registre : c’est que sans mĂ©langer les deux, vous Ă©duquerez pendant des annĂ©es sans jamais obtenir ce que vous voulez.

La sĂ©quence la plus efficace est simple : quand un mauvais comportement diminue jusqu’à disparaĂźtre, renforcez par-dessus le bon comportement qui l’a remplacĂ©. Le chien apprend plus vite et comprend beaucoup mieux.

Renforçateurs primaires et secondaires

La distinction et son instabilité

Un renforçateur primaire rĂ©pond directement Ă  un besoin essentiel : la nourriture. Un renforçateur secondaire ne le devient qu’aprĂšs un apprentissage prĂ©alable : le jeu, par exemple.

Ce classement n’est pas figĂ©, et c’est le point important. Nos chiens domestiques sont nourris Ă  heure fixe, souvent trop : ils n’ont plus besoin de chercher leur nourriture, et la valeur de ce renforçateur primaire baisse dans leur Ă©chelle. À l’inverse, une balle rarement disponible, qui rĂ©pond Ă  des patrons moteurs, peut passer devant la nourriture toujours prĂ©sente.

Corollaire Ă  ne jamais oublier : plus le renforçateur a de valeur, plus l’apprentissage ou le dĂ©sapprentissage est rapide. Un chien privĂ© de nourriture pendant une semaine verra celle-ci redevenir un renforçateur primaire, ce qui n’est Ă©videmment pas un protocole mais une illustration du principe.

N’ayez jamais de mode de rĂ©compense préétabli

Chaque renforçateur a une valeur diffĂ©rente selon les chiens ; le contexte, l’environnement et les apprentissages antĂ©rieurs font bouger les paramĂštres.

Un chien abandonnĂ©, qui a vĂ©cu dehors, n’a jamais rien partagĂ© avec un humain : s’acharner Ă  jouer au boudin avec lui ne mĂšnera nulle part. En revanche il a probablement manquĂ© de nourriture, et si celle-ci ne le rend pas fou, elle devient un levier extraordinaire. SymĂ©triquement, un chien gavĂ© de friandises par ses prĂ©cĂ©dents apprentissages a besoin qu’on passe Ă  autre chose. Un chien qui n’a pas confiance en la vie se travaille au contraire Ă  la caresse et Ă  la voix, progressivement.

Les renforcements sociaux (fĂ©licitations, caresse, contact) ont une propriĂ©tĂ© rare : chez beaucoup de chiens, ils subissent moins d’attĂ©nuation que les autres, Ă  condition que le lien soit fort. MĂ©fiez-vous cependant du gavage de caresses : caresser tout le temps et pour tout banalise le geste, et sur un couple maĂźtre-chien un peu fragile, la caresse finit par ne plus rien valoir.

Notez enfin le principe de Premack : tout comportement Ă  forte frĂ©quence peut servir de renforçateur Ă  un autre comportement. C’est ce qui permet de dresser un chien Ă  la recherche de stupĂ©fiants : chercher n’a aucun intĂ©rĂȘt pour lui, mais retrouver donne accĂšs au jouet prĂ©fĂ©rĂ©, et l’activitĂ© sans intĂ©rĂȘt devient passionnante.

Échappement et Ă©vitement

Le renforcement négatif en détail

Un stimulus aversif est un stimulus dont l’animal veut s’éloigner, ou qui provoque du mal-ĂȘtre, de la douleur ou de la peur. C’est l’opposĂ© du stimulus appĂ©titif. Un renforcement nĂ©gatif est un stimulus aversif qui disparaĂźt, ou n’apparaĂźt pas, Ă  la suite d’une rĂ©ponse, ce qui augmente la probabilitĂ© de cette rĂ©ponse.

Le manuel donne un exemple : apprendre au chien un lieu de couchage en l’agressant chaque fois qu’il se couche ailleurs, et en le laissant tranquille quand il choisit le bon endroit. C’est efficace, on ne peut pas prĂ©tendre le contraire, et c’est exactement ce qu’il ne faut pas faire. Les consĂ©quences sont la dĂ©tĂ©rioration, voire la destruction de la relation. Un chien Ă©levĂ© ainsi ne cherchera plus la rĂ©ponse auprĂšs de son maĂźtre le jour oĂč il aura peur : il ira mordre.

Échappement

Le stimulus aversif est prĂ©sent, et la rĂ©ponse permet de s’y soustraire, en gĂ©nĂ©ral par la fuite. Il commence Ă  pleuvoir, le chien se rĂ©fugie dans sa niche : rĂ©ponse d’échappement. Il a pris la pluie.

Évitement

Le stimulus aversif n’est pas encore lĂ , mais un signal permet de l’anticiper et d’empĂȘcher qu’il ne survienne. Il ne pleut pas encore, le tonnerre gronde, le troupeau gagne le couvert des arbres. C’est un processus d’anticipation, qui s’installe gĂ©nĂ©ralement aprĂšs l’échappement, une fois qu’un ou plusieurs stimuli discriminatifs ont Ă©tĂ© appris. Tant que le chien n’a pas compris comment s’échapper, il ne peut pas installer d’évitement.

Les évitements que le chien construit contre vous

C’est ici que se joue une grande partie de votre travail de terrain.

Le mĂ©canisme de base : un chien a peur d’un humain, il cherche Ă  fuir, ça ne marche pas, alors il grogne, et l’humain recule. Bingo, il a trouvĂ© la solution. Le jour oĂč le grognement ne suffit plus, dans une ruelle Ă©troite par exemple, il mord, et il constate que ça fonctionne encore mieux. D’oĂč la rĂšgle : quand on ne sait pas faire, on ne fait pas. Si vous n’ĂȘtes pas certain de vos compĂ©tences face Ă  un chien rĂ©actif, ne l’approchez pas. Et reculer de cinq mĂštres Ă  chaque grognement “pour respecter sa zone de confort”, c’est confirmer au chien que sa solution marche.

MĂȘme chose dans les familles. Un maĂźtre Ă  qui on apprend Ă  manipuler physiquement son chien en permanence obtiendra tĂŽt ou tard un grognement, qui marchera neuf fois sur dix, et ensuite tout le monde a peur du chien. C’est lĂ  qu’on comprend l’intĂ©rĂȘt du dressage, mot qui dĂ©plaĂźt Ă  certains : mettre des mots sur des situations (“recule”, puis on ouvre la porte) Ă©vite de manipuler le chien, Ă©vite de l’attraper au collier, Ă©vite de le mettre en position de combat.

Le cas vĂ©tĂ©rinaire est le classique Ă  connaĂźtre. Le chien est tenu fermement sur la table d’examen, il se dĂ©bat, grogne, montre les dents et mord ; le praticien renonce Ă  l’injection et prescrit un comprimĂ©. À la visite suivante, le chien est immĂ©diatement agressif : dĂšs que les signaux associĂ©s (le cabinet, la table, l’odeur) sont prĂ©sents, il produit la conduite qui a supprimĂ© la piqĂ»re. Il Ă©vite.

La rĂ©ponse Ă  cela est l’apprentissage de la museliĂšre pour tous les chiens : un apprentissage, pas un mode de vie, fait bien avant et loin du vĂ©tĂ©rinaire. Le chien arrive alors muselĂ© aprĂšs une balade banale, sans qu’on ait besoin de le serrer, sans pression, sans que tout le monde sente la peur, et l’injection se fait tranquillement. Un chien qui a mal peut mordre de douleur, ce n’est pas sa faute ; mais un chien qu’on ne peut plus soigner finit par ne plus ĂȘtre soignĂ© du tout.

Les associations d’idĂ©es, et ce qu’elles coĂ»tent

Le chien associe toujours le contexte complet : situation, odeur, agissement, résultat. Cela produit aussi des dégùts involontaires.

L’exemple type : un chiot de deux mois Ă  qui on met un Ă -coup pour le faire marcher Ă  la jambe, alors qu’il est bien trop jeune pour comprendre l’exercice. Si une voiture passe Ă  cet instant, il n’associera pas l’à-coup Ă  sa position, dont il ne sait rien, mais Ă  la voiture. MĂȘme mĂ©canisme avec un chien, un humain, un chat qui passerait au mauvais moment. C’est ainsi qu’on fabrique des chiens rĂ©actifs.

D’oĂč la mĂ©thode d’analyse : ne restez pas sur la problĂ©matique visible, remontez le cheminement. En comprenant comment l’association s’est faite, vous pouvez l’inverser.

Deux usages, l’un à proscrire, l’autre valable

Le contre-exemple, tirĂ© du manuel : pour apprendre le rapport d’objet, le conducteur pince l’oreille du chien en disant “prends” ; le chien gĂ©mit, entrouvre la gueule, on y place l’objet, et le pincement cesse. Le chien apprend par renforcement nĂ©gatif Ă  Ă©viter le pincement. Ça marche, et c’est Ă  bannir : cela dĂ©truit prĂ©cisĂ©ment ce que le rapport d’objet doit construire, le partage, la rĂ©ponse Ă  des patrons moteurs, un lien fort.

L’usage acceptable, Ă  l’inverse : un chien qui connaĂźt parfaitement le rappel et ne revient pas. Longe, rappel, pas de retour, Ă -coup sur la longe ; pour Ă©viter l’à-coup, il reviendra au premier appel. Ce type de solution n’est envisageable que si l’ordre est rĂ©ellement installĂ©, si l’organisation familiale est en place, et donc si le chien peut interprĂ©ter son non-retour comme une dĂ©sobĂ©issance.

Un mot sur le matĂ©riel, dans le mĂȘme esprit. Un collier Ă©trangleur mal utilisĂ© dĂšs le dĂ©part, Ă  grands coups d’étranglement, est presque impossible Ă  rattraper : dans une famille oĂč cela s’est passĂ© ainsi, retirez-le, mettez un collier plat et interdisez-en l’usage. Ce n’est pas une position de principe contre l’outil, c’est une position contre les sĂ©vices dans l’apprentissage. On peut ĂȘtre ferme et intransigeant avec ceux qui font n’importe quoi sans pour autant se ranger dans un camp.

Rien n’est jamais interdit par principe, du moment que c’est pour le bien-ĂȘtre du chien et du maĂźtre : si l’un des deux est malheureux, ça ne fonctionne pas.