Examen standardisé

De jeunes adultes en Pologne assis pour leur maturité. La maturité est standardisée afin que les universités puissent facilement comparer les résultats des étudiants à travers tout le pays.

Un examen standardisé ou test standardisé est un examen étant administré et noté de manière cohérente ou standardisée. Les examens standardisés sont conçus de telle manière à ce que les questions ainsi que les interprétations soient uniformes, administrées et notées de manière standardisée et prédéterminée[1].

Un examen standardisé est administré et noté uniformément pour tous les candidats. Tout examen dans lequel le même examen est administré de la même manière à tous les candidats et noté de la même manière pour tout le monde, est un examen standardisé. Il ne s'agit pas nécessairement d'examens à enjeux élevés, d'examens à durée limitée, de questionnaires à choix multiples, d'examens académiques, ni d'examens administrés à un grand nombre de candidats. Les examens standardisés peuvent prendre diverses formes, dont l'écrit, l'oral, ou un examen pratique. L'examen standardisé peut évaluer de nombreux sujets, y compris la conduite, la créativité, l'athlétisme, la personnalité, la déontologie professionnelle, ainsi que les compétences académiques.

L'opposé des tests standardisés est le test non standardisé, dans lequel soit des tests significativement différents sont administrés à différents candidats, soit le même test est administré dans des conditions significativement différentes ou évalués différemment.

La plupart des interrogations et des tests quotidiens passés par les élèves à l'école correspondent à la définition d'un examen standardisé : tous les élèves de la classe passent le même test, au même moment, dans les mêmes circonstances, et tous les examens sont évalués par leur enseignant de la même manière. Toujours est-il que le terme examen standardisé ou test standardisé est le plus souvent utilisé pour désigner des tests administrés à de grands groupes, comme par exemple un test passé par tous les adultes souhaitant obtenir une licence pour exercer un emploi particulier, ou par tous les élèves d'un certain âge. La plupart des examens standardisés sont des évaluations sommatives (des évaluations considérant l'apprentissage des participants à la fin d'une unité pédagogique).

Parce que tout le monde reçoit le même examen ainsi que le même système de notation, les tests standardisés sont souvent perçus comme étant plus juste que les tests non standardisés. De tels examens sont souvent pensés comme étant plus objectifs qu'un système dans lequel certains candidats reçoivent un examen plus facile et d'autres reçoivent un examen plus difficile. Les tests standardisés sont conçus afin de permettre une comparaison fiable des résultats entre tous les candidats, car chacun passe le même test et est évalué de la même manière[2].

Définition

Deux hommes passent un test standardisé authentique, non écrit et basé sur des critères précis. S'ils pratiquent une réanimation cardiopulmonaire sur le mannequin avec la vitesse et la pression adéquates, ils réussiront cet examen.

La définition d'un test standardisé a quelque peu changé au fil du temps[3]. En 1960, les examens standardisés se définissent comme ceux où les conditions et le contenu sont identiques pour tous les candidats, quels que soient le moment, le lieu ou l'organisme qui administre le test ou l'évalue. Les examens standardisés utilisent une méthode de notation cohérente et uniforme[4]. Cela signifie que tous les candidats répondant à une question de la même manière aura la même note pour cette question. L'objectif de cette standardisation est d'assurer que les notes indiquent de manière fiable les aptitudes ou les compétences mesurées, et non d'autres variables[3].

Au début du XXIe siècle, l'accent se déplace d'une stricte uniformité des conditions vers une équité égale des conditions de test[5]. Par exemple, un candidat avec un poignet cassé pourrait écrire plus lentement en raison de sa blessure, et il serait plus équitable, et cela permettrait de mieux comprendre les connaissances réelles du candidat, de lui accorder quelques minutes supplémentaires pour noter ses réponses à un test à durée limitée. Modifier les conditions d'évaluation de manière à améliorer l'équité à l'égard d'une incapacité permanente ou temporaire, sans pour autant compromettre l'objectif principal de l'évaluation, s'appelle un accommodement. Cependant, si l'accommodement compromet l'objectif du test, alors les marges de tolérance deviendraient une modification du contenu, et non plus un examen standardisé.

Exemples de tests standardisés et non standardisés
Sujet Format Test standardisé Test non standardisé
Histoire Oral
Chaque étudiant reçoit les mêmes questions, et leurs réponses sont évaluées de la même manière. L'enseignant pose à chaque étudiant une question différente. Certains questions sont plus dures que les autres.
Conduite Compétences pratiques
Il est demandé à chaque élève de réaliser les mêmes choses, et ils sont tous évalués selon les mêmes critères. Certains élèves doivent conduire sur une autoroute, mais d'autres n'ont qu'à faire lentement le tour du pâté de maisons. Un examinateur retire des points pour « mauvaise attitude », mais d'autres examinateurs ne le font pas.
Mathématiques Écrit
Chaque étudiant reçoit les mêmes questions, et leurs réponses sont évaluées de la même manière. Le professeur donne des questions différentes à différents élèves : un test facile pour les élèves en difficulté, un autre test pour la plupart des élèves et un test difficile pour les meilleurs élèves.
Musique Audition
Tous les musiciens jouent le même morceau musical. Les juges se sont mis d'accord à l'avance sur l'importance relative de facteurs tels que le timing, l'expression et la musicalité. Chaque musicien choisit de jouer un morceau musical différent. Les juges choisissent le musicien qu'ils préfèrent. L'un d'eux accorde des points bonus aux musiciens costumés.

Histoire

Chine

Les premières traces de tests standardisés se trouvent en Chine, au cours de la dynastie Han, où les examens impériaux couvrent les six arts, qui comprennent la musique, le tir à l'arc, l'équitation, l'arithmétique, l'écriture et la connaissance des rituels et cérémonies des sphères publiques et privées[6]. Ces examens servent à sélectionner les employés de la bureaucratie d'État.

Par la suite, des sections portant sur les stratégies militaires, le droit civil, les recettes et la fiscalité, l'agriculture et la géographie furent ajoutées aux épreuves. Sous cette forme, les examens furent institutionnalisés pendant plus d'un millénaire.

De nos jours, les tests standardisés restent largement utilisés, notamment dans le système Gaokao.

Royaume-Uni

Les tests standardisés sont introduits en Europe au début du XIXe siècle, calqués sur les examens de mandarin chinois, grâce au soutien des administrateurs coloniaux britanniques, dont le plus « persistant » est le consul britannique à Guangzhou, en Chine, Thomas Taylor Meadows. Meadows met en garde contre l'effondrement de l'Empire britannique si des tests standardisés ne sont pas immédiatement mis en œuvre dans tout l'empire.

Avant leur adoption, les tests standardisés ne font traditionnellement pas partie de la pédagogie occidentale. Basés sur la tradition sceptique et ouverte du débat héritée de la Grèce antique, l'académie occidentale privilégie les évaluations non standardisées utilisant des dissertations rédigées par les élèves. En raison de cela, la première mise en œuvre européenne de tests standardisés n'a pas lieu en Europe proprement dite, mais en Inde britannique. Inspirés par l'usage des Chinois des tests standardisés, au début du XIXe siècle, les dirigeants d'entreprises britanniques utilisent des examens standardisés pour l'embauche et les promotions afin de garantir un processus équitable et exempt de corruption ou de favoritisme. Cette pratique des tests standardisés est ensuite adoptée à la fin du XIXe siècle sur le continent britannique. Les débats parlementaires qui s'ensuivent font de nombreuses références au « système mandarin chinois ».

Les tests standardisés se répandent depuis la Grande-Bretagne non seulement dans tout le Commonwealth britannique, mais en Europe ainsi qu'en Amérique. Sa propagation est alimentée par la révolution industrielle, où l'augmentation du nombre d'élèves scolarisés suite aux lois sur l'instruction obligatoire diminue le recours aux évaluations ouvertes, qui sont plus difficiles à produire en masse et à évaluer objectivement.

Pendant la Seconde Guerre mondiale, des soldats britanniques passent des tests standardisés. Cette nouvelle recrue trie des pièces mécaniques pour évaluer ses connaissances en mécanique. Son uniforme ne porte ni nom, ni grade, ni aucun autre signe distinctif susceptible d'influencer l'évaluation de son travail.

Des tests standardisés tels que les commissions de sélection du ministère de la Guerre se développent au sein de l'Armée britannique au cours de la seconde guerre mondiale dans le but de choisir des candidats à la formation d'officier ainsi que d'autres fonctions[7]. Ces tests évaluent les aptitudes mentales, les compétences techniques, le travail d'équipe et d'autres qualités des soldats. Les méthodes précédentes souffraient de biais et aboutissaient à une sélection inadéquate des soldats pour la formation d'officiers[7].

États-Unis

Les tests standardisés font partie du système éducatif américain depuis le XIXe siècle, or, le recours généralisé aux tests standardisés dans les écoles américaines est en grande partie un phénomène du XXe siècle.

L'immigration au cours du XIXe siècle contribue à la croissance des tests standardisés aux États-Unis. Des tests standardisés sont utilisés dès l'arrivée des personnes aux États-Unis afin d'évaluer leurs rôles sociaux et de déterminer leur pouvoir et leur statut social[8].

Le College Entrance Examination Board commence à proposer des tests standardisés pour l'admission à l'université et aux établissements d'enseignement supérieur en 1901, couvrant neuf sujets. Cet examen est mis en œuvre dans le but de créer des critères d'admission standardisés pour les universités d'élite du nord-est des États-Unis. À l'origine, ce test est également destiné aux meilleurs internats, afin d'harmoniser les programmes scolaires entre les établissements. À l'origine, les examens standardisés se composent de dissertations et ne se destinent pas à des tests à grande échelle.

Lors de la première guerre mondiale, les tests Alpha et Beta de l'armée sont conçus pour aider à affecter les nouvelles recrues à des postes appropriés en fonction de leur niveau d'intelligence évalué[9]. La première édition d'un test standardisé moderne de QI, l'échelle d'intelligence Stanford-Binet, apparaît en 1916. Le College Board conçoit ensuite le SAT (Scholar Aptitude Test) en 1926. Le premier test SAT est basé sur les tests de QI de l'armée, dans le but de déterminer l'intelligence et les aptitudes à résoudre des problèmes du candidat, ainsi que sa pensée critique. En 1959, Everett Lindquist propose l'ACT (American College Testing) pour la première fois. En 2020, l'ACT comprenait quatre sections principales avec des questions à choix multiples pour tester l'anglais, les mathématiques, la lecture et les sciences, plus une section d'écriture facultative.

Les États individuels commencent à tester un grand nombre d'enfants et d'adolescents par le biais des systèmes scolaires publics dans les années 1970. Dans les années 1980, les écoles américaines procèdent à des évaluations à l'échelle nationale[10]. En 2012, 45 États dépensent en moyenne 27 dollars par élève, soit 669 millions de dollars au total, pour les examens académiques annuels à grande échelle[11]. Cependant, les charges indirectes, telles que le paiement des professeurs afin de préparer les étudiants aux examens ainsi que pour le temps de classe consacré à l'administration des tests, dépassent largement la charge direct de l'examen lui-même[11].

La nécessité pour le gouvernement fédéral d'effectuer des comparaisons significatives au sein d'un système d'éducation publique très décentralisé (contrôlé localement) encourage le recours à des tests standardisés à grande échelle. La loi sur l'éducation élémentaire et secondaire de 1965 exige certains tests standardisés au sein des écoles publiques. La loi No Child Left Behind de 2001 conditionne en outre certains types de financement des écoles publiques aux résultats des tests standardisés. Sous ces lois fédérales, le programme scolaire reste du ressort de chaque État, mais le gouvernement fédéral exige que les États évaluent la qualité de l'enseignement dispensé par les écoles et les enseignants conformément aux programmes choisis par l'État avec des examens standardisés[12]. Les résultats des tests standardisés à l'échelle nationale servent à allouer des fonds et d'autres ressources aux écoles, et à fermer les écoles peu performantes. En fin 2015, la loi Every Student Succeeds Act remplace la loi No Child Left Behind[13]. À ce stade, ces tests standardisés à grande échelle deviennent controversés aux États-Unis, non pas nécessairement parce que tous les élèves passent les mêmes tests et sont notés de la même manière, mais parce qu'ils deviennent des tests à forts enjeux pour les systèmes scolaires et les enseignants.

Au cours des dernières années, de nombreuses universités américaines abandonnent l'exigence de résultats de tests standardisés pour les candidats[14].

Australie

Le programme australien d’évaluation nationale – Littératie et numératie (NAPLAN), un test standardisé, a été lancé en 2008 par l’Autorité australienne des programmes d’études, de l’évaluation et du rapport, une autorité indépendante « chargée de l’élaboration d’un programme d’études national, d’un programme d’évaluation national et d’un programme national de collecte et de rapport de données qui soutient l’apprentissage du 21e siècle pour tous les élèves australiens ».

Tous les élèves de 3e, 5e, 7e et 9e année des écoles australiennes sont évalués au moyen de tests nationaux. Les matières évaluées comprennent la lecture, l'écriture, les règles de la langue (orthographe, grammaire et ponctuation) et le calcul.

Le programme présente aux élèves des rapports de niveau conçus pour permettre aux parents de suivre les progrès de leur enfant tout au long de sa scolarité, et aide les enseignants à améliorer les opportunités d'apprentissage individuelles pour leurs étudiants. Les données relatives aux élèves et aux établissements scolaires sont également communiquées au système scolaire concerné, étant entendu qu'elles peuvent être utilisées pour cibler les soutiens et les ressources spécifiques vers les écoles qui en ont le plus besoin. Les professeurs ainsi que les écoles se servent de ces informations, en les combinant avec d'autres informations, afin de déterminer le niveau de performance de leurs élèves et d'identifier les domaines nécessitant une assistance.

Le concept de l'évaluation des résultats des élèves est désormais nouveau, bien que l'on peut dire que l'approche australienne actuelle trouve son origine dans les structures politiques éducatives actuelles aux États-Unis et au Royaume-Uni. Il existe plusieurs différences importantes entre le programme NAPLAN australien et les stratégies du Royaume-Uni et des États-Unis. Les écoles jugées sous-performantes en Australie bénéficieront d'une aide financière conformément à la politique actuelle du gouvernement fédéral.

Colombie

En 1968, l’Institut colombien d’évaluation de l’éducation a été créé pour réglementer l’enseignement supérieur. L'ancien système d'évaluation publique pour l'autorisation de fonctionnement et la reconnaissance légale des établissements et des programmes universitaires est mis en œuvre.

La Colombie dispose de plusieurs tests standardisés qui évaluent le niveau d'éducation dans le pays. Ces examens sont réalisés par l'Institut colombien d’évaluation de l’éducation.

Les élèves de troisième, cinquième et neuvième année passent l'examen « Saber 3°5°9° ». Ce test est actuellement administré sur ordinateur, selon des échantillons contrôlés et représentatifs. À la fin du lycée, les élèves présentent le « Sabre 11 » qui leur permet d'intégrer différentes universités dans le pays. Les élèves étudiant à distance peuvent passer cet examen pour obtenir leur diplôme d'études secondaires et leur certificat de fin d'études.

Les étudiants qui quittent l'université doivent passer l'examen « Saber Pro ».

Canada

Le Canada laisse l'éducation, et les tests standardisés qui en découlent, sous la compétence des provinces. Chaque province a son propre un régime de tests standardisés à l'échelle de la province, allant de l'absence de tests standardisés obligatoires pour les élèves de la Saskatchewan à des examens comptant pour 40 % de la note finale du secondaire à Terre-Neuve-et-Labrador[15].

Conception et notation

Conception

Le plus souvent, un examen universitaire majeur comprend des sections corrigées par des humains et des sections corrigées par ordinateur.

Un test standardisé peut comprendre des questions à choix multiple, des questions vrai ou faux, des questions de dissertation, des évaluations authentiques, ou presque toute autre forme d'évaluation. Les questions à choix multiples et les questions vrai/faux sont souvent choisies pour les tests passés par des milliers de personnes car elles peuvent être administrées et corrigées à moindre coût, rapidement, et de manière fiable grâce à l'utilisation de feuilles de réponses spéciales pouvant être lues par un ordinateur ou par le biais de tests adaptatifs informatisés. Certains examens standardisés comportent des épreuves de rédaction à réponse courte ou de dissertation auxquelles se voient attribuer une note par des évaluateurs indépendants qui utilisent des grilles d'évaluation (règles ou directives) et des exemples de documents de référence (exemples de documents pour chaque note possible) afin de déterminer la note à attribuer à une réponse.

Tout sujet

Affiche présentant les critères de réussite à l'examen de conduite à Taïwan. Toute personne souhaitant obtenir un permis de conduire passe le même examen et est notée de la même manière.

Tous les tests standardisés n'impliquent pas de répondre à des questions. Une évaluation authentique des compétences athlétiques peut prendre la forme d'une course pendant une durée déterminée, ou le dribble d'un ballon sur une certaine distance. Les professionnels de santé doivent réussir les tests prouvant qu'ils peuvent effectuer des interventions médicales. Les candidats au permis de conduire doivent réussir un examen standardisé montrant qu'ils peuvent conduire une voiture. Le test canadien standardisé de condition physique est utilisé dans la recherche médicale pour déterminer la condition physique des personnes testées[16].

Système de notation machine et humaine

Depuis la fin du XXe siècle, les tests standardisés à grande échelle sont en partie façonnés par la facilité et le faible coût de la correction des tests à choix multiples par ordinateur. La plupart des examens nationaux et internationaux ne sont pas pleinement évalués par les humains.

Les gens ont l'habitude de noter des éléments qui ne peuvent pas être notés facilement par ordinateur (tels que les dissertations). Par exemple, le Graduate Record Examination est une évaluation adaptative informatisée qui ne nécessite aucune correction humaine, sauf pour la partie rédactionnelle.

La notation humaine est relativement coûteuse et souvent variable, c'est pourquoi la notation informatique est privilégiée lorsque cela est possible. Par exemple, certains détracteurs déclarent que les employés mal payés obtiendront de mauvais résultats aux tests[17]. Le taux de concordance entre les correcteurs peut varier entre 60 et 85 %, selon le test et la session de correction. Pour les tests à grande échelle organisés dans les établissements scolaires, certains organismes financent la correction de chaque copie par deux correcteurs ou plus ; en cas de divergence, la copie est soumise à des correcteurs supplémentaires[17].

Bien que le processus soit plus difficile que la correction électronique de tests à choix multiples, les dissertations peuvent également être notées par ordinateur. Dans d'autres cas, les dissertations et autres réponses ouvertes sont notées selon une grille d'évaluation prédéterminée par des correcteurs formés. Par exemple, à Pearson, tous les correcteurs de dissertations sont titulaires d'un diplôme universitaire de quatre ans, et la majorité sont des enseignants actuels ou anciens[18].

Utilisation de grilles d'évaluation pour garantir l'équité

L'utilisation d'une grille d'évaluation vise à accroître l'équité lorsque la performance d'un candidat à un test est évaluée. Dans les tests standardisés, l'erreur de mesure (un schéma constant d'erreurs et de biais dans la notation du test) est facile à déterminer. Lorsque la note dépend des préférences individuelles des correcteurs, la note des candidats dépend de la personne qui corrige l'examen.

Certains tests standardisés utilisent des questionnaires à choix multiples, dont la correction est relativement peu coûteuse, mais toute forme d'évaluation peut être utilisée.

Les tests standardisés éliminent également les biais des correcteurs. Des études montrent que les enseignants créent une sorte de prophétie autoréalisatrice dans leur évaluation des candidats, attribuant des notes plus élevées à ceux dont ils anticipent la réussite et des notes plus basses à ceux dont ils prévoient l'échec[19]. Dans les évaluations non standardisées, les correcteurs disposent d'une plus grande latitude individuelle et sont donc plus susceptibles de produire des résultats injustes en raison de biais inconscients.

Exemple de notation pour la question d'histoire ouverte : Quelles sont les causes de la Seconde Guerre mondiale ?
Réponses de l'élève Évaluation standardisée Évaluation non standardisée
Grille d'évaluation : Les réponses doivent être considérées comme correctes si elles mentionnent au moins un des éléments suivants : invasion de la Pologne par l'Allemagne, invasion de la Chine par le Japon, ou problèmes économiques. Aucune norme de notation n'est établie. Chaque enseignant note comme il l'entend, en tenant compte des facteurs qu'il juge appropriés, tels que la réponse, l'effort fourni, le parcours scolaire de l'élève, ses compétences linguistiques ou son attitude.
Élève n° 1 : la Seconde Guerre Mondiale a été causée par Hitler ainsi que l'Allemagne envahissant la Pologne en 1939. Enseignant n° 1 : Cette réponse mentionne l'un des éléments requis, elle est donc correcte.

Enseignant n° 2 : Cette réponse est correcte.

Professeur n° 1 : Je trouve cette réponse satisfaisante, je la considère donc comme correcte.

Professeur n° 2 : Cette réponse est correcte, mais cet élève devrait pouvoir faire mieux, je ne lui accorde donc que des points partiels.

Élève n° 2 : la Seconde Guerre Mondiale a été causée par de multiples facteurs, dont la Grande Dépression ainsi que la situation économique générale, l'essor du socialisme national, le fascisme, et l'expansionnisme impérialiste, ainsi que les ressentiments non résolus liés à la Première Guerre Mondiale. Enseignant n° 1 : Cette réponse mentionne l'un des éléments requis, elle est donc correcte.

Enseignant n° 2 : Cette réponse est correcte.

Professeur n° 1 : Je trouve cette réponse correcte et complète, je vous attribue donc la note maximale.

Professeur n° 2 : Cette réponse est correcte, je vous attribue donc la note maximale.

Élève n° 3 : la Seconde Guerre Mondiale a été causée par l'assassinat de l'archiduc Ferdinand en 1914. Enseignant n° 1 : Cette réponse ne mentionne aucun des éléments requis. Aucun point.

Enseignant n° 2 : Cette réponse est incorrecte. Aucun point.

Professeur n° 1 : Cette réponse est incorrecte. Aucun point.

Professeur n° 2 : Cette réponse est incorrecte, mais l’élève a fait de son mieux et la phrase est grammaticalement correcte. J’accorde donc un point pour l’effort.

Utilisation des scores à des fins de comparaison

Il existe deux types d'interprétations de la note : une interprétation de la note par rapport à une norme ou une interprétation de la note par rapport à un critère[4].

  • L'interprétation des notes par rapport aux normes compare les candidats à un échantillon de pairs[4]. L'objectif est de classer les candidats comme étant meilleurs ou pires que d'autres. L'interprétation des notes aux tests normatifs est associée à l'enseignement traditionnel. Ceux qui obtiennent de meilleurs résultats que les autres réussissent le test, et ceux qui obtiennent de moins bons résultats échouent.
  • L'interprétation des notes par rapport à un critère compare les candidats à un critère (une définition formelle du contenu), indépendamment des notes des autres candidats[4]. On peut également les décrire comme des évaluations basées sur des normes, car elles s'inscrivent dans le mouvement de réforme de l'éducation fondée sur des normes. L'interprétation des notes par critères se concentre uniquement sur la justesse et l'exhaustivité de la réponse de l'élève concerné. Dans un système d'évaluation par critères, il est possible que tous les candidats réussissent ou échouent au test.

L'un ou l'autre de ces systèmes peut être utilisé dans le cadre d'évaluations standardisées. L'important, pour les évaluations standardisées, est de s'assurer que tous les élèves se voient poser les mêmes questions, dans des conditions raisonnablement équivalentes, et évalués selon les mêmes normes.

Un test normatif peut être conçu pour déterminer où se situe le candidat le long d'une courbe normale.

Une évaluation normative compare chaque candidat aux autres candidats. Un test normé est un type de test, d'évaluation ou d'examen qui permet d'estimer la position de l'individu testé au sein d'une population prédéfinie. Cette estimation est obtenue à partir de l'analyse des résultats et d'autres données pertinentes issues d'un échantillon représentatif de la population. Ce type de test permet de déterminer si le candidat a obtenu des résultats supérieurs ou inférieurs à ceux des autres personnes ayant passé ce test. Un test de QI est un test standardisé normé.

La comparaison avec les autres rend les tests standardisés normés utiles à des fins d'admission dans l'enseignement supérieur, où une école essaie de comparer les étudiants de partout au pays ou du monde entier. La standardisation garantit que tous les élèves sont évalués de manière égale, et le référencement normatif permet d'identifier les élèves les plus performants et les moins performants. Parmi les exemples de tests de référence internationaux, on peut citer l'Étude internationale sur les tendances en mathématiques et en sciences (TIMSS) et le Programme international de recherche en lecture scolaire.

Les analyses d'eau utilisent des tests de référence critériés, car il est plus important de déterminer si l'eau locale est potable que de la comparer à l'eau d'un autre endroit.

Un test critérié est un style de test qui utilise les scores du test pour montrer comment les candidats ont réussi à effectuer une tâche donnée, et non comment ils ont réussi par rapport aux autres candidats. La plupart des examens et des questionnaires conçus par les enseignants sont des tests critériés. Dans ce cas, l'objectif est simplement de vérifier si le candidat peut répondre correctement aux questions. Le concepteur du test ne cherche généralement pas à comparer les résultats de chaque candidat avec ceux des autres.

Normes

Les considérations de validité et de fidélité sont généralement considérées comme des éléments essentiels pour déterminer la qualité de tout test standardisé. Cependant, les associations professionnelles et de praticiens replacent fréquemment ces préoccupations dans des contextes plus larges lorsqu'elles élaborent des normes et portent des jugements globaux sur la qualité de tout test standardisé dans son ensemble, au sein d'un contexte donné.

Normes d'évaluation

Dans le domaine de la psychométrie, les Standards for Educational and Psychological Testing (« Normes relatives aux tests éducatifs et psychologiques ») définissent des critères de validité et de fidélité, ainsi que des normes relatives aux erreurs de mesure et aux aménagements pour les personnes en situation de handicap. Le troisième et dernier grand thème aborde les normes relatives aux applications des tests, à la certification, ainsi qu’à l’évaluation des programmes et aux politiques publiques.

Dans le domaine de l'évaluation, et en particulier l'évaluation pédagogique, le Comité mixte sur les normes d'évaluation de l'éducation a publié trois recueils de normes d'évaluation. The Personnel Evaluation Standards (« Les normes d'évaluation du personnel ») paraît en 1988, la deuxième édition paraît en 1994 et The Student Evaluation Standards (« Les normes d'évaluation des élèves ») paraît en 2003.

Chaque publication présente un ensemble de normes applicables dans divers contextes éducatifs. Ces normes fournissent des lignes directrices pour la conception, la mise en œuvre, l'évaluation et l'amélioration de la forme d'évaluation identifiée. Chaque norme est classée dans l'une des quatre catégories fondamentales afin de promouvoir des évaluations pédagogiques pertinentes, utiles, réalisables et précises. Dans ces ensembles de normes, les questions de validité et de fiabilité sont abordées dans la section consacrée à la précision. Les tests sont conçus pour fournir des informations fiables, précises et crédibles sur l'apprentissage et les performances ; cependant, la plupart des tests scolaires (standardisés ou non) offrent une vision limitée des acquis. Se fier à une vision étroite et purement académique des acquis ne permet pas de refléter pleinement le potentiel de réussite d'une personne (par exemple, en n'évaluant pas le savoir-être ni les aptitudes transversales)[20].

Validité statistique

Les militaires du rang passent un test standardisé sur papier, à choix multiples, dans l'espoir d'obtenir une promotion. Ils répondent tous aux mêmes questions et sont notés de la même manière.

L'un des principaux avantages des tests standardisés à grande échelle est que les résultats peuvent empiriquement être documentés ; par conséquent, il est possible de démontrer que les résultats des tests présentent un degré relatif de validité et de fidélité, ainsi que des résultats généralisables et reproductibles[21]. On oppose souvent ce système aux notes figurant sur le bulletin scolaire, attribuées par chaque enseignant. L'analyse des notes individuelles peut rendre difficile la prise en compte des différences de culture éducative entre les établissements, du niveau de difficulté des devoirs donnés par un enseignant, des variations de style pédagogique, des pressions en faveur de la surévaluation des notes, ainsi que d'autres techniques et biais influençant la notation.

Un autre avantage est l'agrégation. Un test standardisé bien conçu permet d'évaluer la maîtrise d'un domaine de connaissances ou de compétences par un individu. L'agrégation de ces données, à un certain niveau, fournit des informations utiles. Autrement dit, si les évaluations individuelles peuvent manquer de précision pour des applications pratiques, les scores moyens de classes, d'établissements scolaires, de succursales d'une entreprise ou d'autres groupes peuvent s'avérer très instructifs grâce à la réduction des erreurs obtenue par l'augmentation de la taille de l'échantillon.

Problèmes de test non spécifiques à la normalisation

La plupart des examens peuvent être classés en plusieurs catégories. Par exemple, un test peut à la fois être un test standardisé ainsi qu'un test à enjeux élevés, ou un test standardisé et un questionnaire à choix multiples. Les critiques formulées à l'encontre des « tests standardisés » (tous les candidats passent le même test, dans des conditions raisonnablement similaires, et sont notés de la même manière) portent souvent sur des préoccupations sans rapport avec la standardisation et s'appliquent tout autant aux tests non standardisés. Par exemple, un détracteur peut bien se plaindre que « tous les tests standardisés sont des tests à durée limitée » (une critique qui est vraie pour beaucoup, mais pas pour tous, les tests standardisés annuels administrés par les écoles), mais la critique porte essentiellement sur la limite de temps, et non sur le fait que tout le monde passe le même test et que ses réponses sont notées de la même manière.

Tests à enjeux élevés

Types d'examens
Test à faible enjeu Test à enjeux élevés
Test standardisé Un test de personnalité en ligne Un examen d'entrée à l'université pour déterminer l'admission
Test non standardisé L'enseignant demande à chaque élève de partager ce qu'ils retiennent de leurs devoirs Le théâtre organise une audition pour déterminer qui obtiendra un rôle principal

Un test à enjeux élevés est un test dont la bonne performance est assortie d'une récompense attendue[4]. Certains examens standardisés, dont de nombreux tests utilisés pour l'admission à l'université à travers le monde, sont des tests à enjeux élevés. La plupart des examens standardisés, tels que les quiz ordinaires en classe, sont des tests à faible enjeu[4].

Le recours excessif aux tests standardisés à enjeux élevés pour la prise de décision est souvent controversé. On reproche fréquemment à ces tests de ne mesurer la performance que lors d'un événement ponctuel (par exemple, une audition), alors que les critiques estiment qu'une évaluation plus globale serait plus appropriée. Ces critiques proposent souvent de privilégier des mesures cumulatives, voire non numériques, telles que les notes obtenues en classe ou de brèves évaluations individuelles (rédigées par écrit) par les enseignants. Les partisans, quant à eux, affirment que les résultats aux tests constituent un critère clair et objectif, un garde-fou précieux contre la surévaluation des notes[22].

Tests normatifs

Une course à pied est un test authentique, normé et référencé. Le but de la course est de voir qui court le plus vite, plutôt que de voir que tout le monde puisse courir à une certaine vitesse.

Un test normatif est un test conçu et noté de telle sorte que certains candidats obtiennent de meilleurs ou de moins bons résultats que d'autres[4]. Le classement fournit des informations concernant le classement relatif, ce qui est utile lorsque l'objectif est de déterminer qui est meilleur (par exemple, dans le cadre des admissions dans les universités d'élite)[4].

Désaccord avec les normes éducatives

Un test critérié est plus courant et plus pratique lorsque l'objectif est de savoir si les candidats maîtrisent la matière requise[4]. Par exemple, si le but est de savoir si quelqu'un sait faire un créneau, alors un test de conduite standardisé consiste à faire garer la voiture à la personne et évalue sa performance en fonction de la justesse et de la sécurité de la manœuvre.

Toujours est-il que certains détracteurs s'opposent aux tests standardisés non pas parce qu'ils s'opposent à ce que les élèves passent le même test dans des conditions raisonnablement similaires et que les réponses soient notées de la même manière, mais parce qu'ils s'opposent au type de contenu généralement évalué par les écoles. Pour reprendre l'exemple du test de conduite, un détracteur pourrait dire qu'il n'est point nécessaire de savoir si l'élève conducteur est capable de se garer en créneau. Dans un contexte éducatif, certains pourraient souhaiter que les compétences non académiques, ou compétences relationnelles, soient évaluées. Bien qu'il existe des tests standardisés mesurant ces compétences, comme les tests de créativité de Torrance, les établissements scolaires font rarement passer de tests standardisés pour évaluer « l'initiative, la créativité, l'imagination, la curiosité, la bienveillance, la réflexion éthique, ou une multitude d'autres qualités et dispositions précieuses »[23],[24]. En revanche, les tests administrés par les écoles ont tendance à moins se concentrer sur le développement moral ou du caractère, et davantage sur des compétences académiques individuelles identifiables, telles que la compréhension de la lecture et l'arithmétique.

Anxiété liée aux examens

Même lorsque le candidat est bien préparé, le trac et d'autres formes d'anxiété sociale liées à l'évaluation peuvent entraîner une sous-performance.

Certains individus deviennent anxieux lorsqu'ils passent un examen. Entre dix et quarante pour cent des étudiants ressentent de l'anxiété liée aux examens[25]. L'anxiété liée aux examens concerne aussi bien les tests standardisés que les tests non standardisés.

L'anxiété liée aux examens peut survenir dans n'importe quelle situation dans laquelle la personne pense être jugée par les autres, surtout s'ils estiment qu'il est peu probable qu'ils reçoivent une évaluation favorable[26]. Ce phénomène plus fréquent pour les examens à forts enjeux que pour les examens à faibles enjeux. Les tests à enjeux élevés (qu'ils soient standardisés ou non) peuvent causer de l'anxiété liée aux examens. Les enfants vivant dans la pauvreté sont plus susceptibles d'être affectés par l'anxiété liée aux examens que les enfants issus de familles plus aisées[27].

Certains étudiants déclarent de « mauvais candidats aux examens », voulant dire qu'ils deviennent nerveux et déconcentrés pendant les examens. Par exemple, lors d'un examen de conduite standardisé, l'élève conducteur peut être tellement nerveux à l'idée de l'examen qu'il commet des erreurs. Par conséquent, bien que le test soit standardisé et devrait fournir des résultats équitables, les candidats affirment être désavantagés par rapport aux candidats moins nerveux.

Questionnaires à choix multiples et formats de tests

Les questionnaires à choix multiples peuvent être des tests standardisés ou non standardisés.

Un questionnaire à choix multiples propose au candidat des questions associées à une liste prédéfinie de réponses possibles. Il s'agit d'une question fermée. Le candidat choisit la bonne réponse dans la liste.

De nombreux détracteurs des tests standardisés s'opposent au format à choix multiples, couramment utilisé pour les tests à grande échelle et peu coûteux, mais inadapté à certains objectifs, comme évaluer la capacité d'un candidat à rédiger un paragraphe. Cependant, les tests standardisés peuvent utiliser n'importe quel format, y compris les questions ouvertes, pourvu que tous les candidats passent le même test, dans des conditions raisonnablement similaires, et soient évalués de la même manière.

Enseignement axé sur l'examen

L'enseignement axé sur l'examen consiste à restreindre délibérément l'enseignement aux seuls éléments qui seront évalués lors de l'examen. Par exemple, si l'enseignant sait qu'un prochain examen d'histoire ne comprendra aucune question concernant l'histoire de la musique ou de l'art, alors l'enseignant pourrait « enseigner pour l'examen » en omettant les notions de musique et d'art présentes dans le manuel scolaire. Les critiques reprochent également aux tests standardisés d'encourager un enseignement axé sur la réussite au test, au détriment de la créativité et d'une étude approfondie des sujets non évalués. Selon eux, cet enseignement défavorise les apprentissages de haut niveau ; il transforme le contenu des programmes et limite considérablement les connaissances que les élèves acquièrent au fil des années. S’il est possible d’utiliser un test standardisé sans que son contenu détermine les programmes et l’enseignement, fréquemment, ce qui n’est pas testé n’est pas enseigné, et la manière dont la matière est testée devient souvent un modèle pour l’enseignement de cette matière.

La rémunération basée sur les résultats est l'idée selon laquelle les professeurs devraient être mieux payés si les étudiants obtiennent de bons résultats aux tests, et moins si leurs résultats sont médiocres. Lorsque les enseignants ou les écoles sont récompensés pour leurs meilleurs résultats aux tests, alors ces récompenses incitent les enseignants à « enseigner pour l'examen » au lieu de proposer un programme d'études riche et diversifié. En 2007, une étude qualitative réalisée par Au Wayne démontre que les tests standardisés restreignent le programme scolaire et encourage un enseignement centré sur l'enseignant plutôt qu'un apprentissage centré sur l'élève[28]. Le gouverneur du New Jersey, Chris Christie, propose une réforme de l'éducation qui contraindrait les enseignants non seulement à « préparer les élèves aux examens », mais aussi à obtenir de meilleurs résultats de leurs élèves, au risque de voir leur salaire et leur emploi menacés. Cette réforme préconise une rémunération au mérite, indexée sur les performances des élèves aux tests standardisés et sur leurs progrès scolaires[29].

Les critiques affirment que le recours excessif et le mauvais usage de ces tests nuisent à l'enseignement et à l'apprentissage en restreignant le programme scolaire. D'après le groupe FairTest, lorsque les tests standardisés constituent le principal facteur de responsabilisation, les écoles utilisent ces tests pour définir de manière restrictive les programmes et orienter l'enseignement. L'obligation de rendre des comptes engendre une pression immense sur la performance, ce qui peut conduire à une utilisation abusive et à une mauvaise interprétation des tests standardisés.

Articles connexes

  • Évaluation - Caractériser et évaluer quelque chose
  • Psychométrie - Théorie et technique de la mesure psychologique
  • Examen - Évaluation pédagogique
  • Loi de Campbell - Adage sur les incitations perverses
  • Pédagogisme (réforme de l'éducation fondée sur des normes) - Système éducatif fondé sur les objectifs souhaités

Notes et références

  1. (en) « Why standardized tests don't measure educational quality » [« Pourquoi les tests standardisés ne mesurent pas la qualité de l'éducation »], Educational Leadership,‎ , p. 8–15
  2. (en) Richard PHELPS, « The Role and Importance of Standardized Testing in the World of Teaching and Training » [« Le rôle et l'importance des tests standardisés dans le monde de l'enseignement et de la formation »] Accès libre,
  3. (en) Amy Olson et Darrell Sabers, « Standardized Tests », dans Thomas Good, 21st Century Education : A Reference Handbook [« L'éducation au XXIe siècle : un manuel de référence »], , 1032 p. (ISBN 9781452265995, lire en ligne), p. 423
  4. (en) Amanda Ross, « Low-Stakes Tests and Labels », dans Donald Allen et Amanda Ross, Pedagogy and Content in Middle and High School Mathematics [« Pédagogie et contenu des mathématiques au collège et au lycée »] (ISBN 978-94-6351-137-7, lire en ligne), p. 187
  5. (en) Ember Smith et Richard Reeves, « SAT math scores mirror and maintain racial inequity » [« Les scores en mathématiques du SAT reflètent et perpétuent les inégalités raciales. »] Accès libre,
  6. (en) « Chinese civil service » [« Fonction publique chinoise »] Accès libre
  7. (en) Richard Trahair, Behavior, Technology, and Organizational Development : Eric Trist and the Tavistock Institute [« Comportement, technologie et développement organisationnel : Eric Trist et l'Institut Tavistock »], , 352 p. (ISBN 9781412855495)
  8. (en) Mark Garrison, A Measure of Failure : The Political Origins of Standardized Testing [« Une mesure de l'échec : les origines politiques des tests standardisés »],
  9. (en) « A Nation of Morons » [« Une nation d'imbéciles »], New Scientist,‎ , p. 349–352
  10. (en) Richard Stiggins, « Assessment Crisis : The Absence of Assessment for Learning » [« Crise de l'évaluation : l'absence d'évaluation au service de l'apprentissage »], Phi Delta Kappan, vol. 83, no 10,‎ , p. 758-765 (lire en ligne Accès libre [PDF])
  11. (en) « Five reasons standardized testing isn't likely to let up » [« Cinq raisons pour lesquelles les tests standardisés ne sont pas près de s'atténuer »] Accès payant, sur The Washington Post,
  12. (en) Jacqueline Chinappi, « History & Background of the No Child Left Behind Act, Including Pros and Cons » [« Historique et contexte de la loi « No Child Left Behind », y compris ses avantages et ses inconvénients »] Accès libre
  13. (en) « Every Student Succeeds Act (ESSA) » Accès libre
  14. (en) « The beginning of the end of our obsession with standardized tests » [« Le début de la fin de notre obsession pour les tests standardisés »] Inscription nécessaire, sur The Washington Post,
  15. (en) Peter Cowley et Paige MacPherson, Testing Canadian K-12 Students Regional Variability, Room for Improvement : a Cross-Canada Comparison of K-12 Provincial Assessment Programs [« Évaluation des élèves canadiens de la maternelle à la 12e année : variabilité régionale et marge de progression : une comparaison pancanadienne des programmes provinciaux d’évaluation de la maternelle à la 12e année »], (ISBN 978-0-88975-694-6, lire en ligne)
  16. (en) « Physiological profile of fire fighters compared to norms for the Canadian population » [« Profil physiologique des pompiers comparé aux normes de la population canadienne »], Canadian Journal of Public Health,‎ , p. 50–52
  17. (en) Jolayne Houtz, « Temps spend just minutes to score state test ; A WASL math problem may take 20 seconds; an essay, 2 1/2 minutes » [« Les candidats passent quelques minutes à corriger un test d'État ; un problème de maths WASL peut prendre 20 secondes ; une dissertation, 2 minutes et demie. »] Accès libre,
  18. (en) « Grading the Common Core: No Teaching Experience Required » [« Évaluation des normes communes : aucune expérience d’enseignement requise »] Inscription nécessaire, sur The New York Times,
  19. (en) Lee Jussim, « Teacher expectations: Self-fulfilling prophecies, perceptual bias, and accuracy » [« Attentes des enseignants : prophéties autoréalisatrices, biais perceptuels et exactitude »], Journal of Personality and Social Psychology,‎ , p. 469–480
  20. (en) Hani Morgan, « Relying on High-Stakes Standardized Tests to Evaluate Schools and Teachers: A Bad Idea » [« S'appuyer sur des tests standardisés à enjeux élevés pour évaluer les écoles et les enseignants : une mauvaise idée »], The Clearing House: A Journal of Educational Strategies, Issues and Ideas, vol. 89, no 2,‎ , p. 67-72
  21. (en) Nathan Kuncel et Sarah Hezlett, « Standardized Tests Predict Graduate Students' Success » [« Les tests standardisés permettent de prédire la réussite des étudiants diplômés »], Science, vol. 315, no 5815,‎ , p. 1080-1081
  22. (en) Measuring Success : Testing, Grades, and the Future of College Admissions [« Mesurer la réussite : tests, notes et avenir des admissions universitaires »], , 344 p. (ISBN 9781421424965)
  23. (en) Alfie Kohn, The Case Against Standardized Testing : Raising the Scores, Ruining the Schools [« Plaidoyer contre les tests standardisés : hausse des scores, ruine des écoles »], , 94 p. (ISBN 9780325003252)
  24. (en) William Ayers, To Teach : The Journey of a Teacher [« Enseigner : la journée d'un enseignant »], , 168 p. (ISBN 9780807739853), p. 116
  25. (en) Sarah Wood, Sara Hart, Callie Little et Beth Phillips, « Test anxiety and a high-stakes standardized reading comprehension test : A behavioral genetics perspective » [« Anxiété liée aux tests et test standardisé de compréhension de lecture à enjeux élevés : une perspective de génétique comportementale »], Merrill Palmer Q,‎ , p. 233-251
  26. (en) Moshe Zeidner, Test Anxiety : The State of the Art [« Anxiété liée aux examens : l'état de l'art »] (lire en ligne), p. 56
  27. (en) Grace Tatter, « Tests and Stress Bias : Strengthening the correlation between student stress levels and high-stakes tests » [« Biais liés aux tests et au stress : Renforcer la corrélation entre le niveau de stress des étudiants et les tests à enjeux élevés »] Accès libre,
  28. (en) Wayne Au, « High-Stakes Testing and Curricular Control : A Qualitative Metasynthesis » [« Évaluations à enjeux élevés et contrôle des programmes d'études : une métasynthèse qualitative »], Educational Researcher, vol. 36, no 5,‎ , p. 258-267
  29. (en) Matt Arco, « Christie blasts teacher unions as he pitches national education plan in Iowa » [« Christie s'en prend aux syndicats d'enseignants lors de la présentation de son plan national pour l'éducation dans l'Iowa. »] Accès libre,
  • icône décorative Portail de l’éducation