Liste Swadesh


La liste Swadesh est une liste de mots appartenant à une partie du lexique la plus résistante au changement, établie par le linguiste et anthropologue américain Morris Swadesh, dans les années 1940-1950. Elle s'utilise en linguistique comparée, linguistique historique ainsi qu'en anthropologie notamment pour identifier le lexique fondamental de toute langue étudiée pour la première fois, ainsi qu'établir le degré de proximité de deux ou plusieurs langues.

Établissement de la liste

Swadesh étudia de nombreuses langues, surtout une vingtaine de langues amérindiennes du Canada, des États-Unis et du Mexique. Devant faire des recherches sur des langues presque éteintes, avec des moyens limités, il éprouva le besoin d’une procédure standardisée pour rassembler des données essentielles concernant la parenté entre langues. À cet effet, il créa une liste de mots selon le postulat suivant :

Bien que des mots disparaissent de toute langue, étant remplacés par d’autres au cours du temps, certaines parties du lexique sont moins exposées au changement que d’autres. C’est pourquoi on peut définir un lexique de base se rapportant à des notions véhiculées dans toutes les langues. Les pronoms, les numéraux, certains adjectifs (« grand », « petit », « long », « court »), certains termes désignant des degrés de parenté (« mère », « père »), des parties du corps (« œil », « oreille », « tête »), des événements ou des objets naturels (« pluie », « pierre », « étoile »), des états et des actions élémentaires (« voir », « entendre », « venir », « donner ») sont peu sujets au remplacement par des emprunts.

Par exemple, le lexique général de l’anglais est emprunté à 50 % environ, mais ce pourcentage diminue à 6 % pour ce qui est du lexique de base. Ainsi, dans la liste Swadesh de 100 mots de l’anglais, il n’y a qu’un seul mot qui ne provienne pas du lexique de base proto-germanique (mountain – « montagne », d’origine française, introduit par les Normands). Un autre exemple est celui de l’albanais et du grec moderne. L’albanais a perdu 90 % de ses mots propres d’origine indo-européenne, beaucoup plus que le grec, mais si l’on considère la liste Swadesh de 100 mots, le pourcentage de pertes est à peu près égal pour les deux langues (25 à 26 %).

[réf. nécessaire]

Pour créer sa liste, Swadesh a choisi un lexique de base que l’on retrouve dans le plus de langues possible, le plus indépendant possible de l’environnement naturel et de la culture locale. Il a commencé par une liste de 225 mots[1], qu’il a réduite plus tard à 215[2], puis à 200[3], arrivant finalement à une variante de 100 mots[4]. On utilise fréquemment une liste de 207 mots, formée de la liste de 200, plus sept de la liste de 100 absents de celle de 200[5].

Utilisation

Mesure du degré de parenté de deux langues

Swadesh a utilisé sa liste pour mesurer la ressemblance, c’est-à-dire le degré de parenté de deux langues, par la méthode quantitative de la lexicostatistique, en établissant le pourcentage de mots d’origine commune. Plus la ressemblance entre les lexiques des deux langues est grande, plus elles sont proches génétiquement, et plus le temps écoulé depuis le moment où elles se sont séparées est court. Selon lui, si le lexique de base de deux langues contient des mots apparentés à raison de 70 %, on peut considérer qu’elles ont évolué à partir d’une même langue. Si ce pourcentage dépasse 90 %, alors ces langues sont des parentes proches.

Établir le degré de proximité de deux ou plusieurs langues données permet ensuite d'établir, à partir d’une matrice de ressemblances quantitativement pertinentes, un dendrogramme à portée phénétiques ou cladistiques des langues comparées. L'élicitation des concepts de la liste dans un ensemble précis de langues permet donc de mesurer les distances interlinguistiques à des fins phylogénétiques.

Datation des langues d’origine (la glottochronologie)

Dans ce but, Swadesh a pris comme postulat que le taux de perte du lexique de base initial ne change pratiquement pas, les mots étant remplacés à un rythme à peu près constant, alors que dans le cas du reste du lexique, qui est étroitement lié à des facteurs culturels, le taux de perte variant en fonction des contacts que les locuteurs ont eu avec des cultures qui leur sont étrangères. À cause de ce postulat, la méthode de datation des langues proposée par Swadesh fut comparée à la détermination de l’âge des fossiles à partir de la désintégration radioactive du carbone 14, qui est constante.

À la suite d’une recherche sur treize langues (indo-européennes pour la plupart mais incluant le chinois[note 1]) qui ont des attestations écrites sur une longue période, à partir de la liste Swadesh de 100 mots, on a calculé un taux de conservation de 86 % sur une période de 1 000 ans, qu’on a considéré comme constant et généralisé à toutes les langues.

Étant donné le pourcentage de mots d’origine commune et le taux de conservation du lexique de base sur 1 000 ans, le temps écoulé depuis la séparation de deux langues qui résultent d’une même langue d’origine peut être déterminé, avec une marge d’erreur calculable, selon la formule :

t = (log c) / (2 log r),

où c est le pourcentage de mots d’origine commune et r – le taux de conservation.

Par exemple, si le lexique de base de deux langues est apparenté à 70 %, alors on peut considérer qu’elles ont évolué à partir d’une même langue qui a existé douze siècles auparavant.

Discussions sur la pertinence de la liste

L’utilisation de la liste Swadesh fut contestée dès le début. On lui oppose les objections suivantes :

  • Le lexique de base n’est pas exempt d’emprunts de manière égale dans toutes les cultures. Par exemple, un objet naturel comme le soleil peut tenir du lexique religieux (tel est le cas en Asie du Sud) et, de ce fait, sa dénomination est empruntée. Par ailleurs, des mots du lexique de base peuvent devenir tabous et être remplacés par d’autres, d’une langue voisine, pour compenser l’interdiction. Le lexique de base n’est pas non plus indépendant du statut socio-culturel des locuteurs. Par exemple, dans le lexique de base des langues dravidiennes, il y a relativement beaucoup d’emprunts au sanskrit, d’autant plus que le locuteur est plus instruit[7].
  • Certains mots ne se retrouvent pas dans toutes les langues, à cause de spécificités de l’environnement naturel, par exemple du climat[8]. Ainsi, les mots « neige » et « glace » sont-ils absents des langues des tropiques. De plus, dans la liste de 207 mots, il y a des mots qui ne se retrouvent pas dans toutes les langues pour des raisons culturelles (Swadesh lui-même a réduit sa liste à cent mots).
  • Un mot peut avoir pour correspondant dans une autre langue, non pas un mot, mais plusieurs, voire des affixes, parmi lesquels il faut choisir, ce qui rend plus arbitraire la comparaison des langues[9].
  • Il est fort peu probable que le taux de conservation soit constant pour toutes les langues et à toutes les époques[8]. Dans des conditions particulières qui tiennent de l’isolement du groupe de locuteurs, de sa cohésion sociale, de l’éventuelle observation d’une norme littéraire ou religieuse, ce taux peut varier considérablement[10]. Il existe en Europe l'exemple de l’islandais, langue d’une stabilité exceptionnelle, ce qui invalide partiellement la méthode, infirmant son universalité. En effet, le taux de perte de l’islandais n’est que de 4 %, alors que celui du norvégien littéraire est de 20 %, bien que ces deux langues soient très proches génétiquement l’une de l’autre[11].
  • L’identification des mots apparentés est problématique. Lorsqu’on applique la technique de la lexicostatistique, à défaut d’une autre possibilité, sur une aire géographique très étendue et sur des centaines de langues pour lesquelles l’information est très lacunaire, les descriptions étant partielles et récentes, il est impossible, faute de matière première, d’établir les lois des changements phonétiques. De ce fait, l’élimination du lexique emprunté, qui devrait se fonder sur la connaissance de ces lois, est très difficile. Par conséquent, l’identification du lexique réellement apparenté et, donc, hérité en parallèle, est problématique.
  • L’identification des mots apparentés est en général aléatoire[10]. Des mots très différents peuvent avoir la même origine, par exemple le mot français « chef » (au sens premier de « tête ») et le mot anglais head « tête ». Les deux proviennent de la racine indo-européenne *kauput-, *kaput-. En revanche, des mots qui se ressemblent peuvent ne pas être directement apparentés, par exemple le mot latin dies et l’anglais day, les deux signifiant « jour ». Le mot latin a pour origine *dyḗws « ciel », et l’anglais – *dʰegʷh- « brûler, brûlant ». Un autre exemple de ressemblance sans fondement est le latin habere et l’allemand haben « avoir ». L’origine du mot latin est *gʰh₁bʰ- « prendre » et celle du mot allemand – *keh₂p- « saisir, attraper ».[réf. nécessaire]

Malgré les objections, on reconnaît que la liste Swadesh et la lexicostatistique peuvent servir pour les investigations linguistiques de base, dans les situations où ni les techniques comparatives classiques ni la reconstitution interne ne sont praticables, ce qui était d’ailleurs l’idée de départ de Swadesh[8], ou comme simple outil de classification génétique préliminaire en anthropométrie[12],[13].

Un exemple d’une telle situation est celui où l’on ne dispose que de listes incomplètes de lexique, comme dans le cas de groupes de langues très grands, récemment attestées, telles les langues austronésiennes (1 000 environ) ou celles des aborigènes d'Australie (autour de 250). Pour de telles langues, la liste Swadesh peut être utilisée pour faire une première ébauche de leur répartition en groupes et sous-groupes, servant de point de départ pour une investigation historique à part entière, qui continue les classements et les reconstitutions.

Développements de la liste Swadesh

À partir des mêmes principes, d’autres linguistes ont à leur tour élaboré des listes de lexique de base, en éliminant des mots de la liste Swadesh et en introduisant d’autres mots et/ou sens. Un exemple est la liste de 114 sens proposée par une équipe de l’Université russe d’État de sciences humaines[14], qui se trouve à la base du projet Global Lexicostatistical Database (Base de données lexicostatistique globale) (GDL)[15]. Une autre base de données de ce genre est Indo-European Lexical Cognacy Database (Base de données de mots apparentés indo-européens), à laquelle travaille une équipe de l’Institut de psycho-linguistique Max-Planck de Nimègue (Pays-Bas)[16], à partir d’une liste de 200 mots proposée par Isidore Dyen[17].

Liste Swadesh de 207 mots du français

La liste en français est l'équivalent de la liste en anglais. Elle reste un outil de base pour l'élaboration de nouvelles ontologies en raison de son universalité[18]. Outre la liste en anglais des 207 mots figurant en annexe de cette publication, il est possible de se référer à celle classée par ordre alphatique établie par le Rosetta Project, comportant les déclinaisons acceptées de chaque mot (par exemple : petit, petite)[19].

Les mots en gras figurent également dans la liste de 100 mots[note 2].

  1. je
  2. tu, vous (formel)
  3. il
  4. nous
  5. vous (pluriel)
  6. ils
  7. ceci, celui-ci
  8. cela, celui-là
  9. ici
  10. là
  11. qui
  12. quoi
  13. où
  14. quand
  15. comment
  16. ne ... pas
  17. tout
  18. beaucoup
  19. quelques
  20. peu
  21. autre
  22. un
  23. deux
  24. trois
  25. quatre
  26. cinq
  27. grand
  28. long
  29. large
  30. épais
  31. lourd
  32. petit
  33. court
  34. étroit
  35. mince
  36. femme
  37. homme (mâle adulte)
  38. homme (être humain)
  39. enfant
  40. femme (épouse)
  41. mari
  42. mère
  43. père
  44. animal
  45. poisson
  46. oiseau
  47. chien
  48. pou
  49. serpent
  50. ver
  51. arbre
  52. forêt
  53. bâton
  54. fruit
  55. graine
  56. feuille (d'un végétal)
  57. racine
  58. écorce
  59. fleur
  60. herbe
  61. corde
  62. peau
  63. viande
  64. sang
  65. os
  66. graisse
  67. œuf
  68. corne
  69. queue (d'un animal)
  70. plume (d'un oiseau)
  71. cheveux
  72. tête
  73. oreille
  74. œil
  75. nez
  76. bouche
  77. dent
  78. langue (organe)
  79. ongle
  80. pied
  81. jambe
  82. genou
  83. main
  84. aile
  85. ventre
  86. entrailles, intestins
  87. cou
  88. dos
  89. poitrine
  90. cœur (organe)
  91. foie
  92. boire
  93. manger
  94. mordre
  95. sucer
  96. cracher
  97. vomir
  98. souffler
  99. respirer
  100. rire
  101. voir
  102. entendre
  103. savoir
  104. penser
  105. sentir (odorat)
  106. craindre
  107. dormir
  108. vivre
  109. mourir
  110. tuer
  111. se battre
  112. chasser (le gibier)
  113. frapper
  114. couper
  115. fendre
  116. poignarder
  117. gratter
  118. creuser
  119. nager
  120. voler (dans l'air)
  121. marcher
  122. venir
  123. s'étendre, être étendu
  124. s'asseoir, être assis
  125. se lever, se tenir debout
  126. tourner (intransitif)
  127. tomber
  128. donner
  129. tenir
  130. serrer, presser
  131. frotter
  132. laver
  133. essuyer
  134. tirer
  135. pousser
  136. jeter, lancer
  137. lier
  138. coudre
  139. compter
  140. dire
  141. chanter
  142. jouer (s'amuser)
  143. flotter
  144. couler (liquide)
  145. geler
  146. gonfler (intransitif)
  147. soleil
  148. lune
  149. étoile
  150. eau
  151. pluie
  152. rivière
  153. lac
  154. mer
  155. sel
  156. pierre
  157. sable
  158. poussière
  159. terre (sol)
  160. nuage
  161. brouillard
  162. ciel
  163. vent
  164. neige
  165. glace
  166. fumée
  167. feu
  168. cendre
  169. brûler (intransitif)
  170. route
  171. montagne
  172. rouge
  173. vert
  174. jaune
  175. blanc
  176. noir
  177. nuit
  178. jour
  179. an, année
  180. chaud (température)
  181. froid (température)
  182. plein
  183. nouveau
  184. vieux
  185. bon
  186. mauvais
  187. pourri
  188. sale
  189. droit (rectiligne)
  190. rond
  191. tranchant
  192. émoussé
  193. lisse
  194. mouillé, humide
  195. sec
  196. juste, correct
  197. près
  198. loin
  199. droite
  200. gauche
  201. à
  202. dans
  203. avec (ensemble)
  204. et
  205. si (condition)
  206. parce que
  207. nom

Notes et références

Notes

  1. ↑ Les 13 langues sont les suivantes : copte, chinois, anglais, allemand, suédois, français, roumain, grec moderne ("athénien"), espagnol, portugais, catalan, italien, et grec chypriote[6].
  2. ↑ Pour un exemple de la liste des 100 mots et leur équivalent en catalan, anglais et espagnol, il est possible de consulter la liste mise à disposition du public sur le site archive.org par le Rosetta Project[20].

Références

  1. ↑ Swadesh 1950, p. 161.
  2. ↑ Swadesh 1952, p. 456-457.
  3. ↑ Swadesh 1955.
  4. ↑ Swadesh 1971, p. 283.
  5. ↑ ComparaLex.
  6. ↑ Swadesh, 1955, p. 133
  7. ↑ Sjoberg 1956.
  8. Strazny 2005.
  9. ↑ Hoijer 1956, p. 53.
  10. Kálmán 2007, p. 118.
  11. ↑ Bergsland 1962.
  12. ↑ (en) J. Vansina, « New linguistic evidence and the Bantu expansion », Journal of African History, 1995, vol. 36, no 2, p. 173-195
  13. ↑ (en) I. Ribot, « Differentiation of modern sub-Saharan African populations: craniometric interpretations in relation to geography and history », Bulletins et mémoires de la Société d’Anthropologie de Paris, vol. 16, nos 3-4,‎ (lire en ligne)
  14. ↑ Kassian 2010.
  15. ↑ Global Lexicostatistical Database.
  16. ↑ Evolutionary Processes in Language and Culture (Processus d’évolution en langue et culture).
  17. ↑ Dyen 1992.
  18. ↑ Laurent Prevot, C. Huang et I. Su, « Using the Swadesh list for creating a simple common taxonomy », 5th Workshop on Ontologies and Lexical Resources,‎ (lire en ligne [PDF], consulté le )
  19. ↑ Rosetta Project, « French Swadesh List », sur rosettaproject.org via archive.org, (consulté le )
  20. ↑ Antoni Brosa Swadesh list for Catalan /Swadesh list for French, lire en ligne sur rosettaproject.org via archive.org.

Voir aussi

Bibliographie

de Morris Swadesh
  • (en) Swadesh, Morris, « Lexicostatistic dating of prehistoric ethnic contacts » [« Datation lexicostatistique des contacts ethniques préhistoriques »], Proceedings of the American Philosophical Society, no 96, p. 452-463 lire en ligne
  • (en) Swadesh, Morris, « Salish internal relationships » [« Relations entre les langues salish »], International Journal of American Linguistics, no 16, p. 157-167
  • (en) Swadesh, Morris, « Towards greater accuracy in lexicostatistic dating » [« Vers une plus grande exactitude dans la datation lexicostatistique »], International Journal of American Linguistics, no 21, p. 121-137 lire en ligne
  • (en) Swadesh, Morris, The Origin and Diversification of Language [« Origine et diversification de la langue »], édition post mortem de Joel Sherzer, Chicago, Aldine, 1971 (ISBN 0-202-01001-5)
Autres références
  • (en) Hoijer, Harry, « Lexicostatistics: A critique » [« Regard critique sur la lexicostatistique »], Language, no 32, 1956, p. 49-60 (consulté le )
  • (en) Dyen, Isidore ; Kruskal, Joseph B. ; Black, Paul, « An Indoeuropean Classification: A Lexicostatistical Experiment » [« Classification indo-européenne. Expérience lexicostatistique »], Transactions of the American Philosophical Society, vol. 82, no 5, 1992
  • (en) Strazny, Philipp, « Morris Swadesh: critical essay » [« Morris Swadesh: essai critique »], Strazny, Philipp (dir.), The Encyclopedia of Linguistics [« Encyclopédie de la linguistique »], New York, Fitzroy Dearborn, 2005 (consulté le )
  • (hu) Kálmán, László et Trón, Viktor, Bevezetés a nyelvtudományba [« Introduction à la linguistique »], 2de édition, augmentée, Budapest, Tinta, 2007 (ISBN 978-963-7094-65-1) (consulté le )
  • (en) Kassian, Alexei et al., « The Swadesh wordlist. An attempt at semantic specification » [« La liste Swadesh. Essai de spécification sémantique »], Journal of Language Relationship, no 4, 2010, p. 46-89 (consulté le )
  • (en) Bergsland, K. et Vogt, H., « On the validity of Glottochronology » [« Sur la validité de la glottochronologie »], Current Anthropology, no 3, p. 115-153
  • (en) Sjoberg, Andrée et Sjoberg, Gideon, « Problems in glottochronology », American Anthropologist, no 58 (2), p. 296-308 (consulté le )
Bibliographie supplémentaire
  • (en) Hockett, Charles F., A course in modern linguistics [« Cours de linguistique moderne »], New York, Macmillan, 1958, chap. 6
  • (en) Walter Arndt, « The performance of glottochronology in Germanic » [« Performance de la glottochronologie dans le domaine des langues germaniques »], Language, no 35, 1959, p. 180-192
  • (en) Dell Hymes, « Lexicostatistics so far » [« La lexicostatistique jusqu’à présent »], Current Anthropology, no 1, 1960, p. 3-44
  • (en) Gudschinsky, Sarah C., « The ABC's of Lexicostatistics (Glottochronology) » [« Les ABC de la lexicostatistique (glottochronologie) »], Hymes, Dell H., Language in Culture and Society. A Reader in Linguistics and Anthropology [« Langue et culture dans la société. Guide de linguistique et d’anthropologie »], New York, Harper & Row, 1964, p. 612-623 (consulté le )
  • Penchoen, Thomas-G., « La Glottochronologie », Martinet, A. (dir.), Le Langage, Paris, Gallimard, 1968, p. 865-884
  • (en) Henri Wittmann, « A lexico-statistic inquiry into the diachrony of Hittite » [« Enquête lexicostatistique dans la diachronie du hittite »] Indogermanische Forschungen, vol. 74, 1969, p. 1-10
  • (en) David Sankoff, « On the Rate of Replacement of Word-Meaning Relationships » [« Sur le taux de remplacement des relations mot-sens »], Language vol. 46, no 3, 1970, p. 564-569
  • (de) Tischler, Johann, Glottochronologie und Lexikostatistik [« Glottochronologie et lexicostatistique »], Innsbruck, Institut für Sprachwissenschaft, 1973
  • (en) Wittmann, Henri, « The lexicostatistical classification of the French-based Creole languages » [« Classification lexicostatistique des créoles à base française »], Dyen, Isidore (dir.), Lexicostatistics in genetic linguistics: Proceedings of the Yale conference, April 3-4, 1971, La Haye, Mouton, 1973, p. 89-99
  • (en) Bynon, Theodora, Historical Linguistics [« Linguistique historique »], Cambridge, Cambridge University Press, 1977, p. 266-272
  • (en) Jeffers, Robert J. et Lehiste, Ilse, Principles and Methods for Historical Linguistics [« Principes et méthodes en linguistique historique »], Cambridge (Massachusetts) / Londres, The MIT Press, 1982, p. 133-137
  • (en) Haarmann, Harald, « Basic vocabulary and language contacts; the disillusion of glottochronology » [« Lexique de base et contacts entre les langues ; la désillusion de la glottochronologie »], Indogermanische Forschungen, no 95, 1990, p. 1-37
  • (en) Callaghan, Catherine A., « Utian and the Swadesh list » [« Les langues miwok et la liste Swadesh »], Redden, J. E. (dir.), Papers for the American Indian language conference, held at the University of California, Santa Cruz, July and August, 1991, Occasional papers on linguistics, no 16, 1991, Carbondale, Department of Linguistics, Southern Illinois University, p. 218-237
  • (en) Crowley, Terry, An Introduction to Historical Linguistics [« Introduction à la linguistique historique »], Oxford University Press, 1992, p. 168-190
  • (en) Lehmann, Winfred P., Historical Linguistics: an Introduction [« Introduction à la linguistique historique »], Londres, Routledge, 1992, p. 175-182
  • (en) Nettle, Daniel, « Linguistic diversity of the Americas can be reconciled with a recent colonization » [« La diversité linguistique des Amérique peut être réconciliée avec une colonisation récente »], PNAS, vol. 96, no 6 1999, p. 3325-3329 (consulté le )
  • (en) Renfrew, Colin ; McMahon, April ; Trask, Larry, Time Depth in Historical Linguistics [« Profondeur temporelle en linguistique historique »], Cambridge (Angleterre), The McDonald Institute for Archaeological Research, 2000
  • (en) McWhorter, John, The Power of Babel [« Le Pouvoir de Babel »], New York, Freeman, 2001
  • (en) Holm, Hans J., « The Proportionality Trap. Or: What is wrong with lexicostatistical Subgrouping » [« Le piège de la proportionnalité ou Qu’est-ce qui ne va pas dans la classification lexicostatistique »], Indogermanische Forschungen, no 108, 2003, p. 38-46
  • (de) Holm, Hans J., « Genealogische Verwandtschaft » [« Parenté généalogique »], Köhler, R. ; G. Altmann ; R. Piotrowski (dir.), Quantitative Linguistik; ein internationales Handbuch [« Linguistique quantitative ; guide international »], Berlin, Walter de Gruyter, 2005, chap. 45
  • (en) McMahon, April et McMahon, Robert, Language Classification by Numbers [« Classification des langues par les nombres »], Oxford, Oxford University Press, 2005
  • Métoz, Laurent, « La convergence pluridisciplinaire dans la recherche de l’origine des langues: l’exemple américain de la «Nouvelle Synthèse» – Aspects historiques, théoriques et étude critique », Marges linguistiques, no 11, 2006, p. 281-296
  • Salem Chaker, « Glottochronologie », Chaker, Salem (dir.) Encyclopédie berbère (consulté le )
  • (en) Lees, Robert, « The basis of glottochronology » [« Bases de la glottochronologie »], Language, vol. 29, no 2, p. 113-127

Articles connexes

Liens externes

  • icône décorative Portail des langues
  • icône décorative Portail de la linguistique