Definición y concepto

El Programa Automatizado de Juicio de Similitud (ASJP) se define como un proyecto colaborativo dedicado a la aplicación de enfoques computacionales dentro del campo de la lingüística comparativa. Su núcleo operativo es una base de datos léxica de acceso abierto, diseñada para facilitar el análisis sistemático de las relaciones entre idiomas mediante el procesamiento de datos vocabulares estandarizados. La iniciativa surge como una herramienta metodológica que busca cuantificar y evaluar las similitudes entre lenguas, proporcionando un marco estructurado para la investigación filogenética y la clasificación lingüística a gran escala.

Estructura de la base de datos y alcance lingüístico

La base de datos del programa se compone de listas de vocabulario básico que contienen 40 elementos fundamentales. Estos conjuntos léxicos cubren más de la mitad de los idiomas del mundo, lo que permite una comparación transversal extensa y detallada. El alcance de la colección es amplio y diverso: incluye no solo lenguas aisladas y aquellas pertenecientes a grupos filogenéticos ya demostrados, sino también pidgins, lenguas criollas, lenguas mixtas y lenguas construidas. Esta inclusión de variedades lingüísticas no tradicionales enriquece el análisis comparativo, permitiendo a los investigadores evaluar la similitud léxica en contextos lingüísticos variados y complejos.

Para garantizar la consistencia en el análisis, las palabras almacenadas en la base de datos se transcriben utilizando una ortografía estándar simplificada conocida como ASJPcode. Esta normalización ortográfica es crucial para reducir la variabilidad superficial y permitir que los algoritmos de comparación se centren en las similitudes fonéticas subyacentes. Cada nueva versión del programa ha implicado una expansión continua de esta base de datos, incorporando nuevos idiomas y refinando las transcripciones existentes para mejorar la precisión de los resultados computacionales.

Metodología de análisis y aplicaciones

El objetivo central de aplicar enfoques computacionales a la lingüística comparativa a través del ASJP es permitir análisis cuantitativos de las relaciones entre lenguas. La base de datos se ha utilizado para diversos propósitos académicos importantes. Entre ellos se encuentran la estimación de las fechas en las que las familias lingüísticas han divergido a partir de su proto-lengua original hacia sus descendientes modernos. Este método se relaciona con, aunque difiere de, la glotocronología tradicional, ofreciendo una perspectiva computacional para determinar la patria o Urheimat de una proto-lengua.

Además de la datación y la localización geográfica histórica, las herramientas del programa permiten investigar el simbolismo sonoro y evaluar diferentes métodos filogenéticos. Estas aplicaciones demuestran la versatilidad de la base de datos como recurso para la lingüística histórica y la tipología lingüística. Al proporcionar un conjunto de datos estandarizado y accesible, el proyecto facilita la reproducción de estudios y la comparación de resultados entre diferentes investigaciones, consolidándose como una referencia técnica en el estudio computacional de la diversidad lingüística mundial.

Historia y desarrollo del proyecto

El Programa Automatizado de Juicio de Similitud (ASJP) se estableció como un proyecto colaborativo fundamental en la intersección entre la lingüística comparativa y los enfoques computacionales. Su fundación oficial data de 2008, momento en el cual se consolidó la estructura del consorcio responsable de su desarrollo continuo. Este esfuerzo académico fue impulsado inicialmente por un grupo de lingüistas destacados, entre los que se encuentran Cecil H. Brown, Søren Wichmann y Eric W. Holman. La creación del programa respondió a la necesidad de sistematizar el análisis de similitudes léxicas a través de una base de datos de acceso abierto, permitiendo así una mayor transparencia y reproducibilidad en las investigaciones filogenéticas.

Evolución metodológica de las listas de vocabulario

Un aspecto crítico en el desarrollo técnico del ASJP fue la optimización de las listas de vocabulario utilizadas para el cálculo de similitudes. Inicialmente, los métodos de clasificación léxica a menudo dependían de listas más extensas, como las de 100 elementos clásicas en la glotocronología tradicional. Sin embargo, el consorcio evolucionó hacia el uso de listas de vocabulario básico compuestas por 40 elementos. Esta reducción no fue arbitraria, sino que se basó en la búsqueda de una mayor estabilidad estadística en los resultados. Al utilizar un conjunto más reducido pero cuidadosamente seleccionado de términos básicos, el programa logra minimizar el ruido en los datos y mejorar la precisión de las comparaciones fonéticas entre idiomas.

Esta metodología permite que la base de datos cubra más de la mitad de los idiomas del mundo, incluyendo no solo lenguas aisladas y grupos filogenéticos demostrados, sino también pidgins, lenguas criollas, lenguas mixtas y lenguas construidas. La transcripción de las palabras en una ortografía estándar simplificada, conocida como ASJPcode, facilita la aplicación de algoritmos de distancia, como la distancia de Levenshtein normalizada, para calcular similitudes fonéticas. Esta evolución técnica ha permitido utilizar la base de datos para diversos propósitos académicos, como estimar fechas de divergencia de familias lingüísticas, determinar la patria de proto-lenguas e investigar el simbolismo sonoro, consolidando al ASJP como una herramienta valiosa, aunque con limitaciones aceptadas en la comunidad de lingüistas históricos.

¿Cómo funciona la metodología de clasificación?

La metodología del Programa Automatizado de Juicio de Similitud se basa en el análisis cuantitativo de listas de vocabulario básico. El sistema utiliza conjuntos de 40 elementos léxicos para más de la mitad de los idiomas del mundo, abarcando lenguas aisladas, grupos filogenéticos, pidgins, criollos, lenguas mixtas y construidas. Estas palabras se transcriben mediante una ortografía estándar simplificada conocida como ASJPcode, lo que permite una comparación directa entre sistemas fonéticos diversos.

Distancia de Levenshtein y normalización

Para calcular la similitud fonética entre pares de palabras, el programa aplica la distancia de Levenshtein (DL). Esta métrica cuenta el número mínimo de operaciones de edición (inserciones, eliminaciones o sustituciones) necesarias para transformar una palabra en otra. Dado que las palabras pueden variar en longitud y complejidad, la distancia cruda se normaliza para obtener la Distancia de Levenshtein Normalizada (DLN). Este proceso corrige las diferencias de longitud y reduce el impacto de la similitud fortuita, permitiendo una comparación más precisa entre pares léxicos de diferentes familias lingüísticas.

Sistema de codificación ASJP

La base de datos emplea un conjunto específico de símbolos para representar los sonidos básicos. A continuación, se presentan las representaciones estándar utilizadas en la codificación ASJP para vocales y consonantes:

Tipo de sonido Símbolo ASJP Representación fonética
Vocal a Ábierta posterior no redondeada
Vocal e Media anterior no redondeada
Vocal i Cerrada anterior no redondeada
Vocal o Media posterior redondeada
Vocal u Cerrada posterior redondeada
Consonante p Oclusiva bilabial sorda
Consonante b Oclusiva bilabial sonora
Consonante t Oclusiva dental/alveolar sorda
Consonante d Oclusiva dental/alveolar sonora
Consonante k Oclusiva velar sorda
Consonante g Oclusiva velar sonora
Consonante m Nasal bilabial
Consonante n Nasal dental/alveolar
Consonante s Fricativa dental/alveolar sorda
Consonante l Lateral dental/alveolar
Consonante r Vibrante múltiple dental/alveolar

Esta estandarización permite que el programa evalúe diferentes métodos filogenéticos y estime fechas de divergencia de familias lingüísticas a partir de proto-lenguas originales. Aunque esta clasificación no es ampliamente aceptada por los lingüistas históricos como método definitivo, su acceso abierto y expansión continua han facilitado investigaciones sobre simbolismo sonoro y la determinación de patrias de proto-lenguas.

Estructura de la base de datos y codificación

La arquitectura de la base de datos del Programa Automatizado de Juicio de Similitud (ASJP) se fundamenta en una selección rigurosa de vocabulario básico diseñado para minimizar el préstamo léxico y maximizar la estabilidad fonética a lo largo del tiempo. Esta expansión continua en cada nueva versión permite una comparación transversal más amplia que los métodos tradicionales. La selección de estas 40 palabras guarda relación con la famosa lista de Swadesh-Yakhontov, aunque el ASJP adapta y selecciona específicamente aquellos conceptos que muestran mayor resistencia a la erosión semántica y fonética en contextos computacionales masivos.

Sistema de codificación ASJPcode

Para estandarizar la comparación entre lenguas con sistemas de escritura dispares (alfabéticos, silábicos y logográficos), el programa emplea un sistema de transcripción conocido como ASJPcode. Este sistema reduce la complejidad ortográfica a una ortografía estándar simplificada, permitiendo que las palabras sean tratadas como secuencias de símbolos comparables directamente. La codificación es crucial para aplicar la distancia de Levenshtein normalizada, el algoritmo principal para calcular similitudes fonéticas en la base de datos.

El ASJPcode utiliza marcas específicas para denotar matices fonéticos que a menudo se pierden en la transcripción fonética básica. Por ejemplo, el uso de marcas como la tilde (~) y el signo de dólar ($) permite distinguir entre consonantes que ocupan la misma posición en la serie consonántica pero difieren en rasgos como la glotalización o la aspiración. Esta precisión en la codificación es esencial para que el cálculo de distancia de Levenshtein refleje verdaderas similitudes fonéticas y no solo coincidencias ortográficas superficiales. Al transformar las palabras en esta representación estandarizada, el programa puede estimar fechas de divergencia de familias lingüísticas, determinar la patria (Urheimat) de proto-lenguas e investigar fenómenos como el simbolismo sonoro con un grado de precisión cuantitativa que los métodos cualitativos tradicionales a menudo no ofrecen de manera sistemática.

Aplicaciones en lingüística histórica

La base de datos del Programa Automatizado de Juicio de Similitud (ASJP) se ha convertido en una herramienta fundamental para la lingüística histórica computacional, permitiendo a los investigadores abordar preguntas complejas sobre la evolución de las lenguas mediante el análisis de listas de vocabulario básico de 40 elementos. El acceso abierto a estos datos ha facilitado una expansión continua del corpus, que ahora abarca no solo lenguas aisladas y grupos filogenéticos clásicos, sino también pidgins, lenguas criollas, lenguas mixtas y lenguas construidas. Esta diversidad tipológica permite evaluar la robustez de los métodos filogenéticos en contextos lingüísticos diversos.

Estimación de divergencia y glotocronología

Este enfoque se relaciona con la glotocronología, aunque utiliza métodos distintos para calcular la distancia de Levenshtein normalizada entre las formas léxicas. Al analizar estas similitudes fonéticas, los investigadores pueden proponer cronologías para la separación de ramas lingüísticas, ofreciendo una perspectiva cuantitativa sobre la tasa de cambio léxico a lo largo del tiempo.

Determinación de la patria (Urheimat) y simbolismo sonoro

Además de la cronología, la base de datos se utiliza para determinar la patria o Urheimat de una proto-lengua, es decir, la región geográfica original donde se hablaba la lengua ancestral antes de su dispersión. Este análisis espacial se complementa con investigaciones sobre el simbolismo sonoro, explorando cómo ciertos sonidos pueden asociarse con significados específicos a través de diferentes familias lingüísticas. La inclusión de lenguas construidas y criollas en la muestra permite contrastar estos fenómenos con lenguas naturales de desarrollo más antiguo.

Evaluación de métodos filogenéticos

La base de datos también sirve para evaluar diferentes métodos filogenéticos, permitiendo a los lingüistas comparar la eficacia de diversos enfoques computacionales para reconstruir árboles genealógicos de las lenguas. La transcripción de las palabras en una ortografía estándar simplificada, conocida como ASJPcode, facilita esta comparación al reducir la variabilidad ortográfica entre las distintas lenguas incluidas en el estudio. Estas evaluaciones son cruciales para refinar las herramientas de análisis y mejorar la precisión de las reconstrucciones lingüísticas históricas.

¿Qué limitaciones tiene el método ASJP?

Limitaciones académicas y aceptación del método

Aunque el Programa Automatizado de Juicio de Similitud (ASJP) ha aportado herramientas computacionales valiosas para la lingüística comparativa, su clasificación no es ampliamente aceptada por los lingüistas históricos como un método definitivo o suficiente por sí solo para establecer relaciones filogenéticas entre las lenguas. La comunidad académica reconoce la utilidad de las listas de vocabulario básico de 40 elementos y la aplicación de la distancia de Levenshtein normalizada para calcular similitudes fonéticas, pero advierte que estos indicadores cuantitativos deben complementarse con análisis cualitativos más profundos.

El consenso entre los especialistas indica que algunas relaciones encontradas mediante el enfoque ASJP han sido confirmadas posteriormente por el método comparativo ortodoxo, lo que valida parcialmente la eficacia de la herramienta en ciertos contextos. Sin embargo, esto no implica que el programa sustituya a la metodología tradicional. El método comparativo, que examina correspondencias fonéticas sistemáticas y cambios morfológicos a lo largo del tiempo, sigue siendo considerado el estándar de oro para probar la parentesco lingüístico. El ASJP, al basarse en listas reducidas y una transcripción simplificada (ASJPcode), puede capturar similitudes superficiales que no siempre reflejan una divergencia a partir de una proto-lengua común.

Además, la inclusión de pidgins, lenguas criollas, lenguas mixtas y lenguas construidas en la base de datos, aunque enriquece el alcance del proyecto, introduce variables complejas que pueden afectar la precisión de las estimaciones de divergencia y la determinación de la patria de una proto-lengua. Los lingüistas históricos señalan que estos tipos de lenguas a menudo presentan préstamos masivos o estructuras híbridas que no siguen patrones de evolución lineales típicos de las familias lingüísticas demostradas. Por lo tanto, las conclusiones derivadas del ASJP deben interpretarse con cautela y siempre en diálogo con otros métodos filogenéticos y evidencias históricas externas.

En resumen, mientras que el ASJP, impulsado por investigadores como Cecil H. Holman, ofrece una perspectiva innovadora y de acceso abierto para investigar simbolismo sonoro y evaluar métodos filogenéticos, su resultado no debe tomarse como una prueba concluyente de relación lingüística sin el respaldo del análisis comparativo tradicional. La integración de ambos enfoques permite una visión más completa y robusta de la diversidad lingüística mundial.

Ejercicios resueltos: cálculo de similitud

Principios de cálculo de similitud léxica

El Programa Automatizado de Juicio de Similitud (ASJP) determina la cercanía entre palabras de distintos idiomas mediante la aplicación de la distancia de Levenshtein normalizada sobre listas de vocabulario básico. La normalización permite comparar pares de palabras de longitudes variables, expresando el resultado como un valor entre 0 (similitud perfecta) y 1 (diferencia total). Es fundamental aplicar este cálculo sobre las palabras transcritas en la ortografía estándar simplificada del proyecto, conocida como ASJPcode, para reducir la variabilidad ortográfica y centrarse en la fonética subyacente.

Ejercicio 1: Cálculo básico de distancia de Levenshtein

Se analizan dos formas hipotéticas de la palabra "agua" en dos idiomas distintos, transcritas como AGUA y AGWA. Para calcular la distancia de Levenshtein, se identifican las operaciones mínimas requeridas para transformar la primera secuencia en la segunda:

La distancia bruta es 1. La longitud máxima de las dos palabras es 4. La similitud normalizada se calcula dividiendo la distancia por la longitud máxima:

S = d ( A G U A, A G W A ) max ( len ( A G U A ), len ( A G W A ) ) = 1 4 = 0.25

Un valor de 0.25 indica una alta similitud fonética entre ambas formas, lo que sugiere una posible relación cognada bajo los umbrales típicos del proyecto.

Ejercicio 2: Impacto de la codificación ASJPcode

La transcripción a ASJPcode es crítica para la precisión del cálculo. Consideremos la palabra "sol" en dos idiomas, representada ortográficamente como SOL y SOLEIL. Sin codificación, la distancia sería mayor debido a las letras adicionales. Sin embargo, si el sistema de transcripción simplifica ambas formas a una representación fonética común, como SOL y SOL (suponiendo que la terminación -eil se considera una variación morfológica o fonética menor que se normaliza o se ignora en la comparación de raíces básicas según las reglas específicas de la lista de 40 elementos), la distancia sería 0.

En un escenario más realista donde se comparan SOL y SOL tras la normalización, la distancia de Levenshtein es 0. La similitud es:

S = 0 3 = 0

Esto refleja una coincidencia perfecta, demostrando cómo la estandarización de la ortografía en ASJPcode permite identificar relaciones léxicas que podrían pasar desapercibidas en una comparación puramente ortográfica. Estos ejercicios ilustran la metodología técnica utilizada en la base de datos de acceso abierto para evaluar similitudes en más de la mitad de los idiomas del mundo, aunque su aceptación como método definitivo entre lingüistas históricos sigue siendo objeto de debate académico.

Véase también

Referencias

  1. «Programa Automatizado de Juicio de Similitud» en Wikipedia en español
  2. Similarity Search and Clustering in High-Dimensional Spaces — ACM Digital Library
  3. Neural Network Embeddings for Similarity Learning — IEEE Xplore
  4. Siamese Networks for Image Similarity — Stanford University (CS231n)
  5. Cosine Similarity and Vector Space Models — Wolfram MathWorld