DESCRIPCION
Este conjunto de datos contiene las palabras que distinguen en mayor medida el lenguaje de las regiones de Colombia. Los datos que se utilizaron para determinar estas palabras se encuentran en el conjunto de datos “F-TWITTER-COLOMBIA” que se encuentra en el portal datos.gov.co. La medida para determinar el grado del componente regional de las palabras es la autocorrelación espacial (ver https://es.wikipedia.org/wiki/An%C3%A1lisis_espacial) entre las frecuencias de uso de las palabras en 237 ciudades colombianas, contra las coordenadas espaciales (latitud y longitud) de las mismas 237 ciudades. El método para medir esta autocorrelación espacial es el Criterio de Independencia de Hilbert Schmidth o HSIC por su sigla en inglés (Gretton et al., 2008). Entre mayor sea el valor de HSIC, mayor el componente regional de la palabra. Adicionalmente, se reporta el valor-p (p-value) que indica el grado de certeza o significancia estadística del valor de obtenido de HSIC. Reportamos solamente las palabras con valor-p menor de 0.05, o sea que la probabilidad de que la autocorrelación observada sea producto del azar es menor del 5%. El uso de HSIC para la identificación del componente regional de las palabras es el estado del arte actual para la cuestión (Nguyen y Eisenstein, 2017).
Para mayor detalle del cálculo de esta estadística se puede consultar la tesis de maestría:
Rodríguez-Díaz, Carlos Alberto. “DIALECTONOS: BÚSQUEDA DE FRONTERAS DIALECTALES ESTADÍSTICAMENTE SIGNIFICATIVAS USANDO CORPUS LÉXICOS GEOLOCALIZADOS}”, 2018, Maestría en Lingüística, Instituto Caro y Cuervo, Bogotá D.C., Colombia
REFERENCIAS
Gretton, A., Fukumizu, K., Teo, C. H., Song, L., Schölkopf, B., & Smola, A. J. (2008). A kernel statistical test of independence. In Advances in neural information processing systems (pp. 585-592).
Nguyen, D., & Eisenstein, J. (2017). A kernel independence test for geographical language variation. Computational Linguistics, 43(3), 567-592.