Definición
Técnica de extracción de información que localiza segmentos de texto que refieren a entidades (personas, lugares, organizaciones, fechas, cantidades monetarias, etc.) y asigna a cada segmento una etiqueta de categoría; implementada mediante patrones, modelos estadísticos o aprendizaje automático, y produciendo fragmentos anotados que pueden requerir desambiguación o vinculación a identificadores canónicos.
Principio
Principio
NER realiza una clasificación a nivel de superficie: identifica menciones textuales y asigna tipos usando pistas léxicas, sintácticas y contextuales, pero por sí sola no resuelve ambigüedades de identidad (entity linking) ni correferencias entre menciones sin procesamiento adicional.
Demostración
Demostración
Escenario ilustrativo → Procesamiento de resúmenes de artículos: el sistema etiqueta 'Marie Curie' como PERSONA, 'París' como LUGAR y 'Institut du Radium' como ORGANIZACIÓN. Acción → las secuencias etiquetadas se usan para indexar documentos y generar enlaces candidatos a registros de autoridad; los casos ambiguos se marcan para desambiguación. Consecuencia → mejora de la búsqueda facetada y la extracción de metadatos, con límites conocidos donde las etiquetas son ambiguas o están ausentes.
Aplicación incorrecta
Aplicación incorrecta
Tratar las etiquetas NER como identidades canónicas (por ejemplo, asumir que cada 'Washington' etiquetado como LUGAR se refiere a la misma entidad geográfica). El error semántico es confundir clasificación superficial con identidad de entidad desambiguada.
Consecuencia
Consecuencia
NER facilita la indexación estructurada, la búsqueda centrada en entidades y el análisis posterior; las malas clasificaciones o las ambigüedades no resueltas sesgan las estadísticas, reducen la precisión de recuperación y pueden inducir a error a flujos automatizados.
Inversión
Inversión
En corpus específicos de dominio (biomedicina, jurídico, histórico), los modelos NER genéricos suelen fallar porque los tipos de entidad y las formas de superficie difieren; la aplicación exitosa requiere por tanto alineación de esquemas, adaptación al dominio o anotación a medida. Además, lenguas con recursos limitados o tokenización compleja necesitan modelos adaptados.
Límite
Límite
Claramente dentro: identificar y etiquetar menciones en texto plano con tipos de entidad generales. Caso límite: entidades anidadas o superpuestas donde difieren los esquemas de anotación. Claramente fuera: el enlace/desambiguación de entidades y la resolución de correferencia, tareas separadas pero complementarias.
Tensión semántica
Tensión semántica
Precisión ↔ Cobertura — modelos más estrictos reducen falsos positivos pero omiten menciones legítimas; modelos más permisivos aumentan cobertura a costa de etiquetas espurias.
Síntesis
Síntesis
NER es un paso de etiquetado superficial que hace manejables por máquina las menciones de entidades; para obtener representaciones canónicas y fiables debe combinarse con desambiguación, vinculación y validación consciente de la procedencia.