Piracoca Arcos, Jhon AlexisOspina Leguizamón, Daniel Mauricio2026-10-012026-10-012026-09-30Ospina Leguizamón, D. M. (2026). Información Clínica en Español: Cómo Aprovecharla sin Poner en Riesgo la Privacidad [Trabajo de Grado, Universidad Santo Tomás].Repositorio Institucionalhttp://hdl.handle.net/11634/74429El crecimiento de la información clínica en formato no estructurado, como las historias clínicas, las notas médicas y los reportes narrativos, deja una gran tarea al tener como principal reto su análisis y aprovechamiento. En este caso, el procesamiento de lenguaje natural (NLP) y los modelos de lenguaje pueden comprenderse como herramientas clave y de gran repercusión para poder extraer y tener una comprensión más directa y exacta de su contenido sin dejar de lado la protección de información relevante expuesta en los mismos. Se desarrolló este artículo de divulgación mediante una revisión de literatura descriptiva y cualitativa de cincuenta fuentes académicas, técnicas y normativas, con el objetivo de exponer la importancia de los datos no estructurados en salud, describir las principales aplicaciones del NLP en este campo y analizar sus desafíos más relevantes, como la precisión de los modelos, la privacidad de los pacientes y la desidentificación de información sensible. Los hallazgos muestran que gran parte de la información clínica más valiosa reside en el texto libre, que las técnicas basadas en transformadores y modelos de lenguaje permiten extraerla con precisión creciente también en español y que la desidentificación y la interoperabilidad son condiciones indispensables para su uso ético. Se concluye que los datos no estructurados, manejados de forma segura, representan una oportunidad real para fortalecer la investigación y con ellas dar un aporte significativo en decisiones clínicas, como también dejar una base clara de cómo avanzar en la gestión de la información de diferentes formatos.The growth of unstructured clinical information, such as medical records, clinical notes, and narrative reports, has created new challenges for its organization, analysis, and use in the healthcare sector. In this context, natural language processing (NLP) and language models have become key tools for extracting, structuring, and protecting the relevant information contained in medical texts. This popular science article was developed through a descriptive, qualitative literature review of fifty academic, technical, and regulatory sources, with the aim of explaining the importance of unstructured data in healthcare, describing the main applications of NLP in this field, and analyzing its most significant challenges, such as model accuracy, patient privacy, and the de-identification of sensitive information. The findings show that much of the most valuable clinical information resides in free text, that transformer-based techniques and language models can extract it with growing accuracy also in Spanish and that de-identification and interoperability are indispensable conditions for its ethical use. It is concluded that unstructured data, when handled securely, represents a real opportunity to strengthen research, support clinical decision-making, and modernize health information systems.application/pdfspaAttribution-NonCommercial-NoDerivs 2.5 Colombiahttp://creativecommons.org/licenses/by-nc-nd/2.5/co/Información Clínica en Español: Cómo Aprovecharla sin Poner en Riesgo la Privacidadbachelor thesisNatural language processingUnstructured dataElectronic health recordDe-identificationInteroperabilityAbierto (Texto Completo)info:eu-repo/semantics/openAccesshttp://purl.org/coar/access_right/c_abf2Procesamiento de lenguaje naturalDatos no estructuradosHistoria clínica electrónicaDesidentificaciónInteroperabilidadreponame:Repositorio Institucional Universidad Santo Tomásinstname:Universidad Santo Tomásrepourl:https://repository.usta.edu.co