Saltar al contenido

Calidad de datos, clave para construir con IA en datacenter

La inteligencia artificial volvió a poner al datacenter en el centro de la estrategia, pero también expuso una verdad incómoda: ningún modelo puede crear valor sostenido si se alimenta de datos incompletos, duplicados, desactualizados, sesgados o mal gobernados. En América Latina, donde muchas organizaciones todavía conviven con sistemas heredados, silos de información, integraciones parciales y procesos manuales, la calidad de datos dejó de ser una preocupación exclusiva de analítica para convertirse en una condición de infraestructura.

La mirada de Betzaida Miranda, de Copa Airlines Panamá, resume bien esa tensión: ‘Nos interesa mucho el liquid cooling, que puede revolucionar el enfriamiento de los centros de datos, y desde ya la calidad de datos, ya que la IA se construye sobre ellos. Sino, se trata de un castillo de naipes que nos lleva a cualquier lado, además’. La frase une dos dimensiones que suelen tratarse por separado: por un lado, la infraestructura física necesaria para sostener IA; por el otro, la base informacional que determina si esa IA sirve para tomar mejores decisiones o apenas reproduce errores con más velocidad.

El punto es especialmente relevante para los DC managers regionales. La IA no exige únicamente más GPU, mejor cooling, más potencia eléctrica o redes de menor latencia. También exige pipelines confiables, datos trazables, catálogos actualizados, controles de acceso, linaje, validaciones automáticas y una gobernanza capaz de sostener modelos en producción. Sin esa base, el datacenter puede convertirse en una plataforma técnicamente sofisticada para procesar información débil, y ahí el problema ya no es de capacidad, sino de confianza.

De la infraestructura de cómputo a la infraestructura de datos

Durante años, muchas organizaciones pensaron el datacenter como el lugar donde residían aplicaciones, servidores, almacenamiento, conectividad y continuidad operativa. Con IA, esa definición queda corta. El centro de datos también debe sostener el ciclo completo de los datos: ingesta, limpieza, normalización, almacenamiento, disponibilidad, procesamiento, entrenamiento, inferencia, auditoría y monitoreo. Si cualquiera de esas capas falla, el modelo pierde precisión, explicabilidad o utilidad para el negocio.

IBM define la calidad de datos para IA como la medida en que la información es precisa, completa, confiable y apta para usarse durante todo el ciclo de vida del modelo. Esa definición incorpora dimensiones que antes podían quedar en segundo plano, como representatividad, sesgo, ruido, precisión de etiquetas y adecuación al caso de uso. En IA, un dato puede ser correcto desde el punto de vista administrativo y aun así ser insuficiente para entrenar un modelo confiable si no representa bien la realidad que se quiere predecir.

La evidencia reciente muestra que el problema no está solo en los algoritmos. MIT NANDA informó en 2025 que apenas una porción menor de los pilotos empresariales de IA generativa logra impacto medible en resultados, y que muchos fracasan por mala integración con procesos, herramientas y flujos de trabajo. En paralelo, IBM Institute for Business Value señaló que la calidad y la gobernanza de datos están entre las principales barreras para escalar IA, con líderes de negocio preocupados por precisión, sesgo y confiabilidad de la información. Para América Latina, donde la madurez de datos es desigual, esta advertencia llega justo en el momento en que crece la presión por adoptar IA más rápido.

La región frente a sus propios silos

América Latina no enfrenta un único problema de datos, sino varios superpuestos. En grandes empresas conviven ERPs, CRMs, data lakes, planillas, aplicaciones móviles, sistemas transaccionales, logs, sensores, canales digitales y repositorios históricos que no siempre hablan el mismo idioma. En sectores regulados, además, la información suele estar fragmentada entre áreas, proveedores, sistemas antiguos y nuevas plataformas cloud. Esa fragmentación complica la creación de datasets consistentes para IA.

El documento base identifica problemas recurrentes en la región: datos incompletos, inconsistentes, obsoletos, duplicados o mal estandarizados. También señala que Brasil, Chile y México muestran mayores niveles de madurez digital, con inversiones en gobernanza, limpieza automática y trazabilidad, mientras otros mercados avanzan de forma más heterogénea. La brecha no es menor: una empresa puede tener ambición de IA, pero si sus datos de clientes, inventario, pacientes, vuelos, transacciones o activos no están normalizados, el primer cuello de botella no estará en el modelo, sino en la preparación previa.

En banca, la calidad de datos impacta en scoring, prevención de fraude, segmentación, riesgo crediticio y cumplimiento regulatorio. En salud, determina la posibilidad de integrar historias clínicas, imágenes, estudios, turnos, diagnósticos y datos operativos sin exponer privacidad ni generar sesgos clínicos. En retail, afecta inventarios, precios, promociones, experiencia omnicanal y asistentes inteligentes. En aerolíneas, como plantea el caso de Copa Airlines, la precisión de datos operativos, reservas, mantenimiento, rutas y experiencia del pasajero puede ser decisiva para que la IA aporte eficiencia real y no recomendaciones inconsistentes.

Cuando el dato malo escala más rápido

La IA tiene una particularidad incómoda: amplifica. Si los datos son buenos, puede acelerar decisiones, detectar patrones, automatizar procesos y abrir nuevas capacidades de negocio. Si los datos son malos, también los amplifica: replica sesgos, profundiza errores, genera predicciones débiles, aumenta costos de limpieza y degrada la confianza de los usuarios internos. Por eso la expresión ‘garbage in, garbage out’ vuelve con fuerza en esta etapa, aunque aplicada a infraestructuras mucho más complejas que las del BI tradicional.

En modelos generativos, la mala calidad de datos se expresa de formas visibles: respuestas incorrectas, alucinaciones, inconsistencias, sesgos, baja precisión contextual o dificultad para sostener criterios corporativos. En modelos predictivos, el impacto puede ser más silencioso: drift, pérdida gradual de performance, decisiones injustas, falsas alertas, scoring inestable o recomendaciones que funcionan en laboratorio pero fallan en operación. En ambos casos, la consecuencia es parecida: el negocio deja de confiar.

El costo tampoco es menor. IBM publicó en 2026 que más de una cuarta parte de las organizaciones estima pérdidas anuales superiores a USD 5 millones por mala calidad de datos, mientras una porción menor reporta pérdidas de USD 25 millones o más. Más allá de la cifra puntual, la lectura es clara: la mala calidad rara vez aparece como una sola falla; se distribuye en reprocesos, decisiones lentas, errores operativos, riesgos de compliance, modelos subutilizados y proyectos que nunca pasan de piloto.

El datacenter como garante de trazabilidad

La calidad de datos suele tratarse como una responsabilidad de áreas de datos, analítica o negocio, pero en proyectos de IA también involucra al datacenter. La infraestructura debe permitir que los datos se muevan con velocidad, pero también con control. No alcanza con tener almacenamiento suficiente: hay que saber qué datos existen, de dónde vienen, quién los modificó, qué versión alimentó a cada modelo, bajo qué permiso fueron usados y cómo se monitorea su evolución en el tiempo.

Esto obliga a integrar arquitectura de datos y arquitectura de infraestructura. Los pipelines de IA combinan ingesta batch, streaming, procesamiento, lakehouse, data warehouse, almacenamiento de baja latencia, redes de alta velocidad y clusters de entrenamiento o inferencia. Cada capa debe incluir controles de calidad: validaciones de completitud, unicidad, formato, consistencia, integridad referencial, freshness y detección de anomalías. Si esos controles quedan afuera del diseño, el error llega demasiado tarde: cuando el modelo ya produjo resultados o cuando el negocio ya tomó decisiones.

En sectores críticos, la trazabilidad es parte del valor. Un banco debe poder explicar por qué un modelo clasificó una transacción como sospechosa. Una empresa de salud debe asegurar que un sistema de apoyo clínico no se entrenó con datos sesgados o incompletos. Una aerolínea debe entender si una predicción operativa se basa en datos actualizados. Un retailer debe saber si un agente de IA recomienda productos con inventario real o con información vencida. En todos los casos, el datacenter deja de ser solo capacidad y se convierte en una pieza de confianza.

Gobernanza: roles, reglas y cultura

La gobernanza de datos no puede aparecer después de que el modelo ya está en producción. Tiene que estar desde el comienzo. Eso implica definir responsables claros: data owners por dominio, data stewards para la gestión operativa, equipos de data engineering para pipelines, seguridad para acceso y protección, compliance para regulación, y líderes de negocio para validar qué significa calidad en cada caso. La calidad de datos no es abstracta: depende del uso que se le dará a la información.

También se necesita una capa tecnológica. Catálogos de datos, herramientas de linaje, plataformas de data quality, motores de observabilidad, controles de acceso y soluciones de metadata management empiezan a ser tan importantes como el almacenamiento o el cómputo. Vendors como Informatica, IBM, Microsoft, Collibra, Alation, SAP, SAS, Talend, AWS, Google Cloud y alternativas open source como Great Expectations, Apache Airflow, Apache NiFi o Kafka forman parte de un ecosistema cada vez más relevante para sostener IA productiva.

Pero la tecnología sola no alcanza. En muchas organizaciones regionales, el problema no es solo que los datos estén mal, sino que nadie se siente dueño de corregirlos. Si cada área carga información con criterios propios, si no existen estándares comunes, si los equipos solo limpian datos cuando un proyecto lo exige y si los errores se corrigen manualmente sin atacar la causa, la IA queda atrapada en una dinámica frágil. La cultura de datos consiste justamente en que cada área entienda que lo que registra hoy puede alimentar una decisión automatizada mañana.

Métricas para pasar de promesa a operación

Una estrategia seria de calidad de datos necesita indicadores. No alcanza con afirmar que los datos ‘están limpios’; hay que medirlo. Entre las métricas más útiles aparecen completitud, precisión, consistencia, unicidad, validez, actualidad, duplicación, integridad referencial y tasa de errores por dominio. También empiezan a ganar espacio indicadores más cercanos a IA, como impacto de la calidad de datos sobre precisión del modelo, drift, retraining, latencia de pipeline o tiempo necesario para certificar un dataset.

El documento base propone métricas como score de calidad de datos, tasa de error, duplicación, time-to-trust, costos de limpieza y mejora del rendimiento del modelo antes y después de saneamiento. Esa lógica es clave porque conecta datos con negocio: permite mostrar que mejorar calidad no es una tarea invisible, sino una inversión que reduce reprocesos, acelera despliegues, mejora confiabilidad y disminuye riesgo.

En el datacenter, esas métricas deben cruzarse con operación. Un dataset confiable pero inaccesible a tiempo no sirve para IA en tiempo real. Un pipeline correcto pero sin redundancia puede comprometer servicios críticos. Un modelo con buena precisión inicial, pero sin monitoreo de drift, puede degradarse sin que nadie lo detecte. La calidad de datos, entonces, debe medirse junto con disponibilidad, latencia, consumo, seguridad, escalabilidad y continuidad. Esa integración es la que convierte a la IA en una capacidad productiva y no en un experimento.

Una base sólida antes de escalar

La advertencia de Betzaida Miranda sobre el ‘castillo de naipes’ es especialmente valiosa porque evita una lectura puramente tecnológica de la IA. Una empresa puede invertir en liquid cooling, GPU, redes de alta velocidad y plataformas modernas, pero si la base de datos es débil, la promesa se derrumba. La infraestructura física habilita la IA; la calidad de datos la vuelve confiable.

Para las organizaciones latinoamericanas, el primer paso debería ser menos glamoroso que comprar aceleradores: auditar dominios críticos de datos. Clientes, productos, transacciones, activos, pacientes, vuelos, inventarios, tickets, sensores o documentos deben ser revisados según el caso de uso. Después, conviene priorizar mejoras sobre datasets de alto impacto, automatizar validaciones, asignar responsables y construir pipelines repetibles. No todos los datos deben estar perfectos para empezar, pero los datos que alimentan decisiones críticas sí deben estar gobernados.

El avance más razonable es por etapas. Primero, diagnóstico y limpieza de datos críticos. Luego, gobierno, catálogo, linaje y controles automáticos. Más adelante, pipelines robustos para IA, monitoreo de calidad y conexión con métricas de negocio. Finalmente, escalamiento hacia modelos productivos con trazabilidad completa. En ese camino, el datacenter aparece como el espacio donde infraestructura, datos y modelos se encuentran. Y en esa intersección se juega buena parte del valor real de la inteligencia artificial en la región.