Marcio Cunha

Arquitectura de Gestión de Logs y Auditoría con Vector, OpenSearch y Almacenamiento Frío

Aprenda a construir un pipeline de logs escalable usando Vector para recolección, OpenSearch para búsqueda y almacenamiento frío para cumplimiento. Optimice costos y asegure la persistencia de datos críticos de auditoría.

Marcio Cunha•3 min
También disponible en:PortuguêsEnglish
Resumen
  • El uso de una capa de transporte como Vector aísla a las aplicaciones de cambios en la infraestructura de almacenamiento.
  • La estrategia de segregación de logs permite mantener datos calientes para análisis inmediato y datos fríos para cumplimiento legal.
  • OpenSearch reduce el tiempo de respuesta en consultas complejas al utilizar índices optimizados por período.
  • La implementación de políticas de ciclo de vida de índices es esencial para el control de costos en la nube.
  • Los datos de auditoría requieren políticas de inmutabilidad y retención a largo plazo para cumplir con estándares de seguridad.

El desafío de la observabilidad a gran escala

Gestionar logs en sistemas modernos va mucho más allá de simplemente guardar texto en archivos. Una arquitectura sólida debe asegurar que, desde el momento en que el dato es generado hasta su consulta, pase por un proceso de normalización, enriquecimiento y enrutamiento eficiente. La acumulación indiscriminada de logs no solo eleva los costos de almacenamiento, sino que también dificulta localizar información crucial en momentos de crisis.

El papel de Vector en la recolección y procesamiento

Vector actúa como un recolector de logs de alto rendimiento. En lugar de instalar agentes pesados que consumen toda la CPU del servidor, Vector está escrito en Rust y funciona como una capa de transporte inteligente. En la práctica, recibe los datos brutos, puede anonimizar información sensible antes del envío y entregar los logs en el destino correcto, ya sea un clúster de búsqueda o un bucket en la nube.

Pipeline hacia OpenSearch

OpenSearch es el motor de búsqueda que nos permite filtrar y visualizar los logs en tiempo real. La integración entre Vector y OpenSearch ocurre mediante una topología donde los logs son indexados en tiempo real. Esta configuración es ideal para lo que llamamos 'hot storage', donde los datos están disponibles para visualización inmediata por ingenieros y herramientas de monitoreo.

Gestión de almacenamiento en frío

No todos los logs necesitan estar disponibles para búsqueda instantánea. Los logs de auditoría, por ejemplo, a menudo deben mantenerse por años por cuestiones regulatorias, pero rara vez se consultan. La estrategia de 'cold storage' consiste en mover estos datos a almacenamiento de objetos, como S3, que tienen un costo drásticamente menor comparado con los discos de alta performance usados en OpenSearch.

Implementación del flujo de datos

  1. Configuración del archivo vector.toml para recibir logs vía formato JSON:
    [sources.my_logs] type = 'stdin' [sinks.opensearch_sink] type = 'opensearch' inputs = ['my_logs'] endpoint = 'http://opensearch:9200' index = 'logs-%Y-%m-%d'
  2. Definición de políticas de ciclo de vida (ILM) en OpenSearch para mover índices antiguos al estado 'warm' y, eventualmente, eliminarlos o archivarlos.
  3. Configuración de una tarea de exportación a S3 o Glacier para asegurar la retención de largo plazo conforme a las leyes de protección de datos.

Consideraciones sobre la seguridad de datos

La gestión de logs de auditoría implica responsabilidad. Es fundamental garantizar que los logs no sean alterados después de su envío. La implementación de firmas digitales o el almacenamiento en buckets con política de bloqueo WORM (Write Once, Read Many) garantiza la integridad de los datos, un punto crucial para auditorías internas y externas que requieren trazabilidad absoluta de los eventos.

Conclusión

La construcción de un pipeline de logs eficiente requiere equilibrio entre rendimiento de búsqueda y costo de almacenamiento. Al utilizar Vector para procesar datos en el origen y OpenSearch para un análisis ágil, combinados con una estrategia clara para datos fríos, las organizaciones alcanzan una madurez operativa superior.

El enfoque debe siempre residir en la observabilidad orientada al valor del negocio, garantizando que los datos de auditoría permanezcan accesibles e íntegros, mientras que los datos de diagnóstico operativo permanecen rápidos y consultables. Esta separación permite escalar el sistema sin comprometer el presupuesto de infraestructura o la capacidad del equipo de TI para resolver incidentes.