Talent.com
Veritran
Site Reliability Engineer (SRE) – Service Operations COVeritran • Pereira, Risaralda Department, Colombia
Buscar otras ofertas
Site Reliability Engineer (SRE) – Service Operations CO

Site Reliability Engineer (SRE) – Service Operations CO

Veritran • Pereira, Risaralda Department, Colombia
Hace 8 días
Descripción del trabajo

Sobre Veritran Somos una compañía global de tecnología abocada a simplificar las experiencias bancarias. A través de nuestras soluciones de negocio inspiramos a las instituciones financieras a llevar su digitalización al siguiente nivel. Estamos orgullosos de ser un partner estratégico clave para reconocidos clientes en América Latina, Norteamérica y Europa, impulsándolos a convertirse en los bancos que sus clientes prefieren. Creamos productos innovadores y centrados en el cliente que permiten más de 50 millones de personas autogestionen sus finanzas. Nuestra cultura de trabajo Estamos fuertemente comprometidos por mejorar de forma continua tanto nuestra capacidad de innovación y entrega como la calidad de nuestros productos. Formamos un equipo de trabajo altamente especializado y multidisciplinario, distribuido en distintas partes del mundo que, con conocimiento, creatividad e innovación, convertimos a la compañía en un referente del sector. Libertad, responsabilidad, solidaridad y la humildad son nuestros valores fundamentales y la base de nuestra cultura. Ponemos énfasis en la gente y su crecimiento. Nos obsesiona entregarles valor a nuestros clientes, por eso nos alentamos y apoyamos en asumir retos que van más allá de nuestro rol. Lo que buscamos en ti Nos encontramos en la búsqueda de un profesional apasionado por la tecnología, metódico, proactivo y con fuerte orientación a la resolución de problemas, que quiera asumir el desafío de contribuir a la confiabilidad, disponibilidad y performance de soluciones de misión crítica utilizadas por nuestros clientes. Buscamos una persona con capacidad para analizar problemas técnicos de manera integral, anticiparse a potenciales incidentes y trabajar en conjunto con diferentes equipos para mejorar continuamente la estabilidad y operabilidad de nuestras soluciones. Para esta posición, esperamos que cuentes con sólidos conocimientos y experiencia en: Sistemas Operativos Linux/UNIX Web Servers como Apache, Nginx o similares Application Servers como Tomcat, WebLogic, JBoss o similares Diagnóstico y troubleshooting de aplicaciones e infraestructura Herramientas de monitoreo, observabilidad y alertamiento Lenguajes de scripting y automatización como Bash, Python o similares Contenedores y tecnologías como Docker Soporte técnico a clientes y resolución de incidentes en ambientes productivos Será valorado que cuentes además con conocimientos en: Infraestructura: servidores, redes, storage, virtualización y backups Bases de datos como Oracle y PostgreSQL Plataformas Cloud. Conceptos de alta disponibilidad, resiliencia, performance y capacity management; Gestión de incidentes, análisis de causa raíz y procesos de mejora continua; Tecnologías de orquestación de contenedores como Kubernetes; Infraestructura como código (IaC) y herramientas como Terraform o similares; Prácticas de CI/CD y automatización de despliegues; Definición y seguimiento de SLIs, SLOs y SLAs, incluyendo conceptos como error budgets; Prácticas de Site Reliability Engineering, automatización de tareas operativas y reducción de toil; Experiencia utilizando herramientas modernas de observabilidad para métricas, logs y trazas distribuidas; Conocimientos de programación que permitan desarrollar automatizaciones y herramientas orientadas a mejorar la confiabilidad y eficiencia operativa. Es importante que cuentes con muy buenas habilidades de comunicación y capacidad para trabajar en escenarios de alta criticidad, establecer prioridades y resolver múltiples situaciones en simultáneo. Buscamos también que puedas generar confianza en nuestros clientes y trabajar de manera colaborativa con equipos de Desarrollo, Delivery, Plataforma y Operaciones. Algunos de tus desafíos del día a día serán Monitorear y contribuir a garantizar la disponibilidad, estabilidad y performance de las soluciones implementadas en nuestros clientes Investigar y resolver incidentes técnicos, realizando troubleshooting sobre aplicaciones, infraestructura, integraciones y bases de datos Analizar métricas, logs y eventos para detectar comportamientos anómalos de manera proactiva, anticipando potenciales incidentes antes de que afecten al servicio Realizar el seguimiento end-to-end de incidentes y problemas hasta asegurar su resolución definitiva Participar en el análisis de incidentes críticos, identificando causas raíz y acciones preventivas que permitan evitar su recurrencia Trabajar en la definición y mejora de mecanismos de monitoreo, observabilidad, alertamiento y healthchecks de las soluciones. Identificar oportunidades de automatización que permitan reducir tareas manuales, errores operativos y tiempos de recuperación. Colaborar con los equipos de Desarrollo, Plataforma, Delivery y Operaciones para mejorar la operabilidad y confiabilidad de las soluciones desde su diseño hasta producción. Acompañar a nuestros clientes durante situaciones de incidentes, brindando asistencia técnica clara, oportuna y orientada a la resolución. Incorporar de manera proactiva el feedback y las necesidades detectadas en nuestros clientes, transformándolas en oportunidades de mejora para nuestros productos, procesos y servicios. Contribuir a la documentación de procedimientos operativos, troubleshooting guides y conocimiento técnico que permita mejorar continuamente la capacidad de respuesta del equipo. Te incorporarás a un equipo responsable de asegurar la confiabilidad y continuidad operativa de soluciones críticas, trabajando de manera transversal junto a diferentes áreas de Veritran y nuestros clientes. Nuestro objetivo es evolucionar desde un modelo principalmente reactivo hacia una operación cada vez más proactiva, observable y automatizada, donde los problemas puedan detectarse anticipadamente, los incidentes se resuelvan rápidamente y cada evento contribuya a mejorar la resiliencia de nuestras soluciones. Compartirás con el equipo la responsabilidad de asegurar que nuestros servicios mantengan altos estándares de disponibilidad, performance, seguridad y calidad operativa durante todo su ciclo de vida. Te proponemos Oportunidades de desarrollo en una compañía que crece y se transforma con agilidad, año tras año, en un contexto global y desafiante. Un excelente clima de trabajo, que cuida tu salud y bienestar para que vivas una experiencia única y diferente. Una cultura de trabajo colaborativa, con comunicaciones abiertas que promueven la libertad, la responsabilidad, la solidaridad y la humildad como nuestros valores fundamentales. #J-18808-Ljbffr

Crear una alerta de empleo para esta búsqueda

Site Reliability Engineer (SRE) – Service Operations CO • Pereira, Risaralda Department, Colombia