Quando um utilizador abre um ticket porque uma aplicação não responde, o problema pode ter começado muito antes. 

Neste artigo analisamos como a integração entre ITSM e ITOM permite ligar a monitorização, a informação de ativos e configurações e a gestão de incidentes para reduzir os tempos de resolução e facilitar a identificação da causa raiz dos problemas. 

Uma degradação num servidor, uma alteração de configuração, uma saturação de recursos ou uma falha num componente de rede podem estar a gerar sinais minutos ou horas antes de o utilizador percecionar o incidente. No entanto, quando a monitorização da infraestrutura, a informação sobre os ativos e a gestão de incidentes funcionam de forma independente, a equipa de suporte recebe apenas uma parte da história.

O resultado costuma traduzir-se em mais tempo a procurar informação, escalamentos desnecessários, diagnósticos mais lentos e diferentes equipas a investigar o mesmo problema a partir de perspetivas distintas.

Ligar ITSM e ITOM permite mudar esta abordagem. A monitorização ajuda a detetar o que está a acontecer, a informação sobre ativos e configurações aporta o contexto necessário e a gestão de serviços permite transformar esses dados em ações estruturadas. Assim, o objetivo deixa de ser unicamente gerir tickets para avançar no sentido de uma visão mais completa: entender o que está a acontecer, que serviços estão afetados e que elemento pode estar na origem do incidente.

Resolver um incidente não deveria começar quando chega o ticket

Num modelo tradicional, o processo costuma começar quando um utilizador deteta que algo não funciona. Abre um incidente, descreve o problema e a equipa de suporte inicia o diagnóstico. A partir desse momento deve identificar que sistema está afetado, verificar o seu estado, rever possíveis dependências, consultar alterações recentes e, se necessário, escalar o incidente para outras equipas. Cada uma destas ações consome tempo.

Entretanto, as ferramentas de monitorização podem estar a mostrar alertas relacionados com essa mesma situação e os sistemas de discovery ou gestão de ativos podem dispor de informação sobre os componentes afetados.

O problema surge quando cada fonte de informação funciona de forma isolada.

O ITSM pode saber quem comunicou o incidente e que serviço utiliza. O ITOM pode conhecer o estado de servidores, redes, aplicações ou serviços cloud. A CMDB (Configuration Management Database) pode conter as relações entre esses elementos.

Mas se essa informação não se interliga, o técnico deve reconstruir manualmente o contexto antes de poder atuar.

De um alerta isolado a um incidente com contexto

Uma estratégia integrada ITSM & ITOM permite criar um fluxo de informação contínuo entre operações e gestão de serviços. A chave não está unicamente em dispor de mais dados, mas sim em relacioná-los para que cada incidente chegue à equipa adequada com o maior contexto possível.

O percurso poderia ser o seguinte:

  • A monitorização deteta uma anomalia. O ITOM supervisiona servidores, aplicações, redes, serviços cloud e outros componentes tecnológicos. Uma degradação de desempenho, uma perda de conectividade ou um consumo anómalo de recursos podem ser detetados antes mesmo de o utilizador aperceber-se do problema.

  • Identifica-se o ativo e as suas dependências. As capacidades de discovery e a informação registada na CMDB permitem relacionar o componente afetado com outros ativos, aplicações e serviços de negócio. A questão deixa de ser apenas "que servidor está a falhar?" para passar a ser "que serviços dependem deste servidor e quem pode ser afetado?".

  • O alerta converte-se num incidente enriquecido. Quando se cumprem determinadas condições, o sistema pode gerar automaticamente um ticket incluindo informação como o ativo afetado, o alerta que o originou, a sua criticidade, eventos relacionados ou alterações recentes.

  • O incidente é priorizado e atribuído utilizando o contexto disponível. Conhecer o impacto do componente permite determinar melhor a urgência da situação e encaminhá-la para a equipa responsável sem depender exclusivamente de classificações manuais.

  • A informação acumulada ajuda a identificar a causa raiz. Se determinados incidentes se repetem ou diferentes alertas apontam para o mesmo componente, a organização pode ir além de restaurar o serviço e analisar o problema subjacente. Desta forma, o incident management e o problem management podem trabalhar sobre informação procedente da operação real.

O ticket deixa, assim, de ser um elemento isolado para se tornar numa peça dentro de uma cadeia de informação muito mais ampla.

A CMDB como ponto de ligação entre ITSM e ITOM

Para entender realmente o impacto de um incidente não basta saber que dispositivo gerou um alerta. É também necessário compreender as suas relações. 

Um servidor pode suportar várias aplicações. Uma aplicação pode depender de uma base de dados. Essa base de dados pode fazer parte de um serviço utilizado por diferentes departamentos.

Aqui entra em jogo a CMDB (Configuration Management Database). Uma CMDB permite representar ativos, elementos de configuração e relações entre eles. Quando esta informação é complementada com capacidades de discovery e monitorização, pode manter-se muito mais alinhada com o estado real da infraestrutura.

Isto aporta um contexto fundamental durante a gestão de incidentes. Perante um alerta, a equipa pode saber que elemento está afetado, que outros componentes dependem dele e que serviço pode sofrer consequências.

Desta maneira, a informação técnica do ITOM adquire uma dimensão de serviço graças ao ITSM.

Menos ruído de alertas, mais informação útil

A monitorização também pode gerar um problema quando existe demasiado ruído.

Uma mesma causa pode desencadear múltiplos eventos em distintos componentes. Se cada evento for transformado diretamente num incidente independente, o resultado pode ser uma avalanche de tickets que dificulte ainda mais identificar o que está a acontecer.

Por isso, ligar o ITOM ao ITSM não significa converter automaticamente cada alerta num ticket.

As capacidades de correlação permitem relacionar eventos, detetar padrões e distinguir entre sintomas e situações que realmente requerem intervenção.

O objetivo é que a equipa de suporte não receba simplesmente mais informação, mas sim informação melhor contextualizada e priorizada.

Quando este modelo é combinado com a automatização, determinadas ações também podem ser executadas sem intervenção manual: criação e atribuição de incidentes, escalamentos, atualização de estados ou até determinadas tarefas de remediação previamente definidas.

Um exemplo: do "a aplicação está lenta" a identificar o problema

Imaginemos que vários utilizadores começam a experienciar lentidão numa aplicação corporativa.

Num modelo desligado, os primeiros tickets chegam ao ServiceDesk. A equipa verifica a aplicação, solicita informação adicional, revede a infraestrutura e possivelmente encaminha o incidente para outra equipa. Entretanto, uma ferramenta de monitorização já tinha detetado um aumento anómalo do consumo de recursos num dos servidores que suporta a aplicação.

Com o ITSM e o ITOM ligados, o processo pode ser diferente. A anomalia é detetada automaticamente. O servidor é relacionado com a aplicação através da CMDB. O sistema identifica o serviço afetado e gera ou enriquece um incidente com informação técnica procedente da monitorização.

Quando os utilizadores começam a comunicar o problema, a equipa já dispõe de um contexto prévio. Além disso, se a análise mostrar que esse mesmo comportamento apareceu após determinadas alterações ou se repetiu várias vezes, a organização pode abrir uma análise de problema para investigar a sua causa raiz.

O objetivo não é apenas fechar mais rápido o ticket atual, mas evitar que o mesmo problema volte a gerar novos tickets no futuro.

Do MTTR a uma visão mais completa do rendimento de TI

Um dos resultados mais visíveis desta integração pode ser a redução do tempo médio de resolução ou MTTR (Mean Time to Resolution).

Mas convém observar todo o percurso:

  • Quanto tempo decorre até detetar um problema?
  • Quanto demora a chegar à equipa adequada?
  • Quanto tempo se dedica realmente ao diagnóstico?
  • Quantos incidentes se repetem porque apenas se tratou o sintoma?

Ligar monitorização, ativos e gestão de serviços permite atuar sobre diferentes etapas desse processo.

A deteção pode produzir-se mais cedo. O diagnóstico parte de mais informação. A atribuição pode ser automatizada. O impacto pode ser avaliado utilizando as relações entre infraestrutura e serviços. E o problem management pode utilizar históricos de incidentes, eventos e alterações para analisar tendências e recorrências.

Por conseguinte, o valor não está unicamente em resolver mais rápido, mas sim em reduzir o tempo durante o qual as TI trabalham sem dispor do contexto necessário.

Uma abordagem especialmente relevante em ambientes complexos e regulados

Cuanto mayor es la infraestructura tecnológica de una organización, más difícil resulta comprender manualmente las relaciones entre sistemas, servicios, usuarios y componentes.

En sectores como Life Sciences, además, determinados sistemas pueden soportar procesos críticos de negocio, producción, calidad o gestión de información regulada.

En estos entornos, disponer de procesos estructurados para la gestión de incidencias y cambios, junto con una visión actualizada de la infraestructura, puede ayudar a mejorar el control operativo y la trazabilidad.

No se trata únicamente de monitorizar tecnología. Se trata de entender qué papel desempeña cada componente dentro del servicio y poder reconstruir qué ha ocurrido cuando aparece un problema.

ITSM + ITOM: ligar informação para tomar melhores decisões

A diferença entre gerir um incidente e compreendê-lo está no contexto.

O ITSM proporciona os processos necessários para organizar a gestão de serviços: incidentes, problemas, alterações, solicitações e níveis de serviço, apoiando-se também na gestão de ativos e configuração.

O ITOM aporta visibilidade sobre o que está realmente a acontecer na infraestrutura.

Quando ambas as disciplinas trabalham de forma conectada, a equipa de TI pode relacionar eventos técnicos com serviços, utilizadores e impacto no negócio. Isto permite reduzir tarefas manuais, acelerar o diagnóstico, melhorar a priorização e avançar de uma gestão reativa para uma operação mais preventiva.

O objetivo final não deveria ser gerir mais tickets, mas sim precisar de cada vez menos tickets para manter os serviços a funcionar corretamente.

Quer ligar a gestão de serviços com a operação da sua infraestrutura? 

Na Ambit Iberia ajudamos as organizações a definir e implementar soluções ITSM & ITOM que ligam processos, infraestrutura e automatização para conseguir uma gestão de TI mais eficiente e controlada.

Desde a gestão de incidentes e ativos até à monitorização, discovery, automatização e otimização de operações, trabalhamos para construir um modelo adaptado às necessidades de cada organização.

Descubra as nossas soluções ITSM & ITOM aqui e, se gostou deste artigo, deixe-nos o seu comentário!