Problem management: Cara mengidentifikasi akar masalah dalam operasional IT

Ketika laptop terputus dari jaringan kantor, karyawan umumnya akan mengajukan permintaan kepada tim IT untuk memeriksanya. Dalam beberapa menit, akses bisa kembali setelah tim IT memperbarui koneksi.
Akan tetapi, masalah yang sama muncul lagi di kemudian hari. Bukan hanya terjadi di satu karyawan, melainkan banyak karyawan.
Ketika hal tersebut terjadi, tim IT harus melihat lebih jauh. Mereka harus melakukan investigasi mendalam dan mencari penyebab dari masalah tersebut.
Proses ini disebut dengan problem management. Melalui problem maangement, tim IT dapat melihat gambaran yang lebih besar, menemukan akar masalah, dan mencegah insiden yang sama terjadi berulang kali.
Apa Itu Problem Management?
Problem management adalah proses mengidentifikasi, menganalisis, dan mengelola akar masalah (root cause) dari insiden yang terjadi di organisasi.
Dalam konteks IT help desk, problem management berarti mencari penyebab dari masalah yang diajukan ke tim IT melalui ticket support. Tim IT perlu menyelidiki penyebab dari masalah tersebut dengan menganalisis data insiden, kondisi infrastruktur IT, serta dokumentasi dari masalah yang sama atau serupa.
Pada problem management ITIL, terdapat beberapa istilah penting yang perlu diketahui, yaitu:
Workaround: Solusi sementara yang dapat memulihkan atau mempertahankan layanan ketika solusi permanen belum tersedia. Workaround membantu mengurangi dampak dari insiden dan menjaga business continuity.
Root cause analysis (RCA): Salah satu teknik investigasi yang membantu menemukan akar masalah dari suatu insiden.
Known error: Problem yang akar penyebabnya sudah diketahui, tetapi belum sepenuhnya diselesaikan. Biasanya, known error sudah memiliki workaround yang dapat digunakan ketika insiden terkait terjadi kembali.
Known error database (KEDB): Database yang menyimpan informasi tentang known error, termasuk root cause dan workaround-nya. Database ini memungkinkan tim IT menangani insiden yang sudah pernah terjadi sebelumnya atau saling berkaitan.
Apa Perbedaan Problem Management, Incident Management, dan Change Management?
Dalam praktiknya, problem management sering dikaitkan dengan incident management dan change management. Ini karena praktik-praktik tersebut merupakan bagian dari pendekatan ITIL (Information Technology Infrastructure Library) dalam mengelola layanan IT.
Namun, ketiga hal ini berbeda.
Problem management fokus menjawab mengapa suatu insiden terjadi dan bagaimana supaya tidak terjadi lagi. Sementara itu, incident management menjawab pertanyaan "bagaimana cara layanan dapat kembali normal", tetapi penyebabnya tidak harus diselesaikan segera. Di sisi lain, change management fokus pada pertanyaan "bagaimana cara menerapkan perubahan untuk memperbaiki dengan aman?".
Cara paling mudah untuk memahaminya adalah dengan melihat contoh kasus.
Misalnya, sebuah printer kantor tiba-tiba tidak bisa digunakan. Ketika karyawan melaporkan masalah tersebut kepada tim IT, fokus utama tim IT adalah mengembalikan layanan secepat mungkin. Tim bisa menghubungkan pengguna ke printer lain atau memberikan solusi sementara agar pekerjaan tetap berjalan. Inilah yang disebut incident management.
Bagaimana jika printer yang sama terus mengalami masalah? Tim IT tentu saja tidak bisa memberikan workaround yang sama terus-menerus. Kini, tim IT harus mencari tahu mengapa masalah tersebut terjadi melalui serangkaian analisis. Inilah yang menjadi fokus problem management.
Change management terjadi setelah itu. Jika ternyata setelah investigasi ditemukan bahwa printer sering mengalami gangguan karena driver yang sudah tidak kompatibel, tentu tim IT harus segera menggantinya. Namun, sekarang tim IT harus memastikan perubahan tersebut dilakukan dengan terencana tanpa menganggu layanan.
Dalam bentuk tabel, berikut perbedaan antara problem management, incident management, dan change management.
Praktik | Fokus utama | Pertanyaan |
Incident management | Memulihkan layanan | "Bagaimana layanan bisa kembali normal?" |
Problem management | Mencari akar penyebab | "Mengapa gangguan bisa terjadi?" |
Change management | Mengelola perubahan | "Bagaimana cara melakukan perubahan dengan aman?" |
Mengapa Problem Management itu Penting?
Problem berawal dari insiden yang terjadi di organisasi, baik itu baru terjadi sekali maupun terjadi berulang, atau baik itu terjadi pada satu orang maupun banyak orang. Jika suatu problem terjadi secara berulang dan pada banyak orang, produktivitas organisasi dan layanan kepada pengguna bisa terhambat. Problem management menguraikan hal di balik terjadinya insiden dan mengelola penyebabnya agar organisasi tidak lagi menghadapi gangguan.
Problem management yang diterapkan dengan baik dapat membantu organisasi:
Mengurangi insiden berulang dengan menemukan dan mengatasi akar penyebab masalah.
Mengurangi dampak gangguan terhadap pengguna dan layanan, terutama pada situasi yang penting.
Meningkatkan kualitas layanan IT dengan mengidentifikasi dan memperbaiki kelamahan dalam layanan.
Meningkatkan produktivitas pengguna dengan mengurangi waktu yang terbuang akibat gangguan layanan.
Mempercepat penyelesaian insiden dengan menyediakan workaround dan solusi permanen untuk masalah yang sudah diketahui.
Meningkatkan kepercayaan pengguna terhadap layanan IT karena gangguan dapat ditangani secara lebih konsisten.
Meningkatkan IT maturity dengan mendorong organisasi beralih dari pendekatan reaktif ke proaktif.
Meningkatkan keamanan dengan mengidentifikasi masalah yang berpotensi menimbulkan celah atau risiko keamanan.
Apa Saja Jenis-jenis Problem Management?
Problem management terdiri atas dua jenis, yaitu:
Reactive Problem Management
Reactive problem management dilakukan setelah terjadinya insiden. Tim IT menyelidiki insiden yang sudah terjadi untuk menemukan akar penyebabnya dan mencegah insiden serupa terulang kembali.
Proactive Problem Management
Proactive problem management dilakukan sebelum insiden terjadi. Biasanya, tim IT memanfaatkan data, analitik, dan alert dari tool monitoring untuk mengidentifikasi pola atau potensi masalah. Dengan begitu, tim dapat mengambil tindakan sebelum masalah tersebut benar-benar terjadi.
Seperti Apa Proses Problem Management?
Proses problem management berbeda-beda untuk setiap organisasi. Akan tetapi, biasanya proses tersebut mencakup langkah-langkah berikut:
1. Deteksi dan identifikasi masalah
Masalah bisa ditemukan dari berbagai sumber, seperti alert dari sistem monitoring, identifikasi insiden berulang oleh tim IT, atau laporan dari ticket support yang masuk melalui IT help desk.
Pada tahap ini, tim IT mencatat masalah dan menentukan prioritasnya. Tidak semua masalah harus ditangani dengan tingkat urgensi yang sama.
Selain itu, masalah juga bisa ditemukan secara proaktif, bahkan sebelum terjadi insiden. Hal ini dapat dilakukan melalui analisis tren insiden, data dari tool monitoring jaringan, atau hasil pengujian.
2. Investigasi dan diagnosis masalah
Setelah masalah teridentifikasi, tim IT mulai mencari tahu apa yang sebenarnya menyebabkan masalah tersebut. Hal ini bisa dilakukan melalui pemeriksaan konfigurasi dan kondisi infrastruktur, serta melakukan root cause analysis (RCA) melalui berbagai teknik seperti Five Whys atau Fishbone Diagram.
Dari investigasi dan diagnosis masalah, tim IT dapat memahami lebih jelas mengenai penyebab masalah dan tindakan yang perlu dilakukan untuk mengatasinya.
3. Resolusi masalah
Setelah penyebab masalah diketahui, tim perlu menentukan cara terbaik untuk menanganinya. Solusinya bisa berupa perbaikan permanen atau workaround jika perbaikan permanen belum memungkinkan.
Jika penyebab masalah sudah diketahui tetapi belum ada perbaikan permanen, informasi tersebut dapat dicatat sebagai known error. Dokumentasi ini diperlukan agar tim IT dapat menangani insiden serupa dengan lebih cepat jika masalah tersebut muncul kembali.
Lalu, jika perbaikan membutuhkan perubahan pada sistem, infrastruktur, atau konfigurasi, tim IT perlu melalui proses change management. Ini penting agar perubahan dapat diterapkan secara terencana dan dengan risiko yang terkendali.
4. Closure masalah
Masalah dapat ditutup setelah solusi diterapkan dan tim memastikan bahwa penyebabnya sudah benar-benar ditangani. Namun sebelum itu, tim perlu memeriksa apakah solusinya masih efektif dan apakah insiden yang sama mungkin terjadi. Dokumentasi seperti hasil penyelesaian dan workaround juga perlu disimpan dengan baik.
Dengan begitu, problem management tidak selesai pada satu kasus saja, tetapi bisa digunakan untuk mencegah atau menangani masalah serupa di kemudian hari.
Apa Teknik yang Umum Digunakan dalam Problem Management?
Pada umumnya, proses problem management dikelola melalui tool service desk. Namun, ketika tim IT perlu menginvestigasi akar penyebab suatu masalah, teknik yang digunakan dapat berbeda-beda, tergantung pada jenis masalah dan kebutuhan organisasi.
Beberapa teknik yang umum digunakan dalam problem management antara lain:
1. Metode Kepner-Tregoe
Metode Kepner-Tregoe (K-T) merupakan teknik pemecahan masalah dan pengambilan keputusan yang dilakukan secara sistematis dan logis. Metode ini mencakup empat proses utama, yaitu:
Penilaian dan klarifikasi situasi untuk memahami kondisi dan menentukan masalah yang perlu ditangani.
Analisis masalah untuk mengidentifikasi hubungan antara penyebab dan dampak.
Analisis keputusan untuk mengevaluasi dan menentukan pilihan yang paling tepat.
Analisis potensi masalah untuk mengantisipasi masalah yang mungkin terjadi di masa depan.
Dalam proses analisis masalah, tim IT perlu mendefinisikan dan mendeskripsikan masalah yang ada secara jelas, mengidentifikasi kemungkinan penyebab, menguji setiap kemungkinan penyebab, kemudian memverifikasi penyebab yang paling mungkin menjadi akar masalah.
2. Analisis Ishikawa/Fishbone diagram
Analisis Ishikawa dikenal juga dengan nama lain fishbone diagram karena proses analisis akar masalahnya menggunakan framework yang menyerupai tulang ikan.
Analisis dimulai dengan mendefinisikan masalah yang ingin diidentifikasi penyebabnya. Masalah tersebut kemudian ditempatkan pada bagian kepala ikan. Kemudian, dibuat garis utama atau spine yang menhubungkan masalah dengan berbagai kategori penyebab yang mungkin.
Dalam konteks service management, kategori penyebab yang umum digunakan adalah partner, process, people, dan technology.
Setelah kategorinya ditentukan dan membentuk bagian ribs padda diagram, tim dapat menambahkan penyebab di bawah setiap kategori. Penyebab ini juga dapat diuraikan lebih lanjut menjadi subpenyebab untuk mendapatkan gambaran yang lebih detail.
3. Analisis Pareto
Prinsip Pareto menyatakan bahwa 80% dampak datang dari 20% penyebab. Dalam problem management, analisis Pareto dapat digunakan untuk mengidentifikasi dan memprioritaskan kategori masalah yang memberi dampak terbesar pada layanan.
Analisis ini dilakukan dengan membuat Pareto chart, yaitu grafik yang menggabungkan frekuensi setiap kategori masalah dengan persentase kumulatifnya.
Untuk membuat grafiknya, tim IT perlu mengelompokkan data berdasarkan atribut atau kategori yang relevan, mengidentifikasi frekuensi masalah pada setiap kategori dalam periode tertentu, menghitung jumlah kemunculan masalah pada setiap kategori, dan mengurutkan kategori berdasarkan frekuensi masalah.
4. Teknik Five Whys
Teknik Five Whys merupakan teknik analisis akar masalah dengan mengajukan pertanyaan "Why" atau "mengapa" secara berulang, sampai akar penyebab suatu masalah diketahui.
Prosesnya dimulai dengan mendefinisikan problem statement, kemudian mengajukan pertanyaan "Why?" berdasarkan jawaban sebelumnya. Pertanyaan "Why?" tidak semestinya dibatasi 5 kali saja, karena semuanya tergantung pada kompleksitas masalah dan seberapa dalam tim perlu melakukan investigasi.
Apa Best Practice dalam Problem Management?
Agar praktik problem management benar-benar memberikan dampak, tim IT harus memastikan setiap masalah dapat diidentifikasi, dianalisis, diprioritaskan, dan ditindaklanjuti dengan cara yang konsisten.
Berikut beberapa best practice yang dapat diterapkan:
1. Mengidentifikasi insiden berulang

Tidak semua insiden perlu ditindaklanjuti sebagai masalah. Biasanya, insiden berulang atau yang memiliki dampak besar lah yang perlu mendapat perhatian lebih.
Tim IT bisa memulai dengan melihat pola atau tren dari insiden yang masuk. Misalnya, jika pengguna terus melaporkan aplikasi yang sama mengalami crash, tim IT sebaiknya tidak hanya menyelesaikan setiap tiket satu per satu, tetapi menginvestigasi berbagai tiket secara keseluruhan. Tujuannya untuk melihat apakah ada masalah yang sama di baliknya.
Supaya lebih mudah, tim IT bisa memanfaatkan parent problem ticket yang tersedia di solusi ITSM. Kapabilitas ini membantu tim melihat berbagai insiden yang berkaitan dalam satu masalah dan melakukan investigasi terhadap penyebab yang mendasarinya.
2. Mengukur metrik yang tepat
Dalam problem management, metrik yang paling penting untuk diukur adalah metrik yang memiliki dampak terhadap kualitas layanan. Contohnya seperti:
Penurunan jumlah insiden berulang.
Jumlah masalah yang berhasil menghasilkan perbaikan permanen.
MTTR-RC (Mean Time to Resolve Root Cause), yaitu waktu yang dibutuhkan untuk menemukan dan mengatasi root cause.
Penghematan biaya atau jumlah jam layanan yang berhasil diselamatkan.
Untuk melihat metrik-metrik ini, organisasi membutuhkan software problem management yang dapat mengumpulkan dan menampilkan berbagai metrik dan menghadirkannya dalam bentuk laporan maupun dashboard.
3. Menetapkan proses problem management yang terdefinisi

Problem management berkaitan dengan praktik ITSM lain seperti incident management, change management, asset management, dan CMDB. Jika ingin problem management berjalan dengan baik, organisasi perlu memiliki proses yang jelas dan memahami peran masing-masing praktik.
Misalnya, incident management fokus pada pemulihan layanan setelah insiden terjadi, sementara problem management fokus mencari dan mengatasi penyebab yang mendasarinya.
Selain menentukan peran setiap proses, organisasi juga perlu mendokumentasikan alur problem management agar dapat dijalankan secara konsisten. Prosesnya dapat dimulai dengan memeriksa apakah masalah yang sama sudah pernah terjadi sebelumnya dan apakah sudah ada solusi yang tersedia.
Jika belum, masalah kemudian dikategorikan dan diprioritaskan berdasarkan impact dan priority. Setelah itu, tim melakukan investigasi dan menentukan solusi atau menginisiasi perubahan jika diperlukan.
4. Menerapkan root cause analysis yang terstruktur

Untuk mengetahui apa yang sebenarnya menyebabkan suatu masalah, tim IT perlu melakukan root cause analysis yang terstruktur. Melalui RCA terstruktur, tim bisa melihat masalah secara menyeluruh dan menghindari keputusan berdasarkan asumsi atau dugaan semata.
Ada berbagai teknik yang dapat digunakan, tergantung pada jenis dan kompleksitas problem. Beberapa di antaranya adalah fishbone diagram, analisis Pareto, atau Five Whys.
RCA yang terstruktur bisa dicapai dengan kapabilitas problem workflow pada software service desk. Workflow tersebut dapat digunakan untuk menstandarkan tahapan investigasi dan menyelaraskannya dengan platform RCA. Automasi juga bisa dilakukan, misalnya menotifikasi stakeholder terkait proses RCA atau mengirim request approval.
5. Menghubungkan perbaikan permanen dengan change management
Organisasi sebaiknya selalu berusaha mendapatkan perbaikan permanen, bukan hanya workaround yang sifatnya sementara saja. Sebab, manfaat problem management akan lebih terasa ketika tim berhasil menghilangkan atau mengurangi penyebab yang membuat insiden terus terjadi.
Lalu, jika solusi permanen sudah ada, organisasi perlu mengaitkannya dengan change management. Dengan begitu, ketika perbaikan tersebut membutuhkan perubahan pada sistem, aplikasi, konfigurasi, atau infrastruktur, perubahan dapat diterapkan secara aman tanpa menganggu layanan.
6. Mengejar proactive problem management, bukan reactive

Model problem management yang mature sebenarnya adalah yang proaktif. Karena itu, pastikan organisasi selalu mengejar proactive problem management, bukan reactive.
Untuk melakukannya, tim IT dapat melakukan investigasi terhadap komponen IT yang rentan, menganalisis data dan tren incident, serta mengevaluasi patch atau upgrade yang berpotensi menimbulkan gangguan.
Kini, untuk mengidentifikasi potensi masalah lebih cepat, tim IT bisa memanfaatkan predictive intelligence dan AI dalam platform ITSM. Pendekatan ini membuat tim bisa mengambil tindakan sebelum gangguan berdampak pada pengguna.
7. Membentuk tim atau focus untuk problem management
Karena problem management melibatkan banyak pihak, organisasi dapat membentuk problem management team atau problem committee yang bertanggung jawab untuk mengidentifikasi, memprioritaskan, dan mengoordinasikan problem.
Anggotanya dapat berasal dari berbagai area IT, seperti service desk, infrastructure, network, application, dan security. Tim ini dapat dipimpin oleh seorang problem manager yang memastikan proses berjalan dan setiap problem memiliki owner serta tindak lanjut yang jelas.
Dengan adanya tim khusus, problem tidak hanya menjadi tanggung jawab satu orang atau satu fungsi IT. Investigasi dan penyelesaiannya dapat dilakukan secara kolaboratif sesuai dengan keahlian masing-masing tim.
8. Memperbaiki problem management secara berkelanjutan
Problem management sebenarnya bukan proses yang memiliki titik akhir. Setelah masalah selesai, organisasi tetap perlu mengevaluasi apakah solusi yang diterapkan efektif dan apakah insiden serupa masih terjadi.
Tim juga dapat mendokumentasikan solusi, insight, dan hal yang sudah dipelajari dari setiap masalah untuk dibagikan kepada tim lain. Pengetahuan tersebut dapat dimasukkan ke dalam knowledge base dan diatur dalam praktik knowledge management.
ManageEngine Membantu Mengelola Problem Management
Masalah yang berulang bukan cuma menganggu produktivitas pengguna, tetapi juga kualitas layanan IT. Maka, tim IT perlu mengidentifikasi akar masalah, mendokumentasikan solusi baik permanen atau hanya workaround, dan memastikan solusi permanen diterapkan agar masalah yang sama tidak terjadi lagi.
ManageEngine ServiceDesk Plus membantu organisasi menjalankan proses problem management secara lebih terstruktur. Tidak hanya menjalankan problem management, ServiceDesk Plus juga dapat mengaitkannya dengan praktik ITSM lain seperti incident management dan change management dalam satu platform. Hal ini akan membuat tim IT lebih mudah menerapkan solusi permanen dan bergerak secara proaktif.
Pelajari lebih lanjut tentang bagaimana ServiceDesk Plus membantu tim IT menjalankan problem management dan meningkatkan kualitas layanan melalui free trial atau demo dengan tim kami!