
Amazon Jelaskan Gangguan AWS, Tawarkan Solusi dan Langkah Preventif
infolangsung.org – Amazon akhirnya memberikan penjelasan resmi mengenai gangguan besar yang melanda layanan Amazon Web Services (AWS) awal pekan lalu. Dalam laporan yang diterbitkan di situs web resminya, Amazon mengungkapkan bahwa masalah utama berasal dari kegagalan besar pada sistem DNS internal DynamoDB. Gangguan ini menyebabkan banyak situs dan aplikasi besar, seperti Canva, Reddit, Roblox, dan Zoom, tidak dapat diakses selama lebih dari 14 jam.
“Baca Juga: OpenAI Luncurkan AI Pembuat Musik, Inovasi untuk Industri Kreatif”
Menurut Amazon, gangguan ini disebabkan oleh masalah “race condition” atau benturan proses pada sistem pengelolaan DNS DynamoDB. Bug yang muncul dalam proses ini mengakibatkan penghapusan alamat IP untuk endpoint regional di kawasan US-EAST-1 (Virginia Utara) secara tidak sengaja. Ketika alamat IP tersebut terhapus, seluruh layanan yang bergantung pada DynamoDB, baik yang digunakan oleh klien maupun sistem internal AWS, langsung gagal terhubung. Akibatnya, banyak aplikasi dan situs web yang bergantung pada AWS mengalami downtime.
Gangguan DNS ini memicu efek berantai pada infrastruktur AWS yang lebih luas. Sistem otomatis yang biasanya digunakan untuk memperbaiki kesalahan secara mandiri tidak dapat menangani masalah ini. Hal ini menyebabkan keterlambatan dalam pemulihan layanan, memaksa Amazon untuk turun tangan secara manual untuk menstabilkan jaringan dan memulihkan DNS yang rusak. Proses perbaikan ini dilakukan secara bertahap, dan layanan AWS mulai kembali normal keesokan harinya.
Setelah gangguan besar ini, Amazon mengeluarkan permintaan maaf kepada pengguna AWS yang terdampak. Perusahaan menyatakan komitmennya untuk mencegah kejadian serupa terulang di masa depan. Sebagai langkah pencegahan, Amazon telah menonaktifkan sistem otomatis DNS yang bermasalah di seluruh dunia. Selain itu, mereka juga menambahkan mekanisme perlindungan baru, peningkatan sistem throttle. Dan serangkaian tes tambahan untuk memastikan bahwa bug serupa tidak muncul kembali.
Gangguan besar ini memberikan dampak signifikan pada pengguna AWS. Termasuk perusahaan besar yang bergantung pada layanan cloud Amazon untuk operasional mereka. Banyak aplikasi yang tidak bisa diakses dalam jangka waktu lama. Menyebabkan ketidaknyamanan bagi pengguna dan merugikan bisnis yang mengandalkan layanan AWS untuk menjalankan aplikasi mereka. Insiden ini juga menjadi pengingat pentingnya ketergantungan pada infrastruktur cloud dan perlunya sistem yang lebih robust untuk mengatasi gangguan teknis.
“Baca Juga: 45% Jawaban AI Soal Berita Ternyata Salah, Apa yang Perlu Diperbaiki?”
Gangguan yang melanda AWS ini menjadi pelajaran penting bagi perusahaan-perusahaan penyedia layanan cloud lainnya untuk memperhatikan kelemahan dalam sistem otomatis mereka. Selain itu, ini juga menunjukkan betapa pentingnya transparansi dan tanggung jawab dalam menyelesaikan masalah teknis. Dengan langkah-langkah pencegahan yang diambil Amazon, diharapkan kejadian serupa dapat dihindari di masa depan, baik di AWS maupun di layanan cloud lainnya.