Metrik & Proses

Memantau CPU, memori, jaringan, disk, dan storage aplikasi secara live dan historis, membaca saran ukuran, serta memeriksa proses di dalam setiap replica.

Raklane mengukur resource yang dipakai setiap replica aplikasi Anda, di mana pun ia berjalan — di compute terkelola Raklane atau di server BYOC milik Anda. Tidak ada yang perlu dipasang atau dikonfigurasi di aplikasi: tanpa library agent, tanpa exporter, tanpa perubahan kode.

Setiap aplikasi punya dua tab:

  • Metrics — penggunaan saat ini, penggunaan dari waktu ke waktu, dan rincian per replica, dengan saran dalam bahasa sederhana tentang apakah ukuran aplikasi sudah pas.
  • Processes — daftar proses yang berjalan di setiap replica secara live, mirip Activity Monitor.

Yang diukur

ResourceYang Anda lihatMengapa penting
CPUCPU yang dipakai, dalam core (millicore), dibandingkan dengan limit CPU replicaPenggunaan tinggi mendekati limit berarti respons lebih lambat.
CPU throttlingPorsi periode penjadwalan saat aplikasi menyentuh limit CPU dan harus menungguTanda paling jelas bahwa limit CPU terlalu rendah.
MemoryWorking set — memori yang dihitung terhadap limit — dibandingkan dengan limit memori replicaMelewati 100% limit, proses akan dihentikan paksa.
OOM killsBerapa kali proses dihentikan karena kehabisan memori sejak replica menyalaAngka berapa pun di atas nol layak diperiksa.
NetworkByte per detik masuk (↓) dan keluar (↑)Tingkat trafik dan lonjakan yang tidak terduga.
Disk I/OByte per detik yang dibaca dan ditulisAktivitas disk yang berat bisa memperlambat semuanya.
StorageUkuran file yang ditulis di dalam container (diukur setiap beberapa menit)File di sini terus bertambah sampai limit storage, dan hilang saat replica diganti.
ProcessesJumlah proses di setiap replicaJumlah yang terus naik bisa berarti ada kebocoran proses.

Angka bersifat per replica, dan totalnya menjumlahkan semua replica yang berjalan.

Tab Metrics

Saat ini

Bagian atas halaman menampilkan total saat ini untuk CPU, memori, jaringan, disk I/O, dan storage. Jika Anda mengatur limit, CPU dan memori ditampilkan dibandingkan limit tersebut; tanpa limit, kotaknya akan menyebutkannya (CPU: no limit set). Nilai live diperbarui sekitar setiap 15 detik.

Saran ukuran

Di bawah angka live, Raklane menambahkan saran ketika penggunaan aplikasi menunjukkan perlu ada perubahan:

SaranKapan munculYang perlu dilakukan
Out of memorySebuah proses di aplikasi dihentikan karena melebihi limit memoriNaikkan limit memori, atau cari kebocoran memori (tab Processes menunjukkan apa yang memakai memori).
Memory is close to the limitMemori mencapai 90% atau lebih dari limitNaikkan limit sebelum berubah menjadi out-of-memory.
CPU is being throttled25% atau lebih periode penjadwalan menyentuh limit CPUNaikkan limit CPU — throttling terlihat sebagai respons yang lebih lambat.
Plenty of headroomCPU di bawah 10% dan memori di bawah 25% dari limitnyaJika bertahan sehari atau lebih, ukuran yang lebih kecil akan lebih hemat.

Ubah limit dari halaman Resources aplikasi — tanpa perlu deploy ulang (lihat Men-deploy Aplikasi).

Riwayat

Grafik resource yang sama dari waktu ke waktu: CPU, Memory, Network, Disk I/O, CPU throttling, dan Running replicas. Pilih rentang: 15m, 1h, 6h, 24h, 7d, atau 30d. Rentang pendek diperbarui bersama nilai live; rentang panjang diperbarui setiap menit.

Riwayat disimpan selama 30 hari secara bawaan. Jika Anda melihat "Usage history isn't enabled on this Raklane installation yet", instalasi Anda belum mengaktifkan penyimpanan riwayat — nilai live dan proses tetap berfungsi. Tanyakan kepada pengelola instalasi Anda.

Replica

Tabel dengan satu baris per replica yang berjalan: CPU dan memori dibandingkan limitnya, laju jaringan dan disk, jumlah proses, dan OOM kills. Gunakan untuk menemukan satu replica yang bermasalah di antara beberapa yang sehat.

Tab Processes

Tab Processes menampilkan setiap proses yang berjalan di dalam setiap replica aplikasi Anda, mirip Activity Monitor atau top:

KolomArti
ReplicaReplica tempat proses berjalan.
PIDID proses di dalam container.
ProcessNama proses. Arahkan kursor untuk melihat command line lengkapnya.
CPUPenggunaan CPU saat ini.
MemoryPenggunaan memori saat ini.
Disk read / Disk writeLaju disk I/O saat ini.
ThreadsJumlah thread.
UserUser yang menjalankan proses.
  • Sort by CPU, Memory, atau Disk I/O untuk menemukan proses terberat dengan cepat.
  • Refresh every 5s menjaga daftar tetap live; matikan untuk membekukan cuplikan sambil Anda membacanya. Waktu pengambilan sampel ditampilkan di samping kontrolnya.
  • Daftar ini hanya live. Raklane mengambil sampel saat Anda melihat dan tidak menyimpan riwayat proses. Untuk melihat tren, gunakan tab Metrics.
  • Jika tidak ada replica yang berjalan (aplikasi dijeda atau belum pernah di-deploy), tidak ada yang bisa ditampilkan — deploy atau lanjutkan aplikasi terlebih dahulu.

Trafik jaringan tidak ditampilkan per proses, karena Linux tidak mencatatnya seperti itu. Trafik jaringan per replica di tab Metrics akurat.

Cara kerjanya

Setiap server yang menjalankan aplikasi Anda mengumpulkan data penggunaan container-nya sekitar setiap 15 detik dan melaporkannya ke Raklane:

  • Tanpa port tambahan. Laporan dikirim lewat koneksi terenkripsi yang sudah dipakai server. Server BYOC tetap tidak membutuhkan port masuk.
  • Gangguan singkat tidak membuat celah data. Jika koneksi terputus, server menyimpan laporan hingga sekitar 10 menit dan mengirimkannya setelah terhubung kembali.
  • Raklane yang menentukan pemilik data. Container milik aplikasi mana ditentukan dari catatan Raklane sendiri, tidak pernah dari laporan server — sehingga server yang bermasalah tidak bisa membuat angkanya muncul di aplikasi orang lain.

Privasi dan akses

  • Anda hanya melihat aplikasi Anda sendiri. Metrik dan daftar proses dibatasi pada container aplikasi Anda; tidak ada cara untuk melihat data pelanggan lain.
  • Environment variable Anda tidak pernah dibaca. Daftar proses tidak pernah melihat environment sebuah proses, tempat secret disuntikkan. Command line dipotong hingga 512 karakter.
  • Server BYOC Anda tetap milik Anda. Operator Raklane bisa melihat angka penggunaan tingkat server (CPU, memori, disk, jaringan) untuk setiap server yang melaporkan metrik, termasuk server BYOC, demi menjaga kesehatan platform. Mereka tidak bisa melihat daftar proses server milik Anda — itu hanya mungkin di server milik Raklane.
  • Metrik tidak memengaruhi tagihan. Tagihan didasarkan pada resource yang Anda konfigurasikan (atau langganan Anda, atau biaya BYOC), bukan pada pengukuran ini. Kehilangan riwayat metrik tidak pernah mengubah jumlah yang Anda bayar.

Metrik di server BYOC

Semua hal di atas berlaku sama untuk aplikasi di server Anda sendiri. Dua pengaturan Node Agent di server memengaruhinya:

  • RAKLANE_AGENT_METRICS_INTERVAL (bawaan 15s) — seberapa sering server melapor. Interval yang lebih panjang mengirim lebih sedikit data tetapi membuat grafik lebih kasar. Mengaturnya ke 0 menghentikan pelaporan sepenuhnya, dan tab Metrics aplikasi di server itu menjadi kosong. Tab Processes tetap berfungsi, karena diambil saat diminta.
  • RAKLANE_DATABASE_VOLUME_ROOT — lokasi penyimpanan data database, sekaligus tempat penggunaan disk-nya diukur.

Lihat Konfigurasi Agent BYOC.

Jika server BYOC Anda Offline, nilai live aplikasinya berhenti diperbarui sampai terhubung kembali, lalu laporan yang tersimpan dikirim sekaligus.

Pemecahan masalah

Tab Metrics kosong. Pastikan aplikasi punya replica yang berjalan (halaman Status). Setelah deploy, tunggu 15–30 detik sampai laporan pertama tiba. Di server BYOC, pastikan server berstatus Healthy dan RAKLANE_AGENT_METRICS_INTERVAL tidak bernilai 0.

Riwayat menyatakan belum diaktifkan. Penyimpanan riwayat dimatikan di instalasi Anda. Nilai live dan proses tetap berfungsi.

Memori terlihat lebih rendah dari laporan internal aplikasi. Angka Memory adalah working set — yang dihitung terhadap limit. Runtime Anda mungkin melaporkan ukuran heap, memori yang dipesan, atau memori virtual, yang diukur dengan cara berbeda.

CPU rendah tetapi aplikasi lambat. Periksa CPU throttling alih-alih rata-rata CPU: lonjakan singkat bisa menyentuh limit meskipun rata-ratanya terlihat rendah. Periksa juga Disk I/O, serta log aplikasi untuk panggilan lambat ke database atau layanan eksternal.

Storage terus bertambah. Ada sesuatu yang menulis file di dalam container — log yang ditulis ke disk, unggahan, atau cache. File tersebut hilang saat replica diganti. Tulis log ke stdout, dan simpan data permanen di database atau storage eksternal.

Lihat juga