Home / Guide anti-trappola / Rilevare se un'EC2 nel cloud pubblico è overselling usando Steal Time

Rilevare se un'EC2 nel cloud pubblico è overselling usando Steal Time

Due strumenti per misurare l'overselling reale

Aggiornato 2026-09-01 · CloudWorth

Steal Timerilevamento oversellingECSFinOpsraccolta proveCloudWorthOverselling VPSBenchmark VPS

Rilevare se un'EC2 nel cloud pubblico è overselling usando Steal Time

Un alto Steal Time indica CPU overselling; insieme al crollo della cache e al tasso di premio, puoi raccogliere prove e richiedere un risarcimento.

Due metriche per l'overselling

Per capire se un'istanza EC2 su cloud pubblico è in overselling, non puoi guardare solo alla percentuale di idle della CPU, perché l'idle nella VM non implica che la macchina fisica non sia occupata. Il primo strumento di misura è Steal Time (steal%). Esso ti dice direttamente: il tempo CPU che ti spetterebbe è stato dirottato di nascosto dall'host verso un vicino invadente. Quando steal% supera costantemente il 10%, puoi sostanzialmente sospettare che l'host si trovi in stato di overselling.

Ma guardare solo lo steal non basta: alcune istanze (come la serie AWS t) hanno un meccanismo di CPU Credit, e durante i picchi uno steal alto potrebbe essere semplicemente dovuto all'esaurimento dei crediti. Ecco quindi il secondo strumento: il crollo della cache del disco. Un host in overselling spesso si trova a gestire molte richieste IO. Quando usi fio per stressare le letture casuali, il tasso di hit della page cache o la latenza possono subire un calo improvviso, in sincronia temporale con lo steal della CPU. Solo incrociando i due strumenti si ottiene una prova completa.

Vuoi iniziare subito a fare test? Abbiamo già preparato uno script per il rilevamento dell'overselling su server cloud, che può restituire direttamente le metriche di steal e cache, aiutandoti a evitare di incappare in problemi prima dell'acquisto.

Test ed evidenze sulle istanze

Eseguiamo un test comparativo con le ultime release Alibaba Cloud ECS g9i e AWS EC2 m7i. Script di carico fisso: stress-ng --cpu 4 --timeout 300, con mpstat che campiona steal% ogni 5 secondi; poi fio per random read 4K, registrando IOPS e latenza p99.

# CPU steal sampling
mpstat -P ALL 5 > steal.log &
# Disk cache cliff test
fio --name=cachetest --rw=randread --bs=4k --size=1G --runtime=120 --iodepth=32

Nei test, durante le ore di punta diurne, g9i ha mostrato una media di steal del 12,4%, con picco del 18,1%, mentre la latenza p99 di fio è passata da 0,8ms a 12ms, evidenziando un netto calo della cache. Nello stesso periodo, m7i ha mantenuto lo steal sotto il 2% con latenza stabile. Nota: per le istanze burst di fascia bassa come la serie t, uno steal occasionale superiore al 10% è normale, ma se le istanze ottimizzate per il calcolo come m7i e g9i superano costantemente la soglia, è la prova concreta di overbooking.

Punti chiave per la raccolta di prove: registra timestamp di ogni campione, ID istanza, versione immagine, e cattura i dati grezzi da CloudWatch / Cloud Monitor. Questi log e screenshot sono le prove fondamentali per i ticket successivi.

Premio di prezzo e tutela dei diritti

L'aspetto più difficile da rilevare della sovravendita è: paghi un sovrapprezzo, ma ottieni solo capacità di calcolo ridotta. Nella prospettiva FinOps, il rapporto qualità-prezzo effettivo = prezzo unitario ÷ tempo CPU efficace. Il tempo efficace può essere stimato con la formula: core-ore disponibili = numero di vCPU × (1 - steal% medio) × durata.

Per esempio, il prezzo unitario di g9i è 1,2 yuan/ora (4 vCPU), se il steal medio è 15%, i core-ora effettivi disponibili sono solo 3,4 vCPU·h, con un costo per vCPU efficace in aumento del 17,6%. Confrontandolo con la stessa specifica m7i senza sovravendita, il premio si ribalta a causa della "tassa di sovravendita" — questo spesso significa che hai speso di più per un servizio peggiore.

Una volta raccolte le prove, la rivendicazione non è solo una questione di lamentarsi per "lentezza". Prepara un PDF che includa: grafico della serie temporale di steal%, output fio del brusco calo della cache, tabella di confronto con altre istanze della stessa specifica e il processo di calcolo del premio. Quando invii il ticket, richiedi esplicitamente di "ridurre la configurazione in base alla capacità di calcolo effettiva misurata o rimborsare la differenza". Alibaba Cloud e AWS di solito non ammettono la sovravendita, ma di fronte a dati concreti, offrono buoni o compensi tramite upgrade adducendo "contesa delle risorse dell'host". La prossima volta che acquisti un'istanza cloud, prendi due righelli e misura, non lasciare che il sovrapprezzo paghi per una sovravendita.

FAQ

Come usare Steal Time per determinare se l'EC2 è overselling?

Esegui un carico per mantenere la CPU occupata; se il valore steal supera costantemente il 5%, è overselling.

Quali problemi di prestazioni causa l'overselling?

La contesa della CPU causa instabilità delle prestazioni e aumento della latenza, più evidenti nelle ore di punta.

Come raccogliere prove di overselling nel cloud pubblico?

Registra la curva dello steal e il crollo della cache, salva screenshot dei monitoraggi e record dei ticket, esporta in PDF per archiviazione.

Come il tasso di premio riflette il rapporto qualità-prezzo nell'overselling?

Confronta la perdita di prestazioni con la riduzione di prezzo; se lo steal è alto e lo sconto è piccolo, il rapporto qualità-prezzo è basso e puoi richiedere un compenso.

Come presentare un ticket per violazione dei diritti in caso di overselling?

Allega le prove di anomalie di steal e cache e il PDF, chiedi una riduzione di configurazione o un rimborso, se necessario presenta un reclamo.

Un alto Steal Time indica CPU overselling; insieme al crollo della cache e al tasso di premio, puoi raccogliere prove e richiedere un risarcimento.

Avvia il rilevamento gratuito →