为什么你的成本优化半年后就反弹了
一次性优化降了 30%,半年后又涨回去。问题不在技术,在机制。
一个典型的循环
账单涨到管理层注意 → 组织专项优化 → 三个月降了 35% → 大家松口气 → 半年后账单回到原点甚至更高 → 再来一轮专项。我们见过不少公司在这个循环里转了两三圈。
根因很简单:优化是项目,浪费是日常。项目结束了,日常还在按原来的方式运转,账单当然会涨回去。
项目式 vs 机制式
项目式(会反弹)
- 成立临时小组,做完解散
- 成果是一份优化清单和一个降本百分比
- 没人对后续的成本负责
- 新增资源没有任何约束
- 标签覆盖率做到 90% 然后不再维护
机制式(能保持)
- 指定常设的 FinOps 负责人(可以是兼职)
- 成果是一套持续运行的流程与指标
- 每个成本中心有明确 owner
- 未打标资源无法创建,异动自动告警
- 标签覆盖率作为持续监控指标
让机制跑起来的四件事
-
01
让成本可见到人
每个业务线负责人每月收到自己的账单构成、环比变化和优化建议。关键是「到人」——发到部门邮箱等于没发。
交付物:成本看板、月度自动推送
-
02
把异动变成必须回应的事
环比涨幅超阈值的成本项,owner 需要在例会上说明原因。不是问责,是让优化有推动力。多数情况下 owner 自己就会先查清楚。
交付物:异动告警、月度例会机制
-
03
能自动化的绝不靠人记
闲置扫描、非生产定时启停、未打标拦截、预算告警,全部自动化。靠人记的事,两个月后一定会忘。
交付物:自动化脚本、拦截策略
-
04
设计激励而不只是考核
把节省下来的预算部分返还给业务线做技术投入。纯考核降本指标容易导致「不敢用资源」,反而拖慢业务。
交付物:激励方案、预算返还规则
机制健康度的几个指标
| 指标 | 健康值 | 说明 |
|---|---|---|
| 标签覆盖率 | ≥ 95% | 低于这个数,成本归属就不可信 |
| 异动响应率 | ≥ 90% | 告警发出后有人查明原因的比例 |
| Savings Plans 利用率 | ≥ 95% | 低说明买多了或资源下线了 |
| Savings Plans 覆盖率 | 65%-80% | 过低有省钱空间,过高有浪费风险 |
| 闲置资源存量 | 持续下降 | 看趋势而不是绝对值 |
| 例会出席率 | ≥ 80% | 出席率低说明机制在失效 |
最小可行版本
不需要一上来就搞完整的 FinOps 体系。最小版本是:标签规范 + 月度成本报表推送到人 + 45 分钟的月度例会。这三件事做扎实,就能挡住大部分反弹。其他的可以慢慢加。