在当前的汇率环境下,云账单对许多初创公司来说已经是一笔实实在在的负担。然而不少管理者仍把这笔账单当作"工程师会自行解决的领域"而搪塞过去。事实恰恰相反:AWS 支出中有 30%~50% 并非因技术问题而流失,而是因决策问题流失。关闭闲置资源的决定、批准长期承诺的决定、决定哪些工作负载放在何处的决定——这些都属于管理层的职责。以下整理了 CEO 应当亲自主导、也能够亲自主导的六个技巧。
1. 监控 EC2 规格,然后调小
云计算中最常见的浪费,就是"以防万一"而配置过大的服务器。在本地部署时代,一旦买了服务器就无法缩小规格,而云计算的根本区别就在于随时都可以调整规格。
首先要看数据。用 CloudWatch 观察 CPU、内存、网络利用率 12 周,就会发现一批平均利用率只有 10%20% 的实例。AWS Compute Optimizer 会自动分析这些数据,免费给出"这个实例降一档规格就足够"的建议。降低一档规格(例如 large 降到 medium)可以直接带来约 50% 的单价降低。
在此基础上再加两个武器。第一,使用量不稳定的工作负载可以迁移到可突发性能系列(t 系列)实例,平时保持低单价,在瞬时高负载时靠积分获取额外性能。第二,基于 ARM 的 Graviton 实例在同等性能下单价更低,只要确认兼容性,就是最容易实现的降本手段之一。核心原则是:不要凭猜测来定规格,先测量,再缩减。
2. 删除未使用的实例和资源
账单上最令人懊恼的一项,就是"没人在用却每月照常扣费"的资源。常见的"幽灵资源"包括:
| 幽灵资源 | 为何会持续扣费 |
|---|---|
| 已分离的 EBS 卷 | 删除实例后卷仍然保留,每月继续计费 |
| 已停止实例上的 EBS | 停止实例后,关联的存储仍会持续计费 |
| 未关联的弹性 IP(EIP) | 分配了却未绑定,反而会触发计费 |
| 旧快照/AMI | 随着版本不断累积,存储成本持续增加 |
| 无流量的负载均衡器 | 按小时收取的固定费用悄然累积 |
| NAT 网关 | 按小时收费加上数据处理费用,是一个"隐藏的陷阱" |
清理这类资源不是一次性的工作。应建立标签(Tag)策略,要求所有资源都标注负责人、项目和到期日期,并建立每季度清理未使用资源的常规流程。AWS Trusted Advisor 和 Cost Explorer 可以自动筛选出候选项。管理层要做的事情很简单:把"不打标签就不创建资源、每季度清理一次"变成组织文化。
3. 通过 RI 和 Savings Plans 获取长期承诺折扣
以按需计费方式 24 小时运行常驻工作负载(数据库、核心系统等)是最昂贵的方式。如果这是一台从不关闭的服务器,那么通过承诺锁定折扣才是正确做法。
有两种选择。Reserved Instances(RI)是针对特定实例配置承诺使用 1 年或 3 年,以此换取相较按需计费最高约 75% 的折扣。而 Savings Plans 承诺的不是具体实例类型,而是"每小时的使用金额",因此更灵活。截至 2026 年,Savings Plans 的折扣幅度依产品和承诺条件而定,大致在 32%~72% 之间,其中三年全额预付的 Compute Savings Plan 折扣可达约 66%。
在实务中,两者通常混合使用。常见做法是对 EC2、Fargate、Lambda 等计算资源应用灵活的 Savings Plans,而对需要更深折扣的特定数据库工作负载使用 RI。实际上,RDS、ElastiCache、Redshift、OpenSearch 等通常是通过 RI 而非 Savings Plans 覆盖的,2025 年 12 月还新推出了专门针对数据库的 Savings Plans。
不过,承诺是一把双刃剑。如果未能达到承诺的使用量,差额部分会被作为"浪费的承诺"计费。因此更安全的策略是,基于最近 6090 天的使用数据,找出使用量的"最低底线(floor)"而非平均值,只承诺该底线的约 70%80%。规模扩大后还有额外优惠:当单一区域内活跃 RI 的标价总额超过 50 万美元时,预付款和按小时费用都会自动获得额外 5% 的折扣。管理层需要把握的平衡点是"只承诺永远不会关闭的部分",而不是"全部承诺"。
4. 将静态网站与轻量服务迁移至免费账户
对于像公司官网、落地页、文档站点、内部静态仪表盘这类"几乎没有服务器逻辑"的服务,用 AWS 的付费资源来运行属于过度投入。竞争对手的云平台在这一领域提供了强大的免费账户方案。
| 服务 | 免费提供内容 |
|---|---|
| Cloudflare Pages | 静态站点托管、自动 HTTPS、全球 CDN、带宽无上限 |
| Oracle Cloud Always Free | ARM 计算、对象/块存储、托管数据库、每月大额出站流量 |
| Microsoft Azure 免费账户 | 初始信用额度 + 12 个月热门服务免费 + 一批永久免费服务 |
对静态网站而言,Cloudflare Pages 尤其强大。Cloudflare Pages 在所有套餐中都不对带宽设置硬性上限,针对静态资源的请求完全免费且无限制。这并非营销说辞,而是其商业模式的必然结果——这一结构是以带宽为核心成本的 Vercel、Netlify 难以复制的。这意味着即便流量激增,也无需担心额外账单。
如果需要服务器的轻量服务,Oracle Cloud 的永久免费套餐则很有威力。Oracle 的 Always Free 永久提供 Ampere A1 4 OCPU + 24GB 内存、2 台 AMD 虚拟机、200GB 存储、自治数据库(Autonomous Database),以及每月 10TB 的出站流量,全部免费。新注册用户还会额外获得 30 天、价值 300 美元的试用额度。不过需要注意的是,在热门区域,ARM Ampere A1 资源有时会因需求暴涨而出现"容量不足(Out of capacity)"错误,选择区域时需要一些耐心。
5. 评估迁移至国产云
在同等规格的比较基准下,国产云在价格上确实明显低于全球三大云厂商的某些区间。同等规格比较显示,NHN Cloud 比 AWS、Azure 便宜约 20%22%;在国内厂商之间,Naver Cloud 的单价又比 NHN Cloud 低约 5%7%。
除了单价之外,结构性优势也不小。国产云以本地货币计费,不存在汇率波动风险,并且由于运营本土自有数据中心,还具有基础设施稳定性和地理位置上的优势。再叠加承诺折扣和合作伙伴折扣,差距会进一步拉大。承诺使用 1 年,相较按需计费最高可获得 30%~40% 的折扣;签署正式 MSP 合作伙伴协议后还可获得额外的批量折扣;NHN Cloud 甚至为初创企业和中小企业提供最高约 5,400 万韩元(约 4 万美元)规模的信用额度支持计划。
不过,"单价便宜 20%~80%"这种笼统的数字,取决于具体迁移的对象。单纯的服务器单价差异大约在 20% 左右,但如果把全球云厂商出了名昂贵的数据传输(出站流量)成本和汇兑损失也计算进去,节省幅度会显著扩大。反过来说,迁移成本、缺乏全球区域节点、部分托管服务的功能差异,也是明确存在的局限。因此,决策不应仅看单价,而应从总拥有成本(TCO)的角度——综合考虑网络成本、技术支持、迁移工作量、运营人力成本——按工作负载逐一拆解判断。"全部迁移"并不现实,"优先迁移以国内流量为主的工作负载"才是可行的做法。
6. 争取免费信用额度,并与客户经理保持深度沟通
云厂商为了留住客户,会提供大量的免费信用额度。不了解这一点而直接按标价付费,是最令人遗憾的损失之一。AWS Activate、Microsoft for Startups、Google for Startups、Oracle 的创业公司计划,都会为初创企业提供从数千到数万美元不等的信用额度。通过加速器、VC 投资组合企业或特定认证合作伙伴,额度上限还可以进一步提高。
而最被低估的武器是人。达到一定使用规模的客户会被分配客户经理(AM)和技术客户经理(TAM)。与他们保持深入沟通,可以打开公开价目表上没有的谈判空间。当使用量超过一定门槛后,可以协商全公司级别的承诺折扣协议(EDP,Enterprise Discount Program),在引入新服务时还可以获得额外信用额度、PoC(概念验证)费用支持以及免费的架构咨询。管理层应当记住,削减账单最快的方法有时不是技术手段,而是每个季度给客户经理打的一个电话。
结语
这六个技巧在难度和效果上各不相同。第 1、2 项(规格调整、资源清理)是今天就能立即启动的免费速效方案;第 3 项(承诺折扣)通过一次审批就能带来最大幅度的节省;第 4、5 项(免费账户、国产云迁移)需要根据工作负载的性质进行有针对性的应用;第 6 项(信用额度、谈判)则来自持续的关系维护。
云成本不是"技术债务"问题,而是"管理纪律"问题。只要 CEO 每月亲自查看账单中排名前五的项目,并养成追问"为什么这一项会这么高"的习惯,节省的一半工作其实已经开始了。
本文基于截至 2026 年 5 月的公开信息及各云服务商的定价政策撰写,仅提供一般性的成本优化视角,不能替代任何具体企业的合同、财务或法律决策。承诺条款、信用额度及价格条件会依服务商政策随时变动,建议在实际决策前查阅最新价目表并与客户经理确认。
作者:金浩光(Dennis Kim)——Cyworld 前 CEO,Betalabs 代表,前 Microsoft Azure MVP