Bedrock 应用主题
常用模型选择
| 模型 | 擅长 | 相对成本 | 典型用途 |
|---|---|---|---|
| Claude Sonnet 系列 | 推理、长文本、代码、工具调用 | 中 | 主力生产模型,RAG 与智能体首选 |
| Claude Haiku 系列 | 速度快、成本低 | 低 | 分类、抽取、路由、高并发场景 |
| Claude Opus 系列 | 最强推理与复杂任务 | 高 | 复杂分析、疑难问题兜底 |
| Amazon Titan Embeddings | 文本向量化 | 极低 | RAG 索引构建 |
| Llama 系列 | 开源可控、可微调 | 低-中 | 有定制化需求或成本极度敏感 |
| Stable Diffusion / Titan Image | 图像生成 | 按张 | 营销素材、商品图、概念设计 |
生产实践建议做模型分层:简单任务走 Haiku,复杂任务走 Sonnet,只在必要时用 Opus,能省一半以上成本。
成本控制怎么做
大模型的账单很容易失控,尤其是接入内部工具后调用量快速上涨。我们的做法是从三个层面控制:调用前的路由分层、调用中的上下文精简、调用后的额度熔断。
路由分层指按任务复杂度自动选模型;上下文精简指严格控制 RAG 注入的文档量与历史轮次;额度熔断指按业务线设置月度上限,接近阈值时告警,超过时自动降级或拒绝。
- 提示词缓存:重复的系统提示与长上下文可复用,命中时成本大幅下降
- 批量推理:非实时任务用 Batch 模式,单价更低
- Provisioned Throughput:稳定高并发场景锁定吞吐与价格
- 按业务线打标签,token 消耗做成本归属,谁用谁承担
- 模型分层节省30% - 55%
- 提示词缓存节省最高 90%(缓存部分)
- 批量模式节省约 50%
- 熔断响应分钟级
数据安全边界
Bedrock 的推理请求不会被用于模型训练,数据在你选择的区域内处理。可以配合 VPC Endpoint 让流量不经公网,配合 KMS 加密存储,配合 CloudTrail 记录每一次调用。这是很多企业选它而不选公开 API 的核心原因。