云产品 · 人工智能

Bedrock:一个 API 接入多家模型,数据留在你的账号里

不用自己搭 GPU 集群,也不用把数据传给第三方。按 token 计费,支持护栏、审计与成本归属。

  • Claude / Llama / Titan
  • 数据不用于训练
  • Guardrails 护栏
  • 按 token 计费

Bedrock 应用主题

常用模型选择

模型擅长相对成本典型用途
Claude Sonnet 系列推理、长文本、代码、工具调用主力生产模型,RAG 与智能体首选
Claude Haiku 系列速度快、成本低分类、抽取、路由、高并发场景
Claude Opus 系列最强推理与复杂任务复杂分析、疑难问题兜底
Amazon Titan Embeddings文本向量化极低RAG 索引构建
Llama 系列开源可控、可微调低-中有定制化需求或成本极度敏感
Stable Diffusion / Titan Image图像生成按张营销素材、商品图、概念设计

生产实践建议做模型分层:简单任务走 Haiku,复杂任务走 Sonnet,只在必要时用 Opus,能省一半以上成本。

成本控制怎么做

大模型的账单很容易失控,尤其是接入内部工具后调用量快速上涨。我们的做法是从三个层面控制:调用前的路由分层、调用中的上下文精简、调用后的额度熔断。

路由分层指按任务复杂度自动选模型;上下文精简指严格控制 RAG 注入的文档量与历史轮次;额度熔断指按业务线设置月度上限,接近阈值时告警,超过时自动降级或拒绝。

  • 提示词缓存:重复的系统提示与长上下文可复用,命中时成本大幅下降
  • 批量推理:非实时任务用 Batch 模式,单价更低
  • Provisioned Throughput:稳定高并发场景锁定吞吐与价格
  • 按业务线打标签,token 消耗做成本归属,谁用谁承担
查看生成式 AI 整体方案
  • 模型分层节省30% - 55%
  • 提示词缓存节省最高 90%(缓存部分)
  • 批量模式节省约 50%
  • 熔断响应分钟级

数据安全边界

Bedrock 的推理请求不会被用于模型训练,数据在你选择的区域内处理。可以配合 VPC Endpoint 让流量不经公网,配合 KMS 加密存储,配合 CloudTrail 记录每一次调用。这是很多企业选它而不选公开 API 的核心原因。

下一步

把云的复杂度交给我们,你只管做业务

留下需求,沐杉云的解决方案架构师会在一个工作日内联系你,提供免费的现状评估、迁移方案草案与 TCO 测算表。