docs: make H-261 cost model reproducible
Co-authored-by: multica-agent <github@multica.ai>
This commit is contained in:
@@ -11,14 +11,14 @@
|
||||
| --- | --- | --- |
|
||||
| 实时 ASR | 公有:阿里云 `fun-asr-realtime`;私有:FunASR `paraformer-zh-streaming` + FSMN-VAD | 不直接采用原版 Whisper;它不是原生流式模型 |
|
||||
| 音色克隆与 TTS | 公有:阿里云 CosyVoice API;私有:CosyVoice3-0.5B | CosyVoice2-0.5B:生产工具链更成熟;IndexTTS2:质量优先、实时能力需 PoC |
|
||||
| LLM | 支持流式输出、函数调用和结构化约束的轻量中文模型;MVP 用公有 API | 用量、数据边界或稳定吞吐证明必要后,以 vLLM 部署 8B 级模型 |
|
||||
| LLM | 公有:阿里云百炼 `qwen-plus-2025-12-01`;私有:Qwen3-8B/vLLM | 低成本公有备选:`qwen-flash-2025-07-28`;私有容量需 PoC |
|
||||
| 实时链路 | 级联 ASR → LLM → TTS,三级流式流水,双向媒体分离并支持打断 | 端到端语音模型暂不进入 MVP,避免牺牲审计与可控性 |
|
||||
| 身份与权限 | Logto organization + organization RBAC;业务库强制租户键 | MVP 不做租户自定义角色 |
|
||||
| 线路 | 只定义统一适配器与契约,PoC 接用户已有的一条线路 | 不调研、不比较、不推荐线路供应商 |
|
||||
|
||||
目标不是复刻一个大而全的呼叫中心,而是验证四个差异点:可插拔线路、低延迟 LLM 对话、经授权的定制音色、可审计的多租户成本。
|
||||
|
||||
**可决策区间(估算):** 在题设线路 `0.10 元/接通分钟`下,三档总成本约 `0.15 / 0.235 / 0.41 元/接通分钟`。中档在 `0.30 元/分钟`售价下贡献毛利率约 `21.7%`,尚未覆盖税费、售前、客服、坏账和利润要求;高档已亏损。阿里云 `0.30 元/分钟`仅作为项目比较基准,不是其当前官方分钟报价:官方公开的是并发包月或按呼出次数计费,并说明线路、号码和通信费另计 [^aliyun-outbound-billing]。
|
||||
**可决策成本锚点:** 在题设线路 `0.10 元/接通分钟`下,有一手牌价支撑的低/中/高三档“线路 + 公有 AI API”小计为 `0.1456 / 0.1734 / 0.2519 元/接通分钟`;全成本分别为该值再加 `F_base/M`。由于尚未选定控制面、媒体、数据库、存储和日志供应商,`F_base` 没有可核验报价,本文不再给出全成本点估计或毛利率结论;PoC 取得账单后才能验收。阿里云 `0.30 元/分钟`仅作为项目比较基准,不是其当前官方分钟报价:官方公开的是并发包月或按呼出次数计费,并说明线路、号码和通信费另计 [^aliyun-outbound-billing]。
|
||||
|
||||
## 2. 证据口径与关键未知
|
||||
|
||||
@@ -111,15 +111,16 @@ flowchart LR
|
||||
|
||||
| 环节 | 推荐 | 官方价格 / 事实(访问 2026-08-17) | 折算假设 |
|
||||
| --- | --- | --- | --- |
|
||||
| ASR | 阿里云 `fun-asr-realtime` | `0.00033 元/秒` [^aliyun-funasr-price] | 全通话 60 秒:`0.0198 元/分钟` |
|
||||
| ASR | 阿里云 `fun-asr-realtime` | `0.00033 元/秒` [^aliyun-funasr-price] | 全通话 60 秒:`60×0.00033=0.0198 元/分钟` |
|
||||
| TTS/克隆 | 阿里云 CosyVoice | `2 元/万计费字符`;一个汉字计两个字符 [^aliyun-voice-price] | 机器人说话占 50%,250 汉字/播报分钟:`125 汉字×2 字符×2/10000=0.05 元/通话分钟` |
|
||||
| LLM | 支持流式与函数调用的轻量中文模型 | 具体模型及牌价在采购时锁定 | 每分钟输入+输出 token 实测;成本表中用规划值,不补造供应商报价 |
|
||||
| LLM(推荐) | 阿里云百炼 `qwen-plus-2025-12-01`,非思考模式 | 中国内地、请求输入 ≤128K 时:输入 `0.8 元/百万 token`、非思考输出 `2 元/百万 token` [^aliyun-llm-price] | 中档假设输入/输出 `3000/600 token`:`(3000×0.8+600×2)/1000000=0.0036 元` |
|
||||
| LLM(低成本备选) | 阿里云百炼 `qwen-flash-2025-07-28` | 中国内地、请求输入 ≤128K 时:输入 `0.15 元/百万 token`、输出 `1.5 元/百万 token` [^aliyun-llm-price] | 低档假设输入/输出 `1000/300 token`:`(1000×0.15+300×1.5)/1000000=0.0006 元` |
|
||||
|
||||
公有组合减少前期运维,适合获取真实的每分钟音频秒数、字符数、token、延迟和失败率。API 密钥只存密钥管理系统;供应商请求必须携带租户和通话的内部追踪 id,但不得发送无关个人数据。
|
||||
|
||||
### 5.2 私有部署:达到触发条件后
|
||||
|
||||
推荐栈:FunASR 流式 ASR/VAD + CosyVoice3(或 CosyVoice2)+ 8B 级中文 LLM/vLLM。模型许可证只说明仓库当前声明;上线应把选定 commit、权重、许可证文本和下载来源固化到 SBOM/模型清单中。
|
||||
推荐栈:FunASR 流式 ASR/VAD + CosyVoice3(或 CosyVoice2)+ **Qwen3-8B/vLLM**。Qwen3-8B 官方模型卡列出 Apache-2.0 许可证,并给出 vLLM 部署入口 [^qwen3-8b];它是明确的私有 LLM PoC 推荐,不代表未经压测的生产容量。上线应把选定 commit、权重、许可证文本和下载来源固化到 SBOM/模型清单中。
|
||||
|
||||
| 规模 | 容量起点(估算) | 内存 / 存储起点 | 必须验证 |
|
||||
| --- | --- | --- | --- |
|
||||
@@ -269,41 +270,35 @@ flowchart TB
|
||||
- `F`:每月固定计算、数据库、缓存、对象存储、监控和基础运维成本。
|
||||
- `K`:购买/部署并发;`H`:每日可呼小时;`D`:每月工作日;`u`:并发有效利用率。
|
||||
|
||||
统一规划假设:中文语速 `250 汉字/分钟`;机器人播报占通话 `50%`;ASR 按全通话时长;LLM 缓存命中率按 `0%`(不预支不确定收益);日志/录音保留量进入 `F/V`,PoC 按真实数据回填;美元项目采用 `1 USD = 7.20 CNY`的规划汇率,最终成本以账单结算汇率为准。本表没有使用美元报价,因此汇率变化当前不改变结果。
|
||||
统一规划假设:中文语速 `250 汉字/播报分钟`;ASR 按全通话时长;LLM 上下文缓存命中率按 `0%`,不使用 Batch、免费额度或缓存折扣;TTS 不复用预生成音频。API 公式按供应商返回的实际秒、token、计费字符线性计算,分项保留 6 位、展示到 4 位;账单聚合取整规则仍需用 PoC 发票核对。美元项目采用规划汇率 `1 USD = 7.20 CNY`,最终以结算汇率为准。
|
||||
|
||||
如果线路按尝试分钟收费,改为 `L_effective = 尝试分钟成本 / 接通率`;如果按次收费,改为 `每次价格 / (接通率 × 接通后平均分钟)`。不得把振铃分钟、接通分钟和呼出次数混为一个口径。
|
||||
|
||||
### 10.2 低 / 中 / 高三档(元/接通分钟)
|
||||
|
||||
三档均以 1 接通分钟为分母。低档使用 Qwen Flash、机器人播报 25%;中档使用 Qwen Plus 非思考、播报 50%;高档使用 Qwen Plus 思考、播报 75%,并用阿里云智能语音交互实时 ASR 标准价作为保守锚点。LLM 输入/输出分别假设为 `1000/300`、`3000/600`、`8000/1500 token`;这些用量不是模型事实,必须由 PoC 逐通计量替换。
|
||||
|
||||
| 组成 | 低成本档 | 中档 | 高成本档 |
|
||||
| --- | ---: | ---: | ---: |
|
||||
| 线路 `L`(题设) | 0.100 | 0.100 | 0.100 |
|
||||
| ASR | 0.010 | 0.020 | 0.040 |
|
||||
| LLM | 0.006 | 0.010 | 0.060 |
|
||||
| TTS / 音色 | 0.012 | 0.050 | 0.080 |
|
||||
| 实时媒体 / 可观测性 `V` | 0.002 | 0.005 | 0.010 |
|
||||
| **AI + 媒体变量小计** | **0.030** | **0.085** | **0.190** |
|
||||
| 固定摊销 `F/M` | 0.020 | 0.050 | 0.120 |
|
||||
| **总成本 `C`** | **0.150** | **0.235** | **0.410** |
|
||||
| 相对 0.30 基准的差额 | -0.150 | -0.065 | +0.110 |
|
||||
| 按 0.30 售价的贡献毛利率 | 50.0% | 21.7% | -36.7% |
|
||||
| --- | --- | --- | --- |
|
||||
| 线路 `L`(题设) | `0.10` | `0.10` | `0.10` |
|
||||
| ASR | `fun-asr-realtime`:`60 秒×0.00033=0.0198` [^aliyun-funasr-price] | 同低档:`60×0.00033=0.0198` | 阿里云实时语音识别标准价:`1 分钟×3.50/60=0.058333` [^aliyun-voice-price] |
|
||||
| LLM | `qwen-flash-2025-07-28`:`(1000×0.15+300×1.5)/1e6=0.000600` [^aliyun-llm-price] | `qwen-plus-2025-12-01` 非思考:`(3000×0.8+600×2)/1e6=0.003600` [^aliyun-llm-price] | 同一 Qwen Plus 思考输出价 `8 元/百万 token`:`(8000×0.8+1500×8)/1e6=0.018400` [^aliyun-llm-price] |
|
||||
| TTS / 音色 | CosyVoice;`ceil(250×25%)=63 汉字`:`63×2×2/10000=0.025200` [^aliyun-voice-price] | `ceil(250×50%)=125`:`125×2×2/10000=0.050000` | `ceil(250×75%)=188`:`188×2×2/10000=0.075200` |
|
||||
| 实时媒体变量 `V` | 自建媒体网关,无独立计量供应商:API 小计中 `V=0`;带宽、日志、录音进入 `F_base` | 同低档 | 同低档 |
|
||||
| **有牌价支撑的小计 `S=L+ASR+LLM+TTS+V`** | **`0.10+0.0198+0.0006+0.0252+0=0.1456`** | **`0.10+0.0198+0.0036+0.05+0=0.1734`** | **`0.10+0.058333+0.0184+0.0752+0=0.251933≈0.2519`** |
|
||||
| 基础设施摊销 | `F_base/(50×60×12×22×0.60)=F_base/475200` | `F_base/(30×60×10×22×0.50)=F_base/198000` | `F_base/(20×60×8×22×0.20)=F_base/42240` |
|
||||
| **全成本 `C`** | **`0.1456+F_base/475200`** | **`0.1734+F_base/198000`** | **`0.251933+F_base/42240`** |
|
||||
|
||||
除线路和已列官方 API 锚点外,本表是规划估算。三档固定摊销可复算如下:
|
||||
`F_base` 应逐月汇总控制面计算、媒体网关、数据库/缓存、对象存储、带宽、日志监控和基础运维。当前没有选定这些资源的地域、规格、供应商和保留量,因此没有一手报价;上述全成本公式明确降级为**待报价、待 PoC 的非验收估算**,不能把 `V=0`理解为媒体免费,也不能再用旧的 `0.15/0.235/0.41`作为交付结论。
|
||||
|
||||
| 档位 | `K` | `H` | `D` | `u` | 月接通分钟 `M` | 月固定成本 `F` | `F/M` |
|
||||
| --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: |
|
||||
| 低 | 50 | 12 | 22 | 60% | `50×60×12×22×0.60=475,200` | 9,504 | 0.020 |
|
||||
| 中 | 30 | 10 | 22 | 50% | `30×60×10×22×0.50=198,000` | 9,900 | 0.050 |
|
||||
| 高 | 20 | 8 | 22 | 20% | `20×60×8×22×0.20=42,240` | 5,068.8 | 0.120 |
|
||||
|
||||
低成本档代表私有/低价模型且高利用率;中档代表公有 API 起步的保守预算;高档代表高价模型、低利用率和较重留存。中档 `ASR=0.020`与 `fun-asr-realtime`官方价格折算 `0.0198`一致;中档 TTS 按官方字符规则算得 `0.05`。LLM、媒体、固定项以及实际 TTS 字符数必须由 PoC 账单替换。
|
||||
私有模型只提供可复算的 PoC 计算锚点,不并入公有 API 三档:Qwen3-8B + FunASR + CosyVoice3 的模型许可证费用为 `0`,RunPod Secure Cloud RTX 4090 公布价为 `$0.74/GPU·小时` [^runpod-price],按 `7.20 元/USD`、24×7 运行,`F_gpu=0.74×7.20×24×30=3836.16 元/月`,每分钟 GPU 摊销为 `3836.16/M_gpu`。存储、流量、税费和控制面不在该价格内;更关键的是三模型同卡的实时并发 `M_gpu` 未经实测,所以私有全成本仍为**待 PoC**,RunPod 也只是价格锚点而非合规部署推荐。
|
||||
|
||||
### 10.3 敏感性与商业门槛
|
||||
|
||||
- 若 `0.10`按尝试分钟收费,接通率为 20% / 40% / 60% 时,仅线路即为 `0.50 / 0.25 / 0.167 元/接通分钟`。
|
||||
- 月接通分钟减半且固定成本不变,固定摊销翻倍。
|
||||
- 任一变量每增加 `0.01`,总成本等额增加 `0.01`。
|
||||
- 售价 `0.30`要达到 40%贡献毛利,总成本必须不高于 `0.18`,即线路之外只能使用 `0.08`;中档目前为 `0.135`,不能满足。
|
||||
- 售价 `0.30`要达到 40%贡献毛利,总成本必须不高于 `0.18`。三档留给 `F_base/M` 的上限分别为 `0.0344 / 0.0066 / -0.071933`;高档即使未计基础设施也无法达到该毛利目标。
|
||||
- 阿里云公开的 `0.08 元/呼出次`若在接通率 40%、接通后平均 2 分钟下,平台费折算为 `0.08/(0.4×2)=0.10 元/接通分钟`,且仍不含线路 [^aliyun-outbound-billing]。
|
||||
|
||||
PoC 必测:线路计费起点/取整、接通率、平均振铃/通话时长、ASR/TTS 计费量、每分钟 LLM 输入/输出 token、缓存实际命中率、并发利用率、失败重试重复计费、录音/日志保留和账单差异。
|
||||
@@ -330,7 +325,7 @@ P1 才考虑复杂工作流画布、人工转接、AB 实验、动态多线路
|
||||
- 同一幂等键不产生第二通;终态唯一,账单与内部用量差异 ≤ 5%。
|
||||
- 打断和首音频达到第 4.3 节 P95 目标。
|
||||
- 关键字段正确率达到业务方在测试前书面约定的阈值,不在结果出来后降低门槛。
|
||||
- 中档实测成本 ≤ `0.235 元/接通分钟`,且按 `0.30`售价贡献毛利率仍 ≥ 20%。
|
||||
- PoC 用真实 `F_base` 与账单算出的全成本 ≤ `0.22 元/接通分钟`,且按 `0.30`售价贡献毛利率仍 ≥ 25%。本文不把公式中的未报价项当作已经达标。
|
||||
- 任一授权/标识/租户隔离门禁失败直接 No-Go;性能或成本失败则限制场景、调整价格或继续 PoC,不扩量。
|
||||
|
||||
## 12. 风险清单
|
||||
@@ -361,7 +356,10 @@ P1 才考虑复杂工作流画布、人工转接、AB 实验、动态多线路
|
||||
[^funasr]: ModelScope, [FunASR 官方仓库](https://github.com/modelscope/FunASR).
|
||||
[^aliyun-funasr-price]: 阿里云模型服务, [Fun-ASR 实时语音识别](https://help.aliyun.com/zh/model-studio/fun-asr-realtime).
|
||||
[^aliyun-voice-price]: 阿里云智能语音交互, [产品计费](https://help.aliyun.com/zh/isi/product-overview/billing-10).
|
||||
[^aliyun-llm-price]: 阿里云百炼, [模型列表与价格](https://help.aliyun.com/zh/model-studio/model-pricing).
|
||||
[^aliyun-outbound-billing]: 阿里云智能外呼机器人, [产品计费](https://help.aliyun.com/zh/outboundbot/product-overview/billing).
|
||||
[^qwen3-8b]: Qwen, [Qwen3-8B 官方模型卡](https://huggingface.co/Qwen/Qwen3-8B).
|
||||
[^runpod-price]: RunPod, [GPU Cloud Pricing](https://www.runpod.io/pricing).
|
||||
[^logto-org]: Logto, [Organizations](https://docs.logto.io/organizations).
|
||||
[^logto-org-template]: Logto, [Organization template](https://docs.logto.io/authorization/organization-template).
|
||||
[^logto-org-api]: Logto, [Organization-level API resources](https://docs.logto.io/authorization/organization-level-api-resources).
|
||||
|
||||
Reference in New Issue
Block a user