01 · 部署拓扑
第一版建议单机逻辑隔离,小范围试用。
入口区Web 工作台、后台、小蓝/微信适配。
应用区API、工作流、智能体、Skill 服务。
控制区权限、RAG、引用、拒答、审计。
数据区原文、台账、全文索引、向量索引。
模型区LLM、Embedding、Rerank、OCR。
运维区监控、日志、备份、恢复、告警。
02 · 模型资源策略
不要一开始承诺超大模型和高并发,先保证链路正确。
| 模型规模 | 定位 | 首版建议 |
|---|---|---|
| 7B/8B | 低资源链路验证 | 优先跑通,验证权限、引用、拒答、审计 |
| 14B | 标准样板候选 | 重点测试中文制度问答效果 |
| 32B | 增强候选 | 低并发测试,不作为首版硬承诺 |
| 70B/72B | 研究对象 | 不作为首版承诺 |
| Embedding/Rerank | RAG 质量关键 | 必须纳入,不只靠生成模型 |
03 · 运维对象
企业 AI 运维要管资料、索引、权限、模型和日志。
资料运维
新增、替换、停用、下线、授权变化、脱敏规则变化。
索引运维
解析失败、分片错误、向量重建、全文索引更新。
权限运维
组织架构变化、岗位变化、角色权限复核。
模型运维
模型版本、推理服务状态、Embedding/Rerank 状态。
审计运维
日志归档、查询、导出、合规留存。
验收运维
资料更新或模型更新后重跑标准问题。
04 · 备份恢复
一体机必须能恢复,不然客户不敢把资料放进去。
| 对象 | 备份频率 | 恢复要求 |
|---|---|---|
| 原始文件 | 每日增量 + 每周全量 | 可恢复指定版本 |
| 资料台账 | 每日 | 不可丢失授权和版本状态 |
| 解析文本 | 随文件版本 | 可重建索引 |
| 向量/全文索引 | 可重建 + 定期快照 | 索引损坏可重建 |
| 审计日志 | 每日归档 | 不可随意删除 |
| 标准问题和验收记录 | 每次变更 | 可追溯测试历史 |
05 · 监控告警
监控不只是服务器 CPU,还要看 AI 业务指标。
系统指标
CPU、内存、显存、磁盘、网络、进程状态。
模型指标
响应时间、失败率、队列长度、显存占用。
知识库指标
资料数、解析失败数、索引更新时间。
问答指标
调用量、拒答率、引用覆盖率、反馈错误率。
权限指标
越权拦截次数、权限配置变更记录。
验收指标
标准问题通过率、阻断题失败数、复测状态。