本地 Agent 怎么选、怎么建:从单场景试点到可运维
给出企业本地 Agent 建设的分阶段路径:场景选择、模型与 RAG、权限与沙箱、验收指标。帮助 IT 与业务共同避开“大而全一上线就停”的坑。
本地 Agent 项目最常见的失败方式,不是模型不够强,而是一上来就想“做个什么都会的企业大脑”。三个月后,权限没理清,知识库是脏的,业务不愿用,机器倒是买了。
下面是一套我们在交付里反复验证过的建造顺序。它不神秘,但很反直觉:先窄,后通;先可控,后智能。
第一步:只选一个“值得驻场争论”的场景
好场景通常同时满足:
- 高频(每周都发生);
- 有明确输入输出(文档进、结论/草稿出);
- 现有人工成本可感知;
- 出错可承受或可人工复核;
- 数据边界清晰。
差场景的特征是:目标含糊(“提升管理水平”)、跨十个系统、一次做错就不可逆。
把场景写成一页纸:用户是谁、触发条件、成功标准、失败时回退方式。没有这一页,不进入采购。
第二步:先定数据与权限,再谈模型品牌
本地 Agent 的骨架往往是 RAG + 工具调用。优先决策:
- 语料从哪来:网盘、Wiki、ERP 导出、工单系统?
- 谁能看什么:检索层是否在生成前做 ACL 过滤?
- 更新频率:制度月更,还是工单日更?
- 脱敏规则:哪些字段永远不进索引?
模型可以换,脏数据和错误权限会长期伤害信任。
第三步:架构按“能审计”来选,而不是按 Demo 炫技
一个可上线的最小栈通常包括:
- 推理运行时(本地开源模型或内网托管推理);
- OpenAI 兼容 API 层(方便现有应用接入);
- RAG 流水线(解析、切片、嵌入、检索、重排);
- 编排层(Prompt 管理、工具路由、人工确认节点);
- 观测层(日志、用量、失败样本)。
对 Agent 工具(尤其是代码执行、写操作)必须默认沙箱:独立容器、出站受限、高风险动作二次确认。
第四步:用评测集代替“领导试了觉得还行”
至少准备 30–50 条真实问题,标注:
- 应当引用的文档;
- 可接受答案要点;
- 明确不该泄露的信息。
上线门槛建议写成数字,例如:
- 关键集准确率达到约定阈值;
- 越权问答拦截率 100%(抽检);
- P95 延迟低于业务可接受值;
- 人工复核队列可在 N 分钟内处理。
没有评测,就只能靠感觉迭代,项目会无限期“再优优化”。
第五步:试点 30 天,再谈推广
推荐节奏:
| 阶段 | 周期 | 产出 |
|---|---|---|
| 发现 | 1 周 | 场景一页纸、数据清单 |
| 搭建 | 2–4 周 | 可演示的单场景 Agent |
| 试运行 | 2–4 周 | 评测报告、使用数据 |
| 加固 | 持续 | 权限、监控、知识更新机制 |
中小企业在硬件上不必迷信“起步就上大集群”。很多单场景试点,合理配置的服务器即可起步;关键是 Docker/运行时与内网闭环是否干净。
自建、采购项目制,还是 FDE?
- 自建:有 AI 工程团队、愿意长期养平台;
- 项目制交付:场景清晰、范围可锁定(我们标准版常从此切入);
- FDE 驻场:流程复杂、系统老旧、需要现场拆解与持续迭代。
三者可以衔接,不必互斥。
验收时请盯住这些交付物
不要只收“一个网页聊天框”。更有价值的是:
- 部署文档与权限矩阵;
- 知识库更新手册;
- 评测集与基线分数;
- 监控与告警说明;
- 源码 / 配置的归属与可审计说明。
醴陵真好提供 Agent 标准版(¥50,000 起)、企业版与 RAG 知识库建设。若你正在做厂商比较,把“场景一页纸 + 权限要求”发给我们,比直接问“能不能做 ChatGPT 一样的”有效得多。
隐性成本:请在立项时写进表格
除了软件与实施费,建议单列:
- 数据清洗与权限梳理人天;
- 生产会话变长带来的算力 / Token 预估;
- 监控、告警与值班;
- 知识库持续更新的岗位职责。
业界已有团队把“上下文膨胀、调用量放大、运维”称作容易被 Demo 掩盖的成本。写进表,不等于恐吓,而是让财务与业务一起做成人决策。
组织侧也要有最小编制
再好的架构,也需要人接住:
- 业务 owner:定义对错;
- 知识管理员:更新语料;
- IT 对接:账号、网络、备份;
- 抽检岗位:每周看失败案例。
没有编制,本地 Agent 会在上线 30 天后变成“还能打开的网页”。立项时把名字写进邮件,比多买一张显卡更关键。