2025-03 - 现在
生产级 AI Agent 平台架构
项目概览
YC 提供面向多行业的企业 SaaS 服务,核心场景为 AI Agent 客服。任职期间负责 AI Agent 平台方向,覆盖平台架构、运行时治理、知识与工具体系、质量治理和团队工程效能。
平台已支撑 2k+ 租户、230k+ 用户,生产环境峰值 60k 请求/天,端到端平均响应约 7s。
SaaS AI Agent 1.0:ARQs 驱动的 0-1 建设
主导模型驱动 AI Agent 1.0 在 SaaS 业务中从 0 到 1 落地,推动既有 Dify 工作流方案升级为自主可控的多租户 AI Agent 平台。围绕营销咨询、电商导购、线索识别、信息收集、资格判断、业务查询和人工转接沉淀可配置能力,形成面向多行业复制交付和持续运营的 AI Agent 产品。
核心架构由四层组成:
- 配置驱动的 Agent 工厂:支持租户与 Agent 维度个性化配置 Instructions、Actions、知识库、Skill、MCP、语言风格和人工转接,在统一平台上适配不同行业与业务场景。
- 行为与推理控制:用 Guideline 表达业务规则,用 Journey 承载可分支、回退的多轮 SOP,并以 ARQs(Attentive Reasoning Queries) 在意图、工具、参数来源和响应合规等关键节点形成结构化判断。
- 工程约束与运行保障:以 Agent Harness 统一工程规范、工具边界、异常恢复和发布校验,降低复杂任务执行与企业系统写入风险。
- 可观测与质量运营:配套可观测后台呈现会话链路、工具调用、响应质量、耗时和成本,通过上线前评测、线上回放、问题归因和版本对比推动持续优化。
该体系将运行日志转化为可比较的任务成功率、工具准确性、响应耗时和 token 成本指标,支持按租户、场景与版本评估变更效果,为平台自动解决率提升至 70%+ 提供持续优化依据。
平台范围
核心能力覆盖:
- Agent 编排:多轮任务、工具协作、异步执行、并发控制与终止管理。
- 配置与扩展:Instructions、Actions、Skill、MCP、工具边界和租户级个性化。
- RAG / Memory:统一知识接入、检索增强、会话事实、用户偏好和任务状态管理。
- 质量与可观测:评测回放、问题归因、版本对比、响应质量、耗时和成本分析。
- 企业集成:业务 API、多渠道接入、人工转接、权限与审计边界。
数据反馈与知识自进化
围绕客服 Agent 的未知问题建设聚类与主题发现平台,将未解决、未命中或低置信度问题转化为可分析的主题簇,服务知识库补全、RAG 优化和 Skill 迭代。
项目在 2025 年进入平台支持阶段。当时平台规模按当前约 50% 折算,对应约 1,000+ 租户、115,000+ 用户、峰值请求约 30,000 次/日。按周请求规模折算,unknown questions 占比从早期约 30% 逐步下降到约 10%,稳定后约 5%,对应每周约 63,000 条、21,000 条和 10,500 条未知问题处理量。
技术链路包括多语言文本清洗、embedding、UMAP/HDBSCAN、BERTopic、LLM topic representation、聚类质量评估、实验管理、可视化报告和结果回写。约 50% 聚类结果进入知识库、RAG 配置或 Skill 迭代,高频主题运营处理覆盖约 70%,结合 content gap 补全推动客服 Agent 自动解决率提升约 30%。
架构演进
1.0 阶段以可控 Agent Runtime 为核心,用 Guideline / Journey / ARQ 将大模型能力约束在可解释、可追踪、可复盘的业务执行框架中。
2.0 阶段升级为模型驱动 Agent Runtime,由 LLM 承担 tool calling 和多步决策,Runtime 负责上下文、行动空间、Skill 动态加载、RAG/Memory、工具边界、并发控制和成本治理。
架构演进围绕可控性、任务完成质量、上下文效率、工具风险与扩展成本持续取舍,并将生产约束沉淀为 Runtime 能力。
团队工程治理
YC 产研团队约 20 人,AI Agent 方向带领 4 人小组。同时推动 AI 研发交付 Harness 覆盖 40 个仓库,将开发、测试、发布、部署、验证与运维纳入共享上下文和统一工程流程。
协作平台围绕三个环节建设:
- 研发与测试收敛:通过统一 CLI、可复用 Skill 和工程自检,将需求理解、代码实现、单元/集成测试、case 复现和验收前检查纳入同一上下文;开发承担并自动化绝大多数测试执行,测试角色聚焦高风险场景和质量门禁。
- 全 AI 交付闭环:串联构建、发布、部署、环境检查、回归验证、生产观测与故障诊断,以 AI 驱动命令和 Skill 自动执行并回写结果。
- 共享上下文:将仓库规范、服务依赖、环境配置和 Spec / EPIC 通过 Skill、MCP 与 CLI 供产研共享,减少跨角色交接、口头同步与等待。
治理机制分为三层:
- Outer Loop:架构规则、语言规范、分层边界、命名、错误处理、日志和可观测要求。
- Inner Loop:用 Spec / EPIC 拆解非平凡需求,明确目标、非目标、验收标准、任务阶段和状态。
- Supervisor Gate:以变更摘要、文件清单、自检结果、AI Harness trace 和验收 checklist 作为交付门禁。
通过统一上下文、过程检查和交付门禁,将原本跨开发、测试与运维角色的长链路收敛为开发主导的 AI 闭环,降低架构漂移、质量不一致和验收缺口;标准化需求交付和生产问题闭环效率达到传统协作方式约 10 倍。
技术栈
主要技术栈包括 Python、TypeScript、Rust、Java、FastAPI、Milvus、阿里云、Google Cloud 和 Gemini。
技术栈服务于统一的平台目标:Agent Runtime、工具体系、RAG/Memory、评测门禁、可观测和团队工程治理。
交付价值
核心交付价值包括:
- 将 AI Agent 能力接入真实客服业务流程。
- 将工具接入、权限审批、运行时授权和审计边界平台化。
- 将 prompt、工具 schema、模型版本和 RAG 策略纳入发布门禁。
- 将 unknown questions 聚类、content gap 识别和主题发现纳入知识自进化闭环。
- 将 Agent Runtime、Skill、RAG/Memory 和多渠道能力沉淀为平台资产。
- 对稳定性、成本、质量、交付流程和业务结果负责。