姜锦源 · AI 应用作品

Browser Automation · MCP · LLM Evaluation

客服聊天质检自动化 Skill

把后台抽查流程拆成可复用的浏览器采集、时间计算、语义评价与证据报告;Skill 已投入生产环境,并由前同事在实际工作场景中使用。

已投入生产环境并用于实际客服质检;公开页面与下载材料均使用脱敏数据。

1 条真实后台会话完成端到端回归
10 秒初版回复速度异常阈值,可配置
Skill + MCP可分享的操作说明与本地工具入口
生产使用前同事已在实际工作场景中使用

从一次人工抽查里识别可自动化的业务链路

原流程依赖人工登录后台、逐条打开详情、查看时间戳并判断回复质量。它能工作,但耗时、难批量、结果也缺少统一证据。

操作重复

菜单、筛选、搜索、详情和截图是固定步骤,适合由浏览器自动化执行。

判断混在一起

响应秒数是确定性计算,回复质量是语义判断,两类任务不应交给同一个模糊过程。

难以追溯

只有一句“回复慢”不够,需要保留原始截图、消息序号、时间戳、规则版本和评价依据。

Skill 把流程拆成七个可验证步骤

优先使用 DOM 定位完成操作,截图承担审计证据;模型不负责点击频率伪装,也不执行会改变后台数据的动作。

01连接已登录 ChromeCDP 会话
02进入售前查询DOM 定位
03筛选并打开详情只读操作
04截图并解析消息角色 / 时间 / 正文
05程序计算响应秒数阈值规则
06LLM 评价回复质量引用原句
07生成可追溯报告JSON / PPTX

交付不止是一段提示词

生产使用版本包含可执行采集器、确定性评分脚本、MCP 工具、评价规则和使用说明;每层职责独立,便于根据后台 DOM 做局部适配。

组件职责状态
collect_chat.mjs连接 Chrome、筛选售前记录、打开详情、等待加载并输出截图与结构化 JSON。已实现
score_chats.py按买家消息与客服回复时间戳计算响应秒数,默认超过 10 秒标记异常。已实现
mcp_server.py以本地 stdio MCP 暴露采集与评分工具,供 Codex 编排调用。已实现
SKILL.md + Rubric定义操作步骤、失败处理、隐私边界、评价维度与报告字段。已实现
多模型服务视觉模型结构化截图、文本模型评价、RAG 提供版本化 SOP、规则程序执行告警。演进设计
脱敏后的客服质检报告预览
公开展示使用脱敏后的汇总页,不展示后台域名、手机号、IP 或原始账号信息。

Live validation

不是只在纸面上成立

  • 真实回归完成 1 条会话端到端采集
  • 消息解析3 条买家消息、4 条售前消息
  • 速度结果13 秒异常、10 秒正常
  • 质量观察信息较具体,但下一步引导不足
  • 生产使用前同事已在实际工作场景中使用

关键问题与解决方案

以下问题来自真实后台回归,分别通过浏览器配置隔离、加载条件、消息分块和确定性规则解决。

1

普通 Chrome 无法直接附着

确认 Chrome 151 对默认用户目录的远程调试限制,使用临时配置副本完成验证,结束后删除副本并恢复原浏览器。

2

截图过早只得到加载框

增加弹窗加载状态和角色文本等待条件,内容完成渲染后再截图和解析。

3

角色与时间戳不在同一行

把正则拼接改成按“买家/售前消息块”切分,保证时间差有可靠的结构化输入。

4

确定性规则与 LLM 职责拆分

时间差、阈值和告警由确定性代码处理;LLM 负责语义质量评价,并要求引用原始消息作为证据。

当前 Skill 为可验证的最小 MVP 版本

该版本已投入实际工作使用,现有流程用于验证端到端链路;回复阈值、抽检范围、评价维度、SOP 和报告模板需根据业务需求持续调整。

当前 MVP

支持人工触发的会话抽查、跨电脑迁移和质检报告生成。

  • Codex Skill:承载操作流程和失败处理
  • Playwright/CDP:读取后台和截图
  • Python 规则:计算响应时间
  • LLM + PPT:生成语义评价和复盘材料

按业务需求演进

面向定时运行、批量质检、动态 SOP 和成本受控的持续服务。

  • MiMo 2.5:读取截图并输出无损结构化消息
  • 确定性服务:计算时间、去重、缓存和告警
  • RAG:检索带版本号与生效时间的 SOP 条款
  • DeepSeek V4:基于文本与 SOP 做质量判断

项目交付物

公开文件已完成脱敏,用于展示 Skill 结构、验证结果与后台适配方法。