操作重复
菜单、筛选、搜索、详情和截图是固定步骤,适合由浏览器自动化执行。
Browser Automation · MCP · LLM Evaluation
把后台抽查流程拆成可复用的浏览器采集、时间计算、语义评价与证据报告;Skill 已投入生产环境,并由前同事在实际工作场景中使用。
已投入生产环境并用于实际客服质检;公开页面与下载材料均使用脱敏数据。
原流程依赖人工登录后台、逐条打开详情、查看时间戳并判断回复质量。它能工作,但耗时、难批量、结果也缺少统一证据。
菜单、筛选、搜索、详情和截图是固定步骤,适合由浏览器自动化执行。
响应秒数是确定性计算,回复质量是语义判断,两类任务不应交给同一个模糊过程。
只有一句“回复慢”不够,需要保留原始截图、消息序号、时间戳、规则版本和评价依据。
优先使用 DOM 定位完成操作,截图承担审计证据;模型不负责点击频率伪装,也不执行会改变后台数据的动作。
生产使用版本包含可执行采集器、确定性评分脚本、MCP 工具、评价规则和使用说明;每层职责独立,便于根据后台 DOM 做局部适配。
| 组件 | 职责 | 状态 |
|---|---|---|
| collect_chat.mjs | 连接 Chrome、筛选售前记录、打开详情、等待加载并输出截图与结构化 JSON。 | 已实现 |
| score_chats.py | 按买家消息与客服回复时间戳计算响应秒数,默认超过 10 秒标记异常。 | 已实现 |
| mcp_server.py | 以本地 stdio MCP 暴露采集与评分工具,供 Codex 编排调用。 | 已实现 |
| SKILL.md + Rubric | 定义操作步骤、失败处理、隐私边界、评价维度与报告字段。 | 已实现 |
| 多模型服务 | 视觉模型结构化截图、文本模型评价、RAG 提供版本化 SOP、规则程序执行告警。 | 演进设计 |

Live validation
以下问题来自真实后台回归,分别通过浏览器配置隔离、加载条件、消息分块和确定性规则解决。
确认 Chrome 151 对默认用户目录的远程调试限制,使用临时配置副本完成验证,结束后删除副本并恢复原浏览器。
增加弹窗加载状态和角色文本等待条件,内容完成渲染后再截图和解析。
把正则拼接改成按“买家/售前消息块”切分,保证时间差有可靠的结构化输入。
时间差、阈值和告警由确定性代码处理;LLM 负责语义质量评价,并要求引用原始消息作为证据。
该版本已投入实际工作使用,现有流程用于验证端到端链路;回复阈值、抽检范围、评价维度、SOP 和报告模板需根据业务需求持续调整。
支持人工触发的会话抽查、跨电脑迁移和质检报告生成。
面向定时运行、批量质检、动态 SOP 和成本受控的持续服务。
公开文件已完成脱敏,用于展示 Skill 结构、验证结果与后台适配方法。