AI 助手语义能力升级
不按问法追加关键词或正则分支;改为结构化语义帧、服务端能力目录、权限内实体解析、只读工具和结果校验。
核心结果
10 / 45新增语义测试 / 断言
70 / 450助手既有回归
15 / 67实体路由回归
120 / 753本次定向测试 / 断言
4 / PASS前端导航定向测试
首轮真实试问反馈与修复
| 反馈 | 根因 | 修复后 |
|---|---|---|
| 当前菜品总数量多少?只给入口 | 语义调用超时后,Kernel 菜品能力没有绑定真实计数工具 | 服务端能力合同先执行,模型不可用也返回已验证数字 |
| 测试一部有多少人无法定位 | 语义调用超时,旧 Kernel 没有当前权限内的动态部门实体目录 | 按权限加载部门名称,唯一解析后执行人员列表同源统计 |
| 真实语义请求 20~60 秒超时 | 意图分类仍启用了模型深度思考 | 默认关闭深度思考,实测两条语义解释约 2.2~2.9 秒成功 |
| 打开机构人员跳到错误页面 | 助手导航目录仍保存旧路由 /staffManagement/staff | 统一为真实菜单 /integratedManagement/organization,携带已验证部门筛选,并新增 PHP/前端/SQL 跨层路由契约 |
本次没有为两条原句增加生产关键词或正则特判;测试中的原句只用于防止同一缺陷回归。
问题判定
| 问题 | 系统行为 | 数字来源 |
|---|---|---|
| 研发部有多少人 | 唯一解析部门后统计;重名则追问 | 人员列表同源查询 |
| 菜品库有多少道菜 | 校验菜品管理权限后统计 | 菜品管理列表同源查询 |
| 餐厅有多少道菜品 | 澄清菜品库还是某日实际餐单 | 未澄清前不查询、不报数字 |
| 人员消费明细在哪里 | 模型选择目录能力,后端反查并校验权限 | 服务端模块映射 |
安全与兼容
模型不能生成 SQL、内部实体 ID、URL 或业务数字。部门候选和最终统计均受数据权限限制;模块 route 只取服务端目录。接口保留既有字段,生产语义主路由可通过配置关闭。
当前结论是“代码和自动化验证完成”,不是“生产数据验收完成”。上线前仍需三类真实权限账号进行页面数字对账。
人工 Review 清单
| 统计口径 | 确认部门人数默认包含下级部门;确认菜品库总数与某日餐单数量的术语。 |
|---|---|
| 权限 | 用完整权限、部门受限、模块受限账号分别验证。 |
| 自然改写 | 每项能力至少试 5 种自然表达,并补 3 个近邻反例。 |
| 回滚 | 确认关闭语义主路由开关后旧问答链路可用。 |
| 导航 | 重新提问“测试一部有多少人”,点击“打开机构人员”,确认进入机构人员并按测试一部筛选。 |
本次吸收与拒绝
建议吸收:能力目录、服务端反查、权限内实体解析、工具结果校验、准确澄清。
明确拒绝:为每个问法追加关键词/正则、让模型拼 SQL、采用模型生成数字、返回模型生成 URL、重名时自动选第一个。
待确认:部门人数展示是否始终注明“包含下级部门”;“餐厅菜品”在特定页面上下文中是否允许自动继承当前筛选。
下一步:真实账号验收通过后再扩大统计能力目录,并把验收反馈写回实施证据。