自动化验证通过 · 待真实账号验收

AI 助手语义能力升级

不按问法追加关键词或正则分支;改为结构化语义帧、服务端能力目录、权限内实体解析、只读工具和结果校验。

核心结果

10 / 45新增语义测试 / 断言
70 / 450助手既有回归
15 / 67实体路由回归
120 / 753本次定向测试 / 断言
4 / PASS前端导航定向测试

首轮真实试问反馈与修复

反馈根因修复后
当前菜品总数量多少?只给入口语义调用超时后,Kernel 菜品能力没有绑定真实计数工具服务端能力合同先执行,模型不可用也返回已验证数字
测试一部有多少人无法定位语义调用超时,旧 Kernel 没有当前权限内的动态部门实体目录按权限加载部门名称,唯一解析后执行人员列表同源统计
真实语义请求 20~60 秒超时意图分类仍启用了模型深度思考默认关闭深度思考,实测两条语义解释约 2.2~2.9 秒成功
打开机构人员跳到错误页面助手导航目录仍保存旧路由 /staffManagement/staff统一为真实菜单 /integratedManagement/organization,携带已验证部门筛选,并新增 PHP/前端/SQL 跨层路由契约

本次没有为两条原句增加生产关键词或正则特判;测试中的原句只用于防止同一缺陷回归。

问题判定

问题系统行为数字来源
研发部有多少人唯一解析部门后统计;重名则追问人员列表同源查询
菜品库有多少道菜校验菜品管理权限后统计菜品管理列表同源查询
餐厅有多少道菜品澄清菜品库还是某日实际餐单未澄清前不查询、不报数字
人员消费明细在哪里模型选择目录能力,后端反查并校验权限服务端模块映射

安全与兼容

模型不能生成 SQL、内部实体 ID、URL 或业务数字。部门候选和最终统计均受数据权限限制;模块 route 只取服务端目录。接口保留既有字段,生产语义主路由可通过配置关闭。

当前结论是“代码和自动化验证完成”,不是“生产数据验收完成”。上线前仍需三类真实权限账号进行页面数字对账。

人工 Review 清单

统计口径确认部门人数默认包含下级部门;确认菜品库总数与某日餐单数量的术语。
权限用完整权限、部门受限、模块受限账号分别验证。
自然改写每项能力至少试 5 种自然表达,并补 3 个近邻反例。
回滚确认关闭语义主路由开关后旧问答链路可用。
导航重新提问“测试一部有多少人”,点击“打开机构人员”,确认进入机构人员并按测试一部筛选。

本次吸收与拒绝

建议吸收:能力目录、服务端反查、权限内实体解析、工具结果校验、准确澄清。

明确拒绝:为每个问法追加关键词/正则、让模型拼 SQL、采用模型生成数字、返回模型生成 URL、重名时自动选第一个。

待确认:部门人数展示是否始终注明“包含下级部门”;“餐厅菜品”在特定页面上下文中是否允许自动继承当前筛选。

下一步:真实账号验收通过后再扩大统计能力目录,并把验收反馈写回实施证据。