餐饮经营Agent能力白皮书_V0.2_54页_1mb
报告摘要
中国餐饮经营 Agent 能力白皮书 V0.2 总结
核心内容
本白皮书由北京餐鸟科技有限公司发布,旨在探讨AI在餐饮经营中的能力边界与发展方向。它提出了一套餐饮经营Agent的能力框架,用于评估AI产品是否具备真实经营辅助能力,而非仅以产品名称或技术术语判断。
主要观点
- “会回答” ≠ “能持续参与经营”:AI能否用于真实经营需从其实际能力出发,而非仅看是否能回答问题。
- 能力分层与结构化定义:餐饮经营Agent被划分为五个层面(G-D-C-A-T),分别代表经营目标与约束、运行底座条件、经营能力、Agent运行能力与可信约束。
- 能力等级与可用线:采用0—5级有序能力等级,3级定义为“真实经营辅助可用线”,表示AI在限定任务和明确输入边界内可辅助经营,但重要判断仍需人工复核。
- 能力验证与可信约束:能力验证基于统一标准化直接测评,强调真实数据与系统环境的重要性,同时引入“待验证”概念,表示证据不足,不等于无能力。
- 未来发展方向:从经营判断辅助逐步走向持续参与经营,需加强数据获取、主动发现、系统执行与结果闭环能力。
关键信息
一、能力层级与定义
| 层级 | 内容 |
|---|---|
| G | 经营目标与约束:明确“为什么干、什么不能碰” |
| D | 四项运行底座条件:数据、语义、状态、工具与权限 |
| C | 六项经营能力:测量、分析、发现、诊断、预测、决策 |
| A | 四项Agent运行能力:持续取数、主动发现、系统执行、结果闭环 |
| T | 可信约束:证据分级、不确定性、因果边界、权限控制、风险降级、可追溯、人类控制、澄清确认 |
二、能力测评结果(截至2026年8月27日)
| 经营能力 | 样本均值 | 达到3级可用线 | 通过率 |
|---|---|---|---|
| C1 | 3.33 | 6/6 | 100% |
| C2 | 2.83 | 3/6 | 50% |
| C3 | 3.20* | 5/5 | 100%* |
| C4 | 2.33 | 1/6 | 16.7% |
| C5 | 2.33 | 3/6 | 50% |
| C6 | 2.17 | 2/6 | 33.3% |
* C3 有1个样本因测试入口限制,未完成冻结数据,状态为“待验证”。
三、测试方法与规则
- 统一标准化直接测评:使用相同题目、数据、顺序与评分规则,封存原始回答,后进行审计。
- 测试真实性层级:
- R0:仿真经营题
- R1:真实经营问题
- R2:真实经营数据
- R3:真实系统环境
- R4:真实动作与结果
- 能力评分规则:不以产品自我声明为依据,而是通过统一测试任务与评分锚点进行。
四、样本选择与测评说明
- 样本纳入标准:产品需公开可访问,且实际功能进入C类经营判断任务。
- 样本排除标准:主要功能不进入经营判断链、无法形成可复核证据、测试环境受污染等。
- 六样本说明:包括“餐剑”“窄门餐谋”“红餐AI”“奥琦玮老板助手”“袋鼠参谋”“食悟AI”,均按研究目的筛选。
五、阶段性发现
- C1(经营测量)表现稳定,6个样本均达到3级可用线。
- C2与C3(经营分析与异常发现)正在形成第二层辅助价值,C3在5个样本中全部过线。
- C4(经营诊断)是共同瓶颈,仅1个样本达到3级可用线。
- C5(预测模拟)与C6(决策优化)已有可用样本,但持续做对更难。
- A1-A4(Agent运行能力)仍需真实环境验证,不能因未测试就判0级。
六、对餐饮经营者的建议
- “五验”快速检查法:
- 拿一份你知道答案的经营账,让它算 → 验证C1
- 给它一段连续经营数据,不告诉它哪里有问题 → 验证C3
- 问它“为什么”,再追问“证据在哪里” → 验证C4与T
- 给两个真实方案和硬约束,让它必须选一个 → 验证C6
- 如果它声称自己是Agent,停止主动提问,看它会不会回来 → 验证A1-A4
七、下一阶段验证方向
- R2验证:使用真实门店数据,检验脏数据、缺数据与复杂口径下的能力表现。
- R3验证:在真实系统环境中测试A1-A3运行能力。
- R4验证:观察真实动作与结果,验证A4闭环能力。
- 持续扩展:引入更多产品、业态、规模和长期样本,对同一产品不同版本进行重复测试。
- 增强可信约束:建立更严格的证据分级、不确定性处理和因果边界机制。
附录与参考资料
- 附录A:六项经营能力0—5级行为评分尺。
- 附录B:四项Agent运行能力0—5级行为评分尺。
- 附录C:统一标准化直接测试任务模板。
- 附录D:六样本证据、匿名规则与方法边界说明。
- 附录E:餐饮经营者“五验”快速检查卡。
- 附录F:术语表,解释“条件性经营判断能力”“餐饮经营Agent”等关键术语。
- 附录G:V0.1.1统一测评协议与版本控制说明。
参考资料
- [1] 三部门《智能体规范应用与创新发展实施意见》
- [2] 《人工智能 智能体 评测指标与方法》(仍在起草)
- [3] T/SAIAS 059—2026《智能体评测指标与方法》
- [4] 《新一代智能终端蓝皮书(2024年)》
- [5] 《工业智能创新发展报告(2026年)》
- [6] 《中国餐饮业数字化发展报告(2024)》
- [7] 中国烹饪协会AI餐饮调研
- [8] 《中国餐饮AI应用研究报告2026》
- [9] 《2025年度中国零售数字化及新技术应用创新案例》
- [10] 四川旅游学院“川菜人工智能重点实验室”课题
- [11] 美团技术团队《Agent评测漫谈——由浅入深讲解Agent评测》
- [12] 《互联网智能体发展研究报告(2026)》
总结
本白皮书不是为了发布排行榜,而是推动餐饮行业对AI经营能力的深入理解与讨论。它强调了从“会回答”到“能持续参与经营”的演进路径,并提出一套可讨论、测试、复查和持续修订的能力框架。未来,餐饮经营Agent将逐步从结构化辅助走向自动化执行,但其成熟仍需真实环境的验证与可信约束的完善。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载