CabinBench

车机多轮对话
评测基准

围绕真实车机使用场景,构建一套覆盖问卷采集、文本与语音多轮对话采集、用户画像聚类、多轮对话自动模拟与多维分析的开源评测平台,支撑车机大模型在长程交互、增量指令与状态保持上的可复现研究。

功能入口

项目介绍

CabinBench 是针对车机大语言模型的多轮对话评测基准。当前研究关注大模型单点能力,但车机场景需要模型在长时间多轮对话中保持长期记忆,遵循用户增量指令,并维持一致的车机状态变化。

  • 覆盖 6 大类核心车机场景:导航、空调控制、车辆控制、多媒体、闲聊、多任务混合与意图修正
  • 多维度自动评测:一致性检测、连贯性评分、指令跟随精度、状态保持准确率
  • 模块化可扩展:支持自定义新增场景、模型、评测指标,一键生成分析报告
  • 支持用户交互式数据采集:可直接部署用于收集真实用户车机对话数据

核心能力

标准化车机场景库

导航、空调、车控、媒体、闲聊与多任务混合等真实车机技能,统一 skill 描述与 agenda

支持多模态测评

同时支持文本、语音、TTS 朗读与多轮交互流,覆盖车机 ASR/TTS 实际使用方式

模块化扩展

LangGraph datagen + 可插拔 skill / LLM provider / embedding,便于自定义模型与场景

完整分析管线

问卷采集 / AI 总结 / embedding / 聚类 / 可视化全流程一体化,离线与网页版本同源