Ryanjxy/CamAct-Benchmark
CamAct Benchmark 这是 CamAct 项目的完整、可迁移 benchmark。它面向个人照片记忆、相册检索、关系信息查询以及基于工具的状态操作评测,包含运行所需的任务、用户记忆、原始相册、运行时服务和评测代码。 内容概览 当前 benchmark 包含 20 个用户、540 个任务,每个用户 27 个任务。每个用户的基础记忆快照包含原始图片、图片 metadata、用户画像和关系图;任务目录包含任务描述、对话上下文、模拟器 fixture、工作区状态、ground truth 和 evaluator 配置。 目录结构如下: benchmark/ ├── benchmark_manifest.json # benchmark 的通用元数据 ├── users/<user_id>/base_memory/ # 用户基础记忆和原始相册 ├── tasks/<user_id>/ # 每个用户的 27 个任务 ├── benchmark_runner/… See the full description on the dataset page: https://huggingface.co/datasets/Ryanjxy/CamAct-Benchmark.
CamAct Benchmark
这是 CamAct 项目的完整、可迁移 benchmark。它面向个人照片记忆、相册检索、关系信息查询以及基于工具的状态操作评测,包含运行所需的任务、用户记忆、原始相册、运行时服务和评测代码。
内容概览
当前 benchmark 包含 20 个用户、540 个任务,每个用户 27 个任务。每个用户的基础记忆快照包含原始图片、图片 metadata、用户画像和关系图;任务目录包含任务描述、对话上下文、模拟器 fixture、工作区状态、ground truth 和 evaluator 配置。
目录结构如下:
benchmark/
├── benchmark_manifest.json # benchmark 的通用元数据
├── users/<user_id>/base_memory/ # 用户基础记忆和原始相册
├── tasks/<user_id>/ # 每个用户的 27 个任务
├── benchmark_runner/ # 运行入口和模型适配器
├── evaluator/ # 任务结果评测
├── services/ # 相册、关系图等运行时服务
├── runtime/tool_registry.json # 工具注册表
├── tests/ # 回归测试
└── validation/ # 结构和运行时校验使用方法
在本目录下查看运行参数:
python -B benchmark_runner/run_model.py --help运行时需要由使用者提供模型服务配置。benchmark 不包含任何固定的中转站、服务地址或 API key。可以通过命令行传入,或先设置以下环境变量:
$env:CAMACT_AGENT_API_BASE = "<your-agent-api-base>"
$env:CAMACT_AGENT_API_KEY_ENV = "<your-agent-api-key-environment-variable>"
$env:CAMACT_AGENT_MODEL = "<your-agent-model>"
$env:CAMACT_SIMULATOR_API_BASE = "<your-simulator-api-base>"
$env:CAMACT_SIMULATOR_API_KEY_ENV = "<your-simulator-api-key-environment-variable>"
$env:CAMACT_SIMULATOR_MODEL = "<your-simulator-model>"批量入口使用 benchmark_runner/provider_profiles.json 中的通用占位 profile;请先填入自己的配置,或使用命令行参数覆盖。API key 只应存在于进程环境变量中,不要写入 benchmark 文件。新的运行结果应写到 benchmark 目录之外,例如 ../runtime/runs/,不要把轨迹、日志或评测输出写回这个目录。
运行本地完整校验:
python -B validation/validate.py