CoolFace
Datasetpublic

Ryanjxy/CamAct-Benchmark

CamAct Benchmark 这是 CamAct 项目的完整、可迁移 benchmark。它面向个人照片记忆、相册检索、关系信息查询以及基于工具的状态操作评测,包含运行所需的任务、用户记忆、原始相册、运行时服务和评测代码。 内容概览 当前 benchmark 包含 20 个用户、540 个任务,每个用户 27 个任务。每个用户的基础记忆快照包含原始图片、图片 metadata、用户画像和关系图;任务目录包含任务描述、对话上下文、模拟器 fixture、工作区状态、ground truth 和 evaluator 配置。 目录结构如下: benchmark/ ├── benchmark_manifest.json # benchmark 的通用元数据 ├── users/<user_id>/base_memory/ # 用户基础记忆和原始相册 ├── tasks/<user_id>/ # 每个用户的 27 个任务 ├── benchmark_runner/… See the full description on the dataset page: https://huggingface.co/datasets/Ryanjxy/CamAct-Benchmark.

sourceHugging Faceupdated 17d agoView on Hugging Face
0likes92downloads
Dataset Card

CamAct Benchmark

这是 CamAct 项目的完整、可迁移 benchmark。它面向个人照片记忆、相册检索、关系信息查询以及基于工具的状态操作评测,包含运行所需的任务、用户记忆、原始相册、运行时服务和评测代码。

内容概览

当前 benchmark 包含 20 个用户、540 个任务,每个用户 27 个任务。每个用户的基础记忆快照包含原始图片、图片 metadata、用户画像和关系图;任务目录包含任务描述、对话上下文、模拟器 fixture、工作区状态、ground truth 和 evaluator 配置。

目录结构如下:

text
benchmark/
├── benchmark_manifest.json       # benchmark 的通用元数据
├── users/<user_id>/base_memory/  # 用户基础记忆和原始相册
├── tasks/<user_id>/              # 每个用户的 27 个任务
├── benchmark_runner/             # 运行入口和模型适配器
├── evaluator/                    # 任务结果评测
├── services/                     # 相册、关系图等运行时服务
├── runtime/tool_registry.json    # 工具注册表
├── tests/                        # 回归测试
└── validation/                   # 结构和运行时校验

使用方法

在本目录下查看运行参数:

powershell
python -B benchmark_runner/run_model.py --help

运行时需要由使用者提供模型服务配置。benchmark 不包含任何固定的中转站、服务地址或 API key。可以通过命令行传入,或先设置以下环境变量:

powershell
$env:CAMACT_AGENT_API_BASE = "<your-agent-api-base>"
$env:CAMACT_AGENT_API_KEY_ENV = "<your-agent-api-key-environment-variable>"
$env:CAMACT_AGENT_MODEL = "<your-agent-model>"
$env:CAMACT_SIMULATOR_API_BASE = "<your-simulator-api-base>"
$env:CAMACT_SIMULATOR_API_KEY_ENV = "<your-simulator-api-key-environment-variable>"
$env:CAMACT_SIMULATOR_MODEL = "<your-simulator-model>"

批量入口使用 benchmark_runner/provider_profiles.json 中的通用占位 profile;请先填入自己的配置,或使用命令行参数覆盖。API key 只应存在于进程环境变量中,不要写入 benchmark 文件。新的运行结果应写到 benchmark 目录之外,例如 ../runtime/runs/,不要把轨迹、日志或评测输出写回这个目录。

运行本地完整校验:

powershell
python -B validation/validate.py
Ryanjxy/CamAct-Benchmark · CoolFace