Xing Han Lù
xhluca
AI & ML interests
None yet
Recent Activity
updated a collection 2 days ago
A3 updated a collection 2 days ago
A3 updated a collection 2 days ago
A3Organizations
AgentRewardBench
-
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
Paper • 2504.08942 • Published • 29 -
McGill-NLP/agent-reward-bench
Viewer • Updated • 1.41k • 5.98k • 4 - SleepingAgents5
Agent Reward Bench Demo
💻5Explore agent trajectories and judgments in web benchmarks
- RunningAgents3
Agent Reward Bench Leaderboard
🥇3Leaderboard for AgentRewardBench
A3
WebLINX
AgentRewardBench
-
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
Paper • 2504.08942 • Published • 29 -
McGill-NLP/agent-reward-bench
Viewer • Updated • 1.41k • 5.98k • 4 - SleepingAgents5
Agent Reward Bench Demo
💻5Explore agent trajectories and judgments in web benchmarks
- RunningAgents3
Agent Reward Bench Leaderboard
🥇3Leaderboard for AgentRewardBench
BM25S
https://github.com/xhluca/bm25s