Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
OpenEvals
community
Activity Feed
Follow
188
AI & ML interests
LLM evaluation
Recent Activity
nielsr
submitted
a paper
5 days ago
One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows
nielsr
submitted
a paper
11 days ago
PixRestore: Unified Image Restoration via Pixel Diffusion Transformer
nielsr
submitted
a paper
11 days ago
MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
View all activity
Team members
9
OpenEvals
's datasets
5
Sort: Recently updated
OpenEvals/leaderboard-data
Viewer
•
Updated
Mar 28
•
105
•
1.65k
•
1
OpenEvals/IMO-AnswerBench
Viewer
•
Updated
Jan 23
•
400
•
638
•
2
OpenEvals/MuSR
Viewer
•
Updated
Dec 12, 2025
•
756
•
70
OpenEvals/aime_24
Viewer
•
Updated
Dec 12, 2025
•
30
•
44
•
1
OpenEvals/SimpleQA
Viewer
•
Updated
Dec 12, 2025
•
4.33k
•
1.83k
•
5