pinned
Running
Agents
222
GIFT Eval
🥇
GIFT-Eval: A Benchmark for General Time Series Forecasting
None defined yet.
StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Evidence-Backed Video Question Answering
GIFT-Eval: A Benchmark for General Time Series Forecasting
A realistic benchmark with real CRM tasks for LLM agents.
View and submit LLM benchmark evaluations
Filter and view LLM benchmark data
Least-loaded Expert Parallelism visualization
Explore efficient reasoning techniques with large language models
Generate captions and answer questions from an image