Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching Paper • 2609.01404 • Published 9 days ago • 27
Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition Paper • 2606.12300 • Published Jun 10 • 1
Decentralized Instruction Tuning: Conflict-Aware Splitting and Weight Merging Paper • 2606.01717 • Published Jun 1 • 21
naver-hyperclovax/HyperCLOVAX-SEED-Vision-Instruct-3B Text Generation • 4B • Updated Sep 16, 2025 • 8.67k • 221