OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding Paper • 2607.27155 • Published 1 day ago • 6
Can AI agents conduct open-ended AI research? Early evidence from two case studies Paper • 2607.27191 • Published 1 day ago • 5
PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models Paper • 2607.24957 • Published 3 days ago • 13
OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs Paper • 2607.25669 • Published 2 days ago • 8
GNM Head: A Generative aNthropometric Model of the human head Paper • 2607.23687 • Published 4 days ago • 5
FilmBench: A Film-Grade Benchmark for Cinematic Video Generation Paper • 2607.24241 • Published 3 days ago • 5
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning Paper • 2607.21653 • Published 8 days ago • 30
Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering Paper • 2607.21848 • Published 7 days ago • 8
SceneActBench: Can Agents Act on the 3D Scenes They See? Paper • 2607.22393 • Published 6 days ago • 7
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills Paper • 2607.22529 • Published 6 days ago • 45
Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction Paper • 2607.20911 • Published 7 days ago • 26
NVIDIA-labs OO Agents: Native Python Object-Oriented Agents Paper • 2607.20709 • Published 8 days ago • 32
TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation Paper • 2607.21017 • Published 7 days ago • 7