
GUI agents that blindly execute infeasible or conflicting instructions are a real deployment risk. This quantifies how badly current agents overcomply and offers an -time feasibility check that measurably reduces it.
articleGUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent EnvironmentsLin Fu, Zheyuan Yang, Tianhui Zhang, Jinbiao Wei, Guo Gan, Boxu Liu, Yilun Zhao, Yu Rong
articleLegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy WorkflowsThilo Reintjes, Sivajeet Chand, Derui Zhu, Sushant Kumar Pandey, Alexander Pretschner
articleUI-Venus-2 Technical ReportVenus Team, Zhuohan Cai, Haoxing Chen, Jiaxuan Chen, Weizhi Chen, Changlong Gao, Zhangxuan Gu, Yuan Guo, Yusong Hu, Jianrong Jiang, Jianguo Li, Runze Li, Jinzhen Lin, Zhenyu Ma, Changhua Meng, Han Peng, Xinyu Qiu, Shuheng Shen, Zhongyi Shui, Weiqiang Wang, Ming Wen, Zhuoer Xu, Hang Yan, Kaiwen Yang, Ruilin Yao, Nanjun Yu, Zhengwen Zeng, Lianrui Zhang, Yunzhu Zhang, Zhe Zhao, Beitong ZhouChecking sign-in…
Loading comments…