Center for AI Safety, Scale AI, and HLE Consortium (including Ting Sun)
The global gold-standard benchmark probing expert-level academic reasoning across frontier models. Contributed 40 accepted questions that stumped all leading models tested at release.
ALE Consortium (including Ting Sun)
The headline benchmark evaluating autonomous coding and reasoning agents across 55 professional subdomains with ground-truth execution checks.
Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie
A brokerless training data plane providing transactional global batches, decentralized adaptive commits, and end-to-end exactly-once semantics without ingestion bottlenecks.
Chaobo Jia*, Ruipeng Wan*, Ting Sun*, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu (*Equal contribution)
Parallel keypoint-based automated verification for LLM-generated interactive environments via runtime state injection and bounded execution. Guided project as senior member.
Ting Sun*, Penghan Wang*, and Fan Lai (*Equal contribution)
SLO-aware request co-location recovering idle serving cycles for up to 5.84× offline throughput gains without latency violations.
Ting Sun, Penghan Wang, and Fan Lai
Device-server collaborative streaming inference optimizing time-to-first-token (TTFT) via cost-constrained request dispatching and token-level migration.
Junjie Zhang, Jingyi Xi, Zhuoyang Song, Junyu Lu, Yuhua Ke, Ting Sun, Yukun Yang, Jiaxing Zhang, Songxin Zhang, Zejian Xie
End-to-end RL training framework for autonomous agents executing in persistent Python loops (NB-Agent), boosting SimpleQA factuality from 30% to 80%.
Xiaoze Liu*, Ting Sun*, Tianyang Xu, Feijie Wu, Cunxiang Wang, Xiaoqian Wang, Jing Gao (*Equal contribution)
Evaluation suite and lightweight n-gram runtime defense strategies protecting LLMs against copyright extraction and bypass attacks.