[Google Scholar]

Publications

2026

A2ASecBench: A Protocol-Aware Security Benchmark for Agent-to-Agent Multi-Agent Systems
Tianhao Li, Chuangxin Chu, Yujia Zheng, Bohan Zhang, Neil Zhenqiang Gong, Chaowei Xiao
International Conference on Learning Representations (ICLR), 2026
Are All Prompt Components Value-Neutral? Understanding the Heterogeneous Adversarial Robustness of Dissected Prompt in Large Language Models
Yujia Zheng*, Tianhao Li*, Haotian Huang, Tianyu Zeng, Jingyu Lu, Chuangxin Chu, Yuekai Huang, Ziyou Jiang, Qian Xiong, Yuyao Ge, Mingyang Li
European Chapter of the Association for Computational Linguistics (EACL), 2026 · Oral · Evaluation and Model Insight Award
Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories
Qian Xiong, Yuekai Huang, Yujia Zheng, Tianhao Li, Ziyou Jiang, Zhiyuan Chang, Zhaoyang Li, Huanxiang Feng, Mingyang Li
arXiv, 2026
Beyond History Mirroring: Profile-Driven Bidirectional Intent Evolution for Personalized Query Recommendation
Yepeng Feng, Yujia Zheng, Tianhao Li, Xuan Tian
SSRN, 2026
Beyond Accuracy: Comprehensive Alignment for AI-Driven Molecular Design
Qiang Zhang, Xiang Zhuang, Chenyi Zhou, Yihang Zhu, Tong Xu, Tianhao Li, Dianbo Liu, Shengchao Liu, Keyan Ding, Emine Yilmaz, Haofen Wang, Huajun Chen
AI for Science (AI4Sci), 2026
A Versatile Method for Accurately Predicting Electronic Absorption Spectra of Tetrapyrrole Macrocycles
Guofan Zhang, Xuanzhi Wang, Qirui Sun, Hanchi Zhao, Jiaao Han, Haoyuan Yang, Hanyu Wang, Chengshu Tian, Aizhen Kuang, Chulong Zhang, Tianhao Li, Zijing Wang, Pengzhan Guo, Rui Liu
Scientific Reports, 2026

2025

AI Benchmark Democratization and Carpentry
Gregor von Laszewski, Wesley Brewer, Jeyan Thiyagalingam, Juri Papay, Armstrong Foundjem, Piotr Luszczek, Murali Emani, Shirley V. Moore, Vijay Janapa Reddi, Matthew D. Sinclair, Sebastian Lobentanzer, Sujata Goswami, Benjamin Hawks, Marco Colombo, Nhan Tran, Christine R. Kirkpatrick, Abdulkareem Alsudais, Gregg Barrett, Tianhao Li, Kirsten Morehouse, Shivaram Venkataraman, Rutwik Jain, Kartik Mathur, Victor Lu, Tejinder Singh, Khojasteh Z. Mirza, Kongtao Chen, Sasidhar Kunapuli, Gavin Farrell, Renato Umeton, Geoffrey C. Fox
arXiv, 2025
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
Tianhao Li, Jingyu Lu, Chuangxin Chu, Tianyu Zeng, Yujia Zheng, Mei Li, Haotian Huang, Bin Wu, Zuoxian Liu, Kai Ma, Xuejing Yuan, Xingkai Wang, Keyan Ding, Huajun Chen, Qiang Zhang
AAAI-25 Workshop on Artificial Intelligence for Cyber Security (AICS), 2025 · Oral
Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems
Qian Xiong, Yuekai Huang, Ziyou Jiang, Zhiyuan Chang, Yujia Zheng, Tianhao Li, Mingyang Li
Findings of the Association for Computational Linguistics: EMNLP, 2025
SFSWTS: A Spatial-Frequency Shifted Windows and Time Self-Attention Network for EEG Emotion Recognition
Weizhi Ma, Ying Li, Tianhao Li, Haowei Yang, Zhengping Li, Lijun Wang, Junyu Xuan
Neurocomputing, 2025
A Survey of Vibe Coding with Large Language Models
Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng
arXiv, 2025
From Droplets to Diagnosis: AI-Driven Imaging and System Integration in Digital Nucleic Acid Amplification Testing
Yuanyuan Wei, Xianxian Liu, Yao Mu, Changran Xu, Guoxun Zhang, Tianhao Li, Zida Li, Wu Yuan, Ho-Pui Ho, Mingkun Xu
Biosensors and Bioelectronics, 2025

Technical Reports

A Robust, Defensible, and Reproducible Methodology for Benchmarking Single-Turn Jailbreak Attacks on Large Language Models
MLCommons Technical Report, 2026
Agentic Product Maturity Ladder V0.1
MLCommons Technical Report, 2025
AILuminate Security: Introducing v0.5 of the Jailbreak Benchmark from MLCommons
MLCommons Technical Report, 2025
AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons
MLCommons Technical Report, 2025