@misc{https://doi.org/10.48550/arxiv.2606.15320,
  doi = {10.48550/ARXIV.2606.15320},
  url = {https://arxiv.org/abs/2606.15320},
  author = {Zou, Yuanhao and Kulkarni, Arthad and Tonanez, Lucas and Spencer, Lincoln and Sun, Guangyu and Ding, Tianxingjian and Deng, Andong and Li, Yi and Liu, Shuangjun and Li, Yuan and Gao, Dashan and Bi, Ning and Jing, Taotao and Zhang, Shuai and Chen, Chen},
  keywords = {Computer Vision and Pattern Recognition (cs.CV), FOS: Computer and information sciences, FOS: Computer and information sciences},
  title = {Conditional Multi-Event Temporal Grounding in Long-Form Video},
  publisher = {arXiv},
  year = {2026},
  copyright = {Creative Commons Attribution Non Commercial Share Alike 4.0 International}
}
