
Few-shot prompting sometimes hurts model performance, and a length-matched random-text control reveals why: much of the measured 'representation shift' from demonstrations is actually an artifact of longer prompts, not what the examples say.
articleWhen Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language ModelsYinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao
articleLatent Undertow: How Ordinary Typos Break ProbesElad David, Max Fomin, Amit LeVi
articleBeyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on QualityQipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang, Wenao Ma, Zhong Ming, Haiqin Yang, Kaishun WuChecking sign-in…
Loading comments…