Uncovering Safety Risks of Large Language Models through Concept Activation Vector - researchr publication authors

researchr

You are not signed in
Sign in
Sign up

Zhihao Xu, Ruixuan Huang, Changyu Chen, Xiting Wang. Uncovering Safety Risks of Large Language Models through Concept Activation Vector. In Amir Globersons, Lester Mackey, Danielle Belgrave, Angela Fan, Ulrich Paquet, Jakub M. Tomczak, Cheng Zhang 0005, editors, Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2024, NeurIPS 2024, Vancouver, BC, Canada, December 10 - 15, 2024. 2024. [doi]

This author has not been identified. Look up 'Zhihao Xu' in GoogleThis author has not been identified. Look up 'Ruixuan Huang' in GoogleThis author has not been identified. Look up 'Changyu Chen' in GoogleThis author has not been identified. Look up 'Xiting Wang' in Google

runs on WebDSL