We study multimodal safety evaluation in generative agent social simulations, examining how multi-agent systems built on vision-language models behave under safety-relevant scenarios.