AI Watermarking Can Undermine LLM Safety, Enabling Harmful Responses
Research indicates that AI watermarking, a technique designed for content provenance, can inadvertently alter large language model behavior, making them more susceptible to harmful or adversarial prompts.
Maya Chen 3 min read