Artificial Intelligence
144 views
Red Teaming AI
Quick Definition
Adversarial testing of AI models for vulnerabilities
Full Definition
Systematic adversarial testing of AI models to identify vulnerabilities biases and safety risks.
Examples
safety evaluation, bias discovery, adversarial probing
Related Terms
ai-safety
adversarial-attack
penetration-testing
More Artificial Intelligence Terms
Feature Importance
Quantifying each input features contribution to predictions
Neural Network
Computing system inspired by brain neurons
Recurrent Neural Network
Neural network with cyclic connections for sequence processing
Image Segmentation
Partitioning images into labeled segments per pixel
Reward Modeling
Training models to predict human preferences for RLHF
Diffusion Model
Generative model creating data by iteratively removing noise