Jobs · Research

AI Safety Expert - Red Team

Mercor · United States · 3 days ago
RemoteRemoteResearch$17–$25/hrPart-time

Mercor connects elite creative and technical talent with leading AI research labs. Headquartered in San Francisco, our investors include Benchmark, General Catalyst, Peter Thiel, Adam D'Angelo, Larry Summers, and Jack Dorsey.

Responsibilities

  • Red team conversational AI models and agents. Focus on jailbreaks, prompt injections, misuse cases, and bias exploitation.
  • Generate high-quality human data. Annotate failures, classify vulnerabilities, and flag systemic risks.
  • Apply structure by following taxonomies, benchmarks, and playbooks to maintain testing consistency.
  • Document reproducibly. Produce reports, datasets, and attack cases that customers can act on.
  • Work independently and asynchronously to meet deadlines while improving AI model performance.

Requirements

  • Fluent in English and Malay.
  • Prior red teaming experience in AI adversarial work, cybersecurity, or socio-technical probing.
  • Strong communication skills to explain risks clearly to technical and non-technical stakeholders.

Preferred Qualifications

  • Experience in Adversarial ML: jailbreak datasets, prompt injection, RLHF/DPO attacks, model extraction.
  • Background in Cybersecurity: penetration testing, exploit development, reverse engineering.
  • Knowledge in socio-technical risk: harassment/disinfo probing, abuse analysis, conversational AI testing.
  • Creative probing skills: psychology, acting, writing for unconventional adversarial thinking.

Pay

$17–$25/hour

Similar jobs