Safeguards Enforcement Analyst, Violence & Extremism

Safeguards Enforcement Analyst, Violence & Extremism

Vollzeit 60000 - 80000 € / Jahr (geschätzt) Homeoffice (teilweise)
A

Auf einen Blick

  • Aufgaben: Entwickle und implementiere Systeme zur Bekämpfung von Gewalt und Extremismus in KI-Anwendungen.
  • Unternehmen: Anthropic, ein innovatives Unternehmen für sichere KI-Systeme.
  • Vorteile: Attraktives Gehalt, flexible Arbeitszeiten und die Möglichkeit zur Visa-Sponsorship.
  • Weitere Informationen: Dynamisches Team mit Fokus auf ethische KI-Entwicklung.
  • Warum dieser Job: Gestalte die Zukunft der KI und schütze die Gesellschaft vor Missbrauch.
  • Qualifikationen: Erfahrung in der Politikdurchsetzung und Bedrohungsanalyse erforderlich.

Das prognostizierte Gehalt liegt zwischen 60000 - 80000 € pro Jahr.

Über Anthropic

Anthropic’s Mission ist es, zuverlässige, interpretierbare und steuerbare KI-Systeme zu schaffen. Wir möchten, dass KI sicher und vorteilhaft für unsere Nutzer und die Gesellschaft als Ganzes ist. Unser Team ist eine schnell wachsende Gruppe von engagierten Forschern, Ingenieuren, Politikspezialisten und Geschäftsführern, die zusammenarbeiten, um nützliche KI-Systeme zu entwickeln.

Über die Rolle

Als Safeguards Enforcement Analyst, der sich auf Gewalt und Extremismus konzentriert, sind Sie verantwortlich für den Aufbau und die Ausführung operativer Arbeitsabläufe zur Bewertung des Modellverhaltens, zur Steuerung von Durchsetzungsentscheidungen und zur Entwicklung von Evaluierungen in einem technisch anspruchsvollen Bereich von Politikbereichen. Ihre Arbeit umfasst das Erkennen und Mildern von Versuchen, die KI-Systeme von Anthropic zu missbrauchen, um realen Schaden zu verursachen, einschließlich Waffen und gefährlicher Technologien, Angriffe auf kritische Infrastrukturen, gewalttätigen Extremismus und Bedrohungen von Gewalt.

Wichtiger Kontext für diese Rolle: In dieser Position können Sie mit expliziten Inhalten konfrontiert werden, die eine Vielzahl von Themen abdecken, einschließlich solcher, die gewalttätig, grafisch, hasserfüllt oder psychologisch belastend sind.

Wesentliche Verantwortlichkeiten

  • Entwerfen und Architektieren automatisierter Durchsetzungssysteme und Überprüfungsabläufe, die effektiv skalieren und gleichzeitig hohe Genauigkeit beibehalten.
  • Entwickeln und Pflegen von Evaluierungen, die die Modellleistung in diesen Politikbereichen messen, Rückschritte aufzeigen und politische sowie Modellverbesserungen informieren.
  • Zusammenarbeiten mit Engineering und Data Science, um die Erkennung und automatisierten Durchsetzungssysteme für potenzielle Politikverletzungen zu optimieren.
  • Überprüfen von markierten Inhalten, um Durchsetzungsentscheidungen zu treffen und politische Lücken zu identifizieren, insbesondere im Hinblick auf neuartige oder technisch anspruchsvolle Missbrauchsversuche und aufkommende extremistische Bewegungen, Ideologien und Mobilisierungstaktiken.
  • Die Safeguards-Politikdesign-Team unterstützen, indem Sie strukturiertes Feedback zu politischen Lücken und Durchsetzungsunklarheiten basierend auf realen Durchsetzungsszenarien geben.
  • Entwickeln und Pflegen von Durchsetzungsrichtlinien und Überprüfungsdokumentationen, die eine genaue und konsistente Durchsetzung über eine breite Palette von Inhalten ermöglichen.
  • Aktuell bleiben zu aufkommenden Bedrohungen, terroristischen und extremistischen Bewegungen, regulatorischen Änderungen und bewährten Verfahren zur Durchsetzung von KI-Richtlinien und diese anwenden, um unsere Arbeitsabläufe und Evaluierungen zu informieren.
  • Identifizieren und Anheben von aufkommenden Missbrauchsmustern, neuartigen Angriffsvektoren und Anzeichen koordinierter gewalttätiger extremistischer Aktivitäten.

Minimale Qualifikationen

  • Erfahrung in der Durchsetzung von Richtlinien, Bedrohungsintelligenz, Terrorismusbekämpfung, Regierung oder einem eng verwandten Bereich, mit direkter Exposition gegenüber schädlichen Inhalten, gefährlicher Technologie, gewalttätigem Extremismus oder der Ermöglichung physischer Schäden.
  • Erfahrung im Aufbau und der Skalierung von Durchsetzungs- oder Inhaltsüberprüfungsabläufen.
  • Kenntnisse in SQL und/oder anderen Datenanalysetools, um Erkenntnisse aus großen Datensätzen zu gewinnen und die Gesundheit des Durchsetzungsablaufs zu überwachen.
  • Erfahrung in der Identifizierung aufkommender Risiken und Bedrohungsakteure sowie der Kommunikation von Ergebnissen an eine vielfältige Gruppe von Interessengruppen, wie Produkt-, Politik-, Ingenieur- und Rechtsteams.
  • Erfahrung mit generativen KI-Produkten, einschließlich der Erstellung effektiver Eingabeaufforderungen für die Inhaltsüberprüfung und Durchsetzung.
  • Verständnis der Herausforderungen bei der Implementierung von Produktpolitiken in großem Maßstab, einschließlich im Bereich der Inhaltsmoderation.

Bevorzugte Qualifikationen

  • Fachkenntnisse in einem oder mehreren Bereichen mit hohem Risiko, wie Waffen und gefährliche Technologie, gewalttätiger Extremismus, Terrorismus, autonome Systeme oder Schutz kritischer Infrastrukturen.
  • Vertrautheit mit relevanten rechtlichen und regulatorischen Rahmenbedingungen, die gefährliche Technologien, kritische Infrastrukturen oder inländischen/internationalen Terrorismus regeln.
  • Erfahrung in der Entwicklung von Evaluierungen oder Red-Teaming von KI-Systemen, insbesondere für schädliche Inhalte oder Anwendungsfälle der Durchsetzung von Richtlinien.
  • Erfahrung mit Bedrohungsakteur-Profiling und Bedrohungsintelligenzrahmen (z.B. MITRE ATT&CK).
  • Erfahrung in der Verfolgung von Bedrohungsakteuren, extremistischen Netzwerken oder Missbrauchsmustern in Oberflächen-, Tief- und Dark-Web-Umgebungen.
  • Erfahrung mit großen Sprachmodellen und ein Verständnis dafür, wie KI-Technologie einen bedeutenden Beitrag zur Verringerung ernsthafter Schäden leisten könnte.
  • Kenntnisse in Python für Datenanalyse und Workflow-Automatisierung.
  • Hintergrund in der Strafverfolgung, nationalen Sicherheit, Verteidigung, Terrorismusbekämpfung oder einem relevanten regulatorischen Umfeld.
  • Erfahrung in der Bewertung der technischen Plausibilität und des Potenzials für realen Schaden von Inhalten, einschließlich der Fähigkeit, zwischen allgemeinem Bildungsinhalt und echtem operationellem Nutzen sowie zwischen geschützter Rede und echter Anstiftung/Mobilisierung zu unterscheiden.
  • Vertrautheit mit plattformübergreifender Bedrohungsanalyse und OSINT-Techniken.

Vergütung

Jahresgehalt: 285.000—330.000 USD

Logistik

  • Minimale Ausbildung: Bachelor-Abschluss oder eine gleichwertige Kombination aus Ausbildung, Schulung und/oder Erfahrung.
  • Erforderliches Studienfeld: Ein für die Rolle relevantes Feld, das durch Kursarbeit, Schulung oder berufliche Erfahrung nachgewiesen wird.
  • Minimale Jahre an Erfahrung: Die erforderlichen Jahre an Erfahrung korrelieren mit den internen Anforderungen an das Jobniveau für die Position.
  • Standortbasierte Hybridpolitik: Derzeit erwarten wir, dass alle Mitarbeiter mindestens 25% der Zeit in einem unserer Büros sind. Einige Rollen erfordern jedoch möglicherweise mehr Zeit in unseren Büros.
  • Visumsponsoring: Wir sponsern Visa. Allerdings können wir nicht für jede Rolle und jeden Kandidaten erfolgreich Visa sponsern. Wenn wir Ihnen ein Angebot machen, werden wir alle angemessenen Anstrengungen unternehmen, um ein Visum zu erhalten.

Safeguards Enforcement Analyst, Violence & Extremism Arbeitgeber: Anthropic

Anthropic ist ein hervorragender Arbeitgeber, der seinen Mitarbeitern die Möglichkeit bietet, in einem dynamischen und innovativen Umfeld zu arbeiten. Mit einem starken Fokus auf Zusammenarbeit und persönlichem Wachstum fördert das Unternehmen eine Kultur, die Kreativität und technische Exzellenz schätzt. Die Mitarbeiter profitieren von flexiblen Arbeitszeiten, großzügigen Urlaubsregelungen und der Chance, an der Spitze der KI-Technologie zu arbeiten, während sie gleichzeitig einen positiven Einfluss auf die Gesellschaft ausüben.

A

Kontaktdaten:

Anthropic Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Safeguards Enforcement Analyst, Violence & Extremism mit Bravour zu bestehen

Policy Enforcement
Threat Intelligence
Counterterrorism
Data Analysis
SQL
Content Review Workflows
Generative AI Products