harmful content detection
Categoria: segurança e governança
Mecanismo que identifica tentativas de gerar ou solicitar conteúdo prejudicial (instruções perigosas, discurso de ódio, desinformação) tanto nos inputs dos usuários quanto nas saídas do agente, bloqueando antes que sejam entregues.