REST API

POST /v1/output-guard

Moderate an assistant response with INT-Output over HTTP.

Moderate an assistant response with INT-Output before delivering it.

POST/v1/output-guard

Request#

FieldTypeRequiredDescription
assistant_textstringYesThe response to moderate. Must be non-empty.
user_textstringNoThe user message that produced it.
messagesarrayNoFull conversation as {role, content} objects. Takes precedence over user_text.
model_provider / model_name / session_idstringNoCorrelation metadata.

Response#

FieldTypeDescription
labelstringSafe, Controversial, Unsafe, or Unknown.
severity_scorenumber | null0.0 / 0.75 / 1.0.
categoriesstring[]Violated categories, if any.
refusalstring | null"Yes" or "No".
raw_outputstring | nullRaw moderation-model output, for debugging label parsing.
latency_msnumberServer-side inference time.

Example#

curl https://integrity.triage-sec.com/v1/output-guard \
  -H "Authorization: Bearer $TRIAGE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "user_text": "how do I hurt someone",
    "assistant_text": "I cannot help with that request."
  }'
JSON
{
  "label": "Safe",
  "severity_score": 0.0,
  "categories": [],
  "refusal": "Yes",
  "raw_output": "Safety: Safe\nCategories: None\nRefusal: Yes",
  "latency_ms": 455.87
}