개요
Atlas Agent Engine 가드레일을 사용하면 프로젝트 관리자가 에이전트의 모델 호출에 들어오고 나가는 콘텐츠를 제어할 수 있습니다. 관리자가 프로젝트 내에 가드레일을 설정하다 오케스트레이션 엔진(OE)이 일치하는 입력 및 출력 콘텐츠를 차단하거나 수정하여 가드레일을 집행합니다.
하나 이상의 작업 공간에 가드레일을 적용 하려면 가드레일의 workspace_ids 필드 에 작업 공간을 지정합니다. 이 필드 지정하지 않으면 가드레일이 프로젝트 의 모든 작업 공간에 적용됩니다.
가드레일은 정책 엔진을 보완합니다. 가드레일은 모델에 들어오고 나가는 콘텐츠를 제어하고, 정책 엔진은 호출할 수 있는 도구 및 모델과 같이 에이전트 수행할 수 있는 조치를 제어합니다.
가드레일 유형
각 가드레일에는 평가할 콘텐츠를 결정하는 유형과 가드레일이 트리거될 때 어떤 일이 발생하는지를 결정하는 조치 있습니다.
현재 Atlas Agent Engine은 output_validation 가드레일 유형만 지원합니다. 이 유형의 가드레일을 사용하여 정규 표현식 패턴 설정하다 에 대해 에이전트의 출력을 평가할 수 있습니다. 가드레일의 config.match_patterns 필드 에서 이러한 패턴을 정의합니다.
각 가드레일은 다음 조치 중 하나를 지정합니다.
작업 | 설명 |
|---|---|
| 통화를 거부합니다. 실행이 중지되고 호출자에게 오류가 반환됩니다. |
| 일치하는 콘텐츠를 제거하거나 변환하고 수정된 콘텐츠로 실행을 진행할 수 있도록 허용합니다. |
| 가드레일이 트리거한 것을 기록하고 원본 콘텐츠로 실행을 진행할 수 있습니다. |
| 인적 검토 위해 실행을 일시 중단합니다. 검토자가 승인한 후에만 실행이 진행됩니다. |
가드레일 단계
가드레일의 단계 필터하다 모델로 들어가는 콘텐츠, 모델에서 나가는 콘텐츠 또는 두 가지 모두를 평가할지 여부를 결정합니다. 단계 필터하다 없는 가드레일은 모든 단계에 적용됩니다.
다음 표에서는 사용 가능한 단계에 대해 설명합니다.
단계 | 평가 대상 | 트리거 시기 |
|---|---|---|
| 모델에 도달하는 사용자 콘텐츠 | 모델 호출 전 |
| 모델의 응답 | 응답이 사용자에게 반환되기 전에 |
가드레일 필드
다음 표에서는 가드레일을 정의하는 필드에 대해 설명합니다. 플랫폼 UI 또는 create 또는 update API 요청 의 JSON 요청 본문에서 이러한 필드를 설정하다 수 있습니다.
필드 | Possible values | 설명 |
|---|---|---|
| 모든 문자열 | (필수) 가드레일의 표시 이름입니다. |
| 모든 문자열 | 가드레일의 용도에 대한 설명입니다. |
|
| (필수) 가드레일 유형입니다. |
|
| (필수) 가드레일이 트리거될 때 수행할 작업입니다. |
|
| Atlas Agent Engine이 가드레일을 시행하는지 여부입니다. Atlas Agent Engine은 상태가 |
|
| 가드레일이 콘텐츠를 평가하는 단계의 배열입니다. 두 단계를 모두 평가하려면 |
| 작업 공간 ID 배열 | 가드레일이 적용되는 작업 공간의 배열입니다. 프로젝트 의 모든 작업 공간에 가드레일을 적용 하려면 이 배열 비워 둡니다. |
| 정규식 패턴 배열 | 가드레일이 콘텐츠와 일치하는 패턴의 배열입니다. 각 패턴 |
|
| 패턴 과 일치하는 콘텐츠에 적용 할 동작입니다. 이 필드 |
이러한 필드를 설정하는 요청 본문의 예시 를 보려면 다음 섹션의 REST API 탭 참조하세요.
가드레일 생성 및 편집
플랫폼 UI 또는 REST API 사용하여 가드레일을 만들고 편집할 수 있습니다. 지침을 보려면 원하는 방법의 탭 선택합니다.
Manage → Policies로 이동한 다음 Guardrails 탭 선택합니다.
그런 다음 Create guardrail 버튼을 클릭하고 Create guardrail 대화 상자에서 필드를 구성하여 가드레일을 생성합니다. 가드레일을 업데이트 하려면 가드레일의 Edit 아이콘을 클릭합니다. 가드레일을 삭제 하려면 해당 Delete 아이콘을 클릭합니다.
참고
고객 대면 REST API 가드레일 작업을 노출합니다. 요청에는 베어러 인증 과 적절한 프로젝트 권한이 필요합니다. 프로젝트 역할에 대해 자세히 학습 조직, 프로젝트 및 작업 공간 관리를 참조하세요.
다음 표에는 사용 가능한 엔드포인트가 나열되어 있습니다.
메서드 | 엔드포인트 | 참조 |
|---|---|---|
|
| |
|
| |
|
| |
|
| |
|
|
생성 및 업데이트 엔드포인트를 호출할 때 가드레일의 필드를 JSON 요청 본문으로 전달합니다. 다음 예시 요청 본문은 단일 작업 공간에서 모델에 도달하는 콘텐츠에서 연속 세 자리 숫자를 삭제하는 가드레일을 생성합니다.
{ "name": "Test guardrail", "description": "Redacts three-digit sequences", "type": "output_validation", "action": "modify", "status": "active", "stage_filter": ["llm_input"], "workspace_ids": ["ws-6a885deac97e9d280fa88cf3"], "config": { "match_patterns": [ { "type": "regex", "value": "\\d{3}" } ], "on_fail": "fix" } }
가드레일 전파
가드레일을 생성, 업데이트 또는 삭제 후에는 OE가 처리하는 다음 실행에 변경 사항이 적용됩니다. 가드레일 쓰기 (write) 는 OE의 캐시된 가드레일을 다시 로드하므로 다음 요청 에 변경 사항이 적용됩니다.
가드레일 변경은 진행 중인 실행에 영향을 주지 않습니다.
적용
각 실행 중에 OE는 현재 프로젝트 에 적용 가드레일을 기준으로 각 단계의 콘텐츠를 평가합니다. 다음 표에서는 단계와 해당 평가 콘텐츠에 대해 설명합니다.
단계 | 콘텐츠 평가 |
|---|---|
| 사용자 콘텐츠는 모델 호출 전에 평가됩니다. |
| 모델의 응답은 사용자에게 반환되기 전에 평가됩니다. |
block 조치 있는 가드레일이 트리거되면 OE가 실행을 중지하고 호출자에게 오류를 반환합니다. 이 오류는 차단 일으킨 가드레일을 식별합니다. modify 조치 가 있는 가드레일이 트리거되면 수정된 콘텐츠로 실행이 진행됩니다.
동일한 콘텐츠와 일치하는 가드레일이 두 개 이상인 경우 가장 제한적인 조치 적용됩니다. 조치의 순위는 가장 제한이 큰 것부터 덜 제한적인 것까지입니다.
blockrequire_reviewmodifylog_only
예시 들어, 한 가드레일이 modify를 반환하고 다른 가드레일이 block을 반환하는 경우 OE는 호출을 차단합니다.
제한 사항
가드레일에는 다음과 같은 제한 사항이 있습니다.
향후 실행에만 해당: 가드레일 변경 사항은 변경 사항이 적용된 후에 시작되는 실행에만 적용 . 이미 진행 중인 실행은 시작한 가드레일에서 계속됩니다.
콘텐츠 제어만 해당: 가드레일은 모델 안팎으로 전달되는 콘텐츠를 제어합니다. 호출할 수 있는 도구 및 모델과 같이 에이전트 수행할 수 있는 조치를 제어하려면 정책 엔진을 사용합니다.