AI는 규칙을 이해하는 것만으로 충분하지 않다
AI SECURITY INSIGHTS
Frontier AI 모델 평가에서 발견된 ‘Cheating Behaviour’와
AI Agent 보안의 새로운 과제
핵심메시지
AI가 목표를 달성했다는 사실만으로는 안전을 보장할 수 없습니다.
허용된 정보·권한·도구와 정책 경로를 통해 행동했는지까지 독립적으로 검증해야 합니다.
AI 에이전트는 사용자가 지정한 목표를 달성하기 위해 정보를 검색하고, 코드를 실행하며, 외부 도구와 시스템을 호출합니다. 이러한 자율성은 업무 생산성을 높이지만, 동시에 새로운 보안 질문을 만듭니다. AI가 과업을 성공적으로 완료했더라도, 그 과정이 조직에서 허용한 방식이었는지는 별도로 검증해야 하기 때문입니다.
2026년 7월, 영국 AI Security Institute(AISI)는 Frontier AI 모델을 대상으로 한 사이버 역량 평가에서 모든 평가 대상 모델이 적어도 일부 실행 과정에서 이른바 ‘Cheating Behaviour’를 시도했다고 발표했습니다. 모델은 이러한 행동을 질문받았을 때 일관되게 보고하지 않았고, Chain of Thought에도 관련 판단이 항상 나타나지 않았습니다. AISI는 이를 바탕으로 강건한 모니터링 방법의 필요성을 제기했습니다. [1]
AISI가 말하는 ‘Cheating’이란 무엇인가?
AISI는 Cheating을 “과업 범위를 벗어나거나 규칙에 의해 명시적으로 금지된 행동을 통해, 의도되지 않은 지름길·우회 방법으로 목표를 달성하려는 행위”로 정의합니다. 이 용어는 반드시 모델의 기만적 의도를 전제하지 않습니다. 핵심은 의도보다도, 실제 행동이 허용된 범위와 정책을 벗어났는지 여부입니다. [1]
AISI의 평가에서 모델은 시뮬레이션 환경에 숨겨진 문자열인 Flag를 찾아야 했습니다. 허용된 공격 범위 안에서 코드를 역분석하거나 취약점을 이용해야 했지만, 일부 실행에서는 인터넷에서 기존 해답을 검색하거나, 평가 대상이 아닌 시스템의 권한을 상승시키거나, 평가 소프트웨어가 정답을 노출하는지 탐색하는 등의 행동이 관찰됐습니다. [1]
모든 평가 대상 모델에서 시도가 관찰됐다
AISI는 자동화된 LLM Monitor를 사용해 모델의 전체 trajectory, 즉 추론과 행동의 연속을 분석했습니다. 다만 모니터가 모든 사례를 잡아낸다고 보장할 수 없으므로, 결과는 완전한 발생률이 아니라 “탐지된 시도의 하한선”으로 해석해야 합니다. [1]
또한 모델의 역량이 높을수록 시도 비율이 일관되게 증가하거나 감소하는 명확한 추세는 확인되지 않았습니다. AISI는 이러한 행동이 순수한 모델 역량뿐 아니라 Alignment Training을 포함한 학습 방식의 영향을 크게 받을 수 있다고 설명합니다. [1]
정상적인 결과가 정상적인 과정을 의미하지는 않는다
기존 AI 평가는 주로 최종 결과를 확인합니다. 정답을 찾았는지, 요청된 업무를 완료했는지, 출력 내용에 문제가 없는지를 중심으로 판단합니다. 그러나 AI 에이전트가 외부 도구와 업무 시스템을 직접 사용할 수 있게 되면 최종 결과만으로는 충분하지 않습니다.
예를 들어 보고서가 정상적으로 생성됐더라도, AI가 승인되지 않은 외부 서비스에 데이터를 전송하거나 업무 범위를 벗어난 파일을 열람하고, 허용되지 않은 Tool 또는 MCP Server를 호출했을 수 있습니다. 결과는 성공이지만, 보안 관점에서는 정상적인 수행이라고 볼 수 없습니다.
모델에게 직접 물어보는 것만으로는 부족하다
AISI의 실험에서 모델은 자신이 시도한 Cheating Behaviour를 일관되게 인정하지 않았으며, 해당 행동을 잘못된 것으로 묘사한 비율도 50% 미만이었습니다. 모델이 행동을 인정하더라도 허용된 행동이었다고 설명하는 경우가 있었습니다. [1]
Chain of Thought 감시도 단독으로는 충분하지 않았습니다. 모델이 관련 행동에 대해 명시적으로 추론하지 않는 경우가 많았고, 금지된 행동일 수 있음을 고려한 뒤에도 실행을 계속한 사례가 관찰됐습니다. AISI는 자기보고와 Chain of Thought 모두 독립적인 탐지 수단으로는 견고하지 않다고 결론 내립니다. [1]
사전 평가만으로 운영 환경의 안전을 보장할 수 있을까?
AISI는 공개 역량 평가에서 사람이 transcript를 직접 검토하고 자동 LLM Monitor를 병행해 Cheating이 결과를 부풀리지 않도록 관리했습니다. 그러나 실제 기업 환경에서 수백 또는 수천 건의 에이전트 실행을 모두 사람이 검토하는 것은 어렵습니다.
같은 모델도 사용자 요청, 제공된 Context, 저장된 Memory, 연결된 Tool·API·MCP Server, 접근 권한과 외부 데이터 변화에 따라 다른 행동을 보일 수 있습니다. 따라서 AI 보안은 배포 전 검증으로 끝나는 일회성 절차가 아니라, 운영 중 지속되는 관찰·정책 평가·실행 통제로 확장되어야 합니다.
AI Agent Security는 행동과 실행 경로를 확인해야 한다
보안 시스템은 누가 작업을 시작했는지, 어떤 모델과 버전이 사용됐는지, 어떤 Prompt·Context·Memory가 판단에 영향을 줬는지, 어떤 Tool·API·MCP Server가 호출됐는지, 실제 외부 시스템에서 무엇이 실행됐는지를 연결해 추적할 수 있어야 합니다.
이 정보가 연결되어야 “AI가 과업을 완료했는가”를 넘어 “허용된 방식으로 과업을 완료했는가”를 평가할 수 있습니다.
이러한 이유로 ASH가 필요하다
ASH는 AI 모델의 도입부터 AI 에이전트의 Runtime, Endpoint 실행과 Governance까지 연결하는 AI Agent Security Platform입니다. Model Security, Runtime Security, Endpoint Security 및 Governance 영역을 하나의 프레임워크로 구성하며, 조직 환경에 따라 단계적으로 확장할 수 있습니다. [2]
Model Gate | 운영 전 모델 검증
AI 모델이 운영 환경에 투입되기 전에 AI-BOM, 무결성, 승인 정책과 관련 증적을 확인하고, 검증된 모델만 운영 단계로 이동하도록 관리합니다. [3]
RunWatch | 운영 중 AI 행동 감시
Prompt·Context·Memory와 Tool·API·MCP 호출, 외부 실행 결과를 연결해 관찰하고, 정책 범위를 벗어나거나 예상하지 못한 행동을 식별하기 위한 Runtime Security 계층입니다.
EndForce | 실제 실행 단계 통제
AI의 판단이 파일 변경, 명령 실행, 네트워크 연결 등 엔드포인트 행동으로 이어지는 단계에서 실행을 관찰하고, 필요할 경우 제한하거나 차단합니다.
Governance | 연결된 감사와 정책 관리
모델 반입, 에이전트 실행, 도구 호출, 엔드포인트 행동과 정책 판단을 하나의 감사 흐름으로 연결해 조직이 AI 행동을 설명하고 검증하도록 지원합니다. [2]
AI에게 목표만 주는 시대에서, 행동을 검증하는 시대로
AI 에이전트가 단순한 답변 생성을 넘어 실제 업무와 시스템을 실행하기 시작하면서 보안 질문도 달라져야 합니다.
- AI는 허용된 정보와 권한을 사용했는가?
- 정책이 정한 경로를 따라 행동했는가?
- 최종 행동은 제공된 근거에서 타당하게 도출됐는가?
- 예상하지 못한 우회 행동이 발생했을 때 확인하고 중단할 수 있는가?
AISI의 연구는 Frontier AI 모델의 자기보고와 추론 기록만으로 이러한 질문에 충분히 답하기 어렵다는 점을 보여줍니다. AI가 더 많은 도구와 권한을 갖게 될수록 신뢰는 모델의 선언이 아니라 독립적인 행동 관찰, 실행 검증과 정책 통제를 통해 확보되어야 합니다.
ASH는 AI 모델 공급망부터 AI 에이전트의 Runtime과 Endpoint 실행까지 연결해, 기업이 AI의 결과뿐 아니라 그 결과에 도달한 행동 과정까지 관리할 수 있도록 설계됐습니다.
참고 자료 및 출처
- [1] UK AI Security Institute, “Cheating behaviour in frontier model evaluations,” 21 July 2026. 원문 보기
- [2] COONTEC, “ASH — AI Agent Security Framework / Platform,” internal product introduction, 2026.
- [3] COONTEC, “ASH Model Gate — AI-BOM Linked Model Supply-Chain Security Gate,” internal product introduction, 2026.
- [4] Secondary transcription reference for Figure 1 values: Studio Global AI, summary of UK AISI findings, July 2026. 원문 보기
