AI 에이전트 '실행 단계'까지 점검.. 금융보안원, 보안 평가기준 대폭 확대
17개 점검 항목 마련
인공지능(AI) 에이전트를 활용한 해킹 공격이 금융권을 강타한 가운데 금융보안원이 '금융분야 AI 에이전트 보안 평가 기준'을 마련했다. 금융회사가 AI 에이전트의 공격에 맞서 AI 에이전트를 활용한 보안체계를 강화해야 하는데 AI 에이전트가 실수를 할 수 있는 만큼 점검 목록을 늘린 것이다. 이미 AI 에이전트발 정보유출 사고가 벌어졌지만 서둘러 추가 피해를 막겠다는 모습이다.
7일 금보원은 'AI 모델 위협 점검 기준 및 AI 에이전트 보안 평가기준(안)'을 마련했다고 밝혔다. AI 에이전트는 주어진 목표 달성을 위해 스스로 계획을 세우고, 각종 도구와 외부 시스템을 활용해 실제 작업을 수행하는 시스템이다. 기존 거대언어모델(LLM)이 텍스트 답변 생성에 그쳤던 것과 달리, 에이전트는 '실행' 능력과 권한을 보유한 것이 특징이다.
생성형 AI를 활용하던 기존에는 환각(할루시네이션)으로 대표되는 답변 오류가 주요 보안 위협으로 이어졌다. 자율성을 갖춘 AI 에이전트는 실행력도 있어 작은 실수가 전체 보안 시스템을 위협하는 행위로 전이·확대될 수 있다. 예를 들어 '시스템 성능 최적화'라는 목표를 부여받은 에이전트가 가용성 확보를 위해 백신을 스스로 중단할 수 있다는 것이다. 또 이메일 자동 답장 기능을 가진 에이전트가 비밀번호 재설정 안내 메일을 보고 임의로 비밀번호를 바꿀 수도 있다.
금보원은 국내외 주요 AI 에이전트 보안 위협 및 대응 방안을 분석해 17개 점검 항목을 도출했다. 이를 AI 레드티밍 기준에 반영했다. AI 레드티밍은 AI 에이전트가 실제로 어떤 작업을 어떻게 실행하는지, 그 과정이 어떻게 통제되는지 확인하기 위해 점검 범위를 확대한다. 기존에는 탈옥, 시스템 프롬프트 유출 등 모델 계층 점검이 중심이었으나 앞으로는 실행 계층까지 점검을 확장한다. 주요 점검 항목은 △실행 권한 및 격리 관리 △도구 실행 및 승인 통제 △작업 범위 및 결과 확인 △자율 실행 제한 및 중단 여부 등이다.
금보원은 올해 말까지 시범 검증을 통해 각 항목의 실효성을 점검한다. 시범 적용과정에서 점검 가능 여부, 금융회사별 구현 방식 차이 등을 반영해 점검 항목과 방법을 구체화한다. 또 레드티밍 과정에서 확인된 AI 에이전트 보안 위협과 실제 공격 기법, 최종평가 기준 등은 '2026년 AI 레드팀 리포트'를 통해 공개할 예정이다.
박상원 금보원장은 "AI 에이전트는 판단에 그치지 않고 직접 행동한다는 점에서 기존 AI와는 또 다른 보안 리스크를 수반한다"며 "이번 평가기준 마련을 계기로 금융권 AI 에이전트의 위험을 실질적으로 검증하고, 금융회사의 안전하고 신뢰할 수 있는 AI 기술 활용을 적극 지원해 나가겠다"고 밝혔다.
한편 금융감독원에 따르면 올해 8월까지 국내 20개 은행이 실시한 모의해킹 78건 중 AI 에이전트를 활용한 모의해킹은 9건(11.5%)에 불과했다.
[email protected] 박문수 기자




