AI 경쟁의 다음 단계는 모델이 아니라 운영력이다
정부가 AI 에이전트를 도입할 때 가장 위험한 질문은 “어느 모델이 제일 똑똑한가”에서 멈추는 것이다. 행정 시스템에서 중요한 차이는 답변의 유창함보다 누가 어떤 자료를 읽을 수 있고, 어떤 행동을 실행할 수 있으며, 그 과정을 나중에 재현할 수 있는가에서 생긴다.
챗봇은 초안을 보여 주고 사람이 복사하는 데서 끝날 수 있다. 에이전트는 검색, 문서 작성, 내부 시스템 조회, API 호출, 신청 처리까지 여러 단계를 잇는다. 같은 모델도 권한과 승인 구조가 다르면 전혀 다른 공공 서비스가 된다. 2026년 한국·미국·일본의 공식 자료를 함께 보면 경쟁의 중심이 모델 구매에서 운영 체계로 옮겨 가는 이유가 선명하다.

이 이미지는 정부 AI 운영을 설명하기 위해 새로 만든 개념 사진이며 특정 기관, 제품 또는 실제 회의 장면이 아니다.
한국은 서비스 출시와 데이터·개인정보 과제를 한 회의에 올렸다
대한민국 정책브리핑에 따르면 2026년 10월 2일 열린 제5차 인공지능책임관 협의회는 참석 범위를 42개 중앙행정기관으로 넓혔다. 회의에는 AI 입법 프레임워크, 12월 정식 출시를 준비하는 ‘모두의 AI’, 범정부 데이터 파이프라인, 공공부문 개인정보보호 관리체계라는 4개 안건이 올라왔다.
여기서 눈여겨볼 부분은 서비스와 통제 장치가 별도 일정이 아니라는 점이다. 공개된 공공 API 연결, 아직 열리지 않은 API와 데이터의 추가 개방, 에이전트의 개인정보 처리·활용 기준, 보안·안전성 검증이 모두 관계기관 협조 과제로 제시됐다. 이는 준비 상황에 관한 공식 발표이지 12월 서비스의 모든 기능과 안전성이 이미 검증됐다는 뜻은 아니다.
운영 관점에서는 데이터 개방 자체보다 접근 조건이 중요하다. 주민 정보 조회, 지원 자격 판단, 신청서 제출은 모두 같은 ‘API 연결’로 보이지만 실패 비용이 다르다. 읽기 전용 조회와 외부 상태를 바꾸는 제출 권한을 분리하고, 후자는 담당자의 명시적 승인을 거치게 해야 한다.
일본의 겐나이는 조직 전체 실증과 에이전트 환경을 연결한다
일본 디지털청의 가버먼트 AI 겐나이 안내는 2026년도에 전 부처 약 18만 명의 정부 직원을 대상으로 대규모 실증을 진행한다고 설명한다. 일반 대화·요약·번역뿐 아니라 행정 실무용 애플리케이션, 정부 공통 데이터셋, 국내 대규모 언어 모델 시험을 한 환경에서 다루는 구상이다. 본격 이용은 2027년도 이후 예산 조치와 연결된 일정으로 구분돼 있다.
9월 18일 공개된 겐나이 OSS 2.0 계획에는 웹 검색, 자료 생성, 코드 실행, 스킬 실행을 조합하는 에이전트 채팅과 개인 전용 코딩 환경인 ‘겐나이 공방’이 포함됐다. 이용 실적을 내보내 분석하는 자재와 조직 간 스킬 공유 구상도 언급됐다. 다만 이 페이지는 2027년 2월 무렵 공개를 목표로 한 개발 중 계획이며 내용이 바뀔 수 있다고 명시한다. 2026년 10월 도입 예정이라는 설명도 실제 전면 가동 확인과 구분해야 한다.
일본 사례가 보여 주는 핵심은 에이전트 기능만 공개하는 것이 아니라 이용 현황, 품질·안전성 평가, 데이터 기반, 기술 지원까지 함께 설계해야 한다는 점이다. ‘직원 18만 명이 접근 가능하다’와 ‘18만 명이 같은 수준으로 안전하게 활용한다’는 서로 다른 지표다.
미국은 에이전트의 신원과 권한을 보안 문제로 다룬다
미국 NIST의 AI 에이전트 보안 의견 분석은 2026년 5월 공개됐다. 제출 의견은 에이전트가 새로운 보안 위협을 만들고 이것이 도입 장벽이 된다는 데 대체로 동의했으며, 기존 사이버 보안 원칙도 에이전트 환경에 맞게 조정할 필요가 있다고 봤다. 정부 역할로 구현 지침, 정보 공유, 표준 촉진이 제안됐다. 이 문서는 의견 수렴 결과의 요약이지 완성된 의무 표준은 아니다.
9월 24일 NIST NCCoE 업데이트는 소프트웨어 개발 과정에서 에이전트를 식별하고 인증하며 권한을 부여하는 구현 사례의 범위를 잡고 있다고 설명했다. 10월 28일 웨비나와 11월 9일까지의 의견 수렴은 10월 3일 현재 미래 일정이다. 따라서 미국도 ‘정답을 이미 확정했다’기보다 에이전트 신원과 행동 권한을 검증 가능한 보안 단위로 만드는 단계에 가깝다.
운영력은 7개의 층으로 설계해야 한다
정부 AI 에이전트의 운영 모델은 최소 7개 층으로 나누는 편이 안전하다.
- 업무 경계: 에이전트가 해결할 업무와 하지 않을 업무를 한 문장으로 정한다.
- 데이터 경계: 공개 자료, 내부 일반 자료, 개인정보, 민감정보를 분류하고 교차 검색 가능 여부를 정한다.
- 신원: 사람, 에이전트, 서비스 계정, 외부 도구를 서로 다른 주체로 식별한다.
- 권한: 읽기, 추천, 초안 작성, 내부 저장, 외부 제출을 단계별로 분리한다.
- 사람 승인: 법적 효과, 금전 지출, 민원 회신, 개인정보 제공 전에는 승인자를 지정한다.
- 감사 기록: 사용 모델, 입력 자료, 도구 호출, 결과, 승인자, 수정 내용과 시간을 남긴다.
- 중단과 복구: 잘못된 권한이나 이상 행동을 발견하면 토큰을 폐기하고 진행 중 작업을 멈추며 원상복구한다.
이 층들은 제품 기능표와 다르다. 한 공급사가 제공하는 버튼만 믿지 말고 조직의 계정 체계, 기록 보존, 민원·감사 절차와 연결해야 한다. 특히 ‘관리자 권한을 가진 에이전트’처럼 넓은 역할은 피하고, 한 업무에 필요한 최소 권한을 짧은 시간 동안만 발급하는 편이 좋다.
읽기·추천·행동의 3단계 권한 사다리
도입 초기에는 권한을 3단계로 단순화할 수 있다.
- 1단계 읽기: 공개 규정과 승인된 내부 문서를 검색하고 근거 위치를 제시한다. 외부 상태를 바꾸지 않는다.
- 2단계 추천: 회신이나 결정 초안을 만들지만 시스템에 저장하거나 발송하지 않는다. 담당자가 수정·승인한다.
- 3단계 행동: 승인된 API를 호출해 예약, 통지, 신청 접수 같은 상태 변경을 수행한다. 작업별 승인과 사후 확인이 필요하다.
권한은 사용자 직급만 따라가면 부족하다. 같은 직원도 상담 초안을 만들 때와 지급 결정을 내릴 때 필요한 권한이 다르다. 에이전트가 다른 에이전트를 부르는 경우에는 호출 사슬 전체의 권한을 기록해야 한다. 하위 작업이 상위 작업보다 더 넓은 데이터에 접근하는 권한 상승도 막아야 한다.
사람 승인은 버튼 한 번이 아니라 판단 자료다
승인 화면에는 ‘확인’ 버튼만 있으면 안 된다. 담당자가 무엇이 바뀌는지 판단할 수 있도록 다음 정보를 함께 보여 줘야 한다.
- 사용한 원문과 최신 갱신 시각
- 에이전트가 제안한 결과와 기존 값의 차이
- 영향을 받는 사람·금액·기한
- 불확실하거나 찾지 못한 항목
- 실행 후 되돌릴 수 있는지 여부
- 같은 유형의 최근 오류와 사람 개입 기록
승인이 너무 잦으면 직원은 내용을 읽지 않고 통과시키는 ‘승인 피로’에 빠질 수 있다. 반대로 모든 행동을 자동화하면 작은 오류가 대량으로 반복된다. 금액, 개인정보 범주, 외부 전송, 법적 효과처럼 위험 기준을 정해 승인 강도를 다르게 해야 한다.
감사 로그는 대화 기록보다 넓어야 한다
대화 전문만 저장하면 사고를 재현하기 어렵다. 에이전트가 어떤 버전의 모델과 스킬을 썼는지, 어떤 문서를 읽었는지, 어느 서비스 계정으로 어떤 API를 호출했는지, 사람이 어느 부분을 바꿨는지를 연결해야 한다.
반드시 남길 항목은 작업 ID, 사용자와 에이전트 ID, 권한 발급·만료 시각, 입력 자료의 식별자와 버전, 도구 호출과 반환 상태, 사람 승인 또는 거절, 최종 결과, 오류 코드, 복구 작업이다. 개인정보 원문을 로그에 중복 저장하지 않고 필요할 때 권한 있는 원본으로 추적할 수 있는 참조값을 쓰는 방법도 검토한다.
로그 열람 권한도 제한해야 한다. 보안을 위해 쌓은 기록이 새로운 개인정보 저장소가 될 수 있기 때문이다. 보존 기간과 삭제 조건, 내부 감사와 사고 조사 때의 접근 절차를 도입 전에 정한다.
90일 도입은 기능보다 통제 장치를 먼저 시험한다
첫 30일에는 읽기 전용 업무 하나를 고르고 현재 처리 시간, 재작업률, 민원 오류를 기준선으로 남긴다. 31~60일에는 에이전트가 초안을 만들되 모든 결과를 사람이 검토한다. 이때 잘못 찾은 근거, 과도한 개인정보 접근, 불필요한 도구 호출을 분류한다.
61~90일에는 위험이 낮고 되돌릴 수 있는 행동만 제한적으로 허용한다. 승인 없이 외부 발송하지 못하게 하고, 하루 호출량과 업무 범위를 제한하며, 비상 중단 훈련을 실제로 해 본다. 시험 종료 때는 속도 향상만 보지 말고 다음 지표를 함께 비교한다.
- 100건당 사람 수정과 거절 횟수
- 근거를 찾지 못했는데도 답을 만든 비율
- 권한 초과 시도와 차단 성공률
- 개인정보가 불필요하게 노출된 건수
- 오류 발견부터 중단·복구까지 걸린 시간
- 직원 한 명이 감독할 수 있는 작업량과 새로 생긴 부담
조달 계약에서 물어야 할 질문
정부가 모델이나 플랫폼을 구매할 때 데이터 학습 제외 문구만 확인해서는 부족하다. 에이전트별 서비스 계정을 만들 수 있는지, 세부 권한과 만료 시간을 설정할 수 있는지, 도구 호출 로그를 내보낼 수 있는지, 모델·스킬 업데이트 전후를 재현할 수 있는지 확인해야 한다.
공급사를 바꿀 때 작업 정의, 승인 규칙, 감사 로그를 표준 형식으로 이전할 수 있는지도 중요하다. 외부 하청 운영자와 모델 제공자가 어떤 데이터에 접근하는지, 사고 통지 기한과 조사 협력 범위, 계약 종료 뒤 파생 로그의 삭제 방법을 분리해 적는다.
결론은 더 큰 모델보다 더 작은 권한이다
한국은 서비스 출시, API·데이터, 개인정보와 보안을 한 범정부 의제로 묶고 있다. 일본은 약 18만 명 규모의 실증과 행정 앱·공통 데이터·에이전트 환경을 연결한다. 미국 NIST는 에이전트의 보안, 신원, 인증과 권한 부여를 구현 문제로 다룬다. 세 나라가 같은 제도를 채택한 것은 아니지만, 모델 성능만으로 정부 AI가 운영되지 않는다는 방향은 겹친다.
공공 AI의 신뢰는 한 번의 멋진 답변보다 잘못된 행동을 막고, 승인 이유를 남기며, 사고 뒤 원인을 재현할 수 있을 때 생긴다. 다음 경쟁의 단위는 파라미터 수가 아니라 최소 권한, 명시적 승인, 완전한 기록, 빠른 복구를 일상 업무에 얼마나 안정적으로 넣는가다.



