AlpacaX

Testimonial

Testimonial: 장애가 나면 외부에 전화해서 해결하던 팀이, 이제는 직접 진단하고 해결합니다

인프라를 전담하는 DevOps도 없던 팀이, 이제는 AI 에이전트에게 작업을 맡기고 문제를 해결합니다.

Taeyeong Baek
Taeyeong BaekGTM Associate · 2026년 9월 28일

인프라를 전담하는 DevOps도 없던 팀이, 이제는 AI 에이전트에게 작업을 맡기고 문제를 해결합니다.

한눈에 보기

도입 전지금
프로덕션 장애 진단사내에서는 불가능, 외부에 요청AI 에이전트가 Alpacon에 연결된 서버를 직접 진단
관리 대상 인프라일부 서버만 연결BNOW 인프라 전체를 Alpacon에 연결
장애 발생부터 해결까지길게는 4시간 이상아무리 오래 걸려도 1시간 이내

Alpacon을 통해 AI 에이전트를 프로덕션에 안전하게 도입한 뒤 가능해진 결과입니다.

BNOW

BNOW는 동물생체데이터를 분석하는 솔루션을 운영합니다. 캡슐형 센서와 게이트웨이로 현장에서 데이터를 받아 분석하고, 이상이 감지되면 알림을 보냅니다. 국내를 넘어 베트남과 싱가포르 등의 연구기관 및 식량안보 네트워크와 협력하고 있고, 현지 농가에서 실증 테스트를 진행합니다.

과제

장애에 민감한 서비스인데 인프라를 전담하는 사람이 없었습니다

BNOW는 현장 기기에서 데이터를 실시간으로 받아 처리합니다. 서버가 멈추면 서비스가 바로 멈추고, 그 사실이 즉시 드러납니다.

"얘는 센서 데이터가 안 들어오면 바로 티가 나니까. 저희는 실시간으로 데이터를 받는 서비스다 보니까." (BNOW 센터장)

그런데 인프라를 전담하는 사람이 없었습니다. 아예 맡는 사람이 없었던 것은 아닙니다. 센터장이 서버와 DB를 관리해왔습니다. 없는 것은 인프라만 전담하는 DevOps 인력입니다.

그래서 큰 문제가 생기면 대부분 외부에 해결을 요청해야 했습니다. 그리고 그런 일은 편한 시간에 생기지 않았습니다.

"금요일 저녁, 노는 날 아침. 그런 상황들이 많다 보니까." (추동현 대표)

Alpacon은 이미 연결되어 있었습니다. 인프라로 들어가는 경로는 열려 있었다는 뜻입니다. 다만 그것을 어떻게 써야 하는지를 아는 사람이 사내에 없었습니다. 무엇이 문제인지 진단할 수는 없었고, 서버가 살아 있는지 확인하는 정도가 전부였습니다.

"그전에는 그냥 죽었는지 살았는지 정도 확인하는 차원에서 썼던 거고." (BNOW 센터장)

"Alpacon 사용법을 몰랐어요, 여기는." (추동현 대표)

데이터가 끊기면 넘어갈 수 없으니 결국 처리는 됐습니다. 문제는 처리 여부가 아니라 걸리는 시간이었습니다. 지금 보면 간단한 작업인데 길게는 4시간 넘게 걸렸습니다. 요청을 넣는 것, 원인을 찾는 것, 답을 기다리는 것이 각각 시간을 잡아먹었습니다.

AI 에이전트를 써 보려 했지만 프로덕션에는 붙일 수 없었습니다

AI 에이전트가 등장하면서 BNOW도 이것으로 진단과 해결에 도움을 얻으려 했습니다. 하지만 프로덕션에 붙이거나, 에이전트가 실제 작업을 하게 만들지는 못했습니다.

에이전트에게 서버 크리덴셜을 그대로 넘기면 작업은 됩니다. 대신 그 에이전트가 어디까지 손댈 수 있는지에 경계가 없어집니다. 되돌릴 수 없는 작업을 실행해도 막을 방법이 없습니다.

전담 인력이 없는 팀일수록 이 문제가 큽니다. 사고가 났을 때 되돌릴 사람도 없기 때문입니다.

도입

권한만 주고, 실행되는 명령을 제어합니다

Alpacon이 그 경계를 만듭니다. 에이전트에게 작업에 필요한 권한만 부여하고, 실제로 실행되는 명령을 제어합니다. 크리덴셜을 통째로 넘기는 대신 통제된 통로를 여는 방식입니다.

BNOW가 처음 체감한 것도 그 지점이었습니다. AI가 무분별하게 접속하려 할 때 Alpacon이 알림을 주고 막아선다는 것이 눈에 보였습니다.

"우리가 유일하게 할 수 있는 건, AI가 무분별하게 접속하려고 할 때 얼럿을 주는구나. 그게 처음에는 되게 좋았다. 'Alpacon이 막고 있네.'" (추동현 대표)

효용을 확인하고 나머지 서버를 전부 연결했습니다

처음에는 일부 서버만 Alpacon에 연결되어 있었습니다. 쓰면서 효용이 확인되자 윈도우 서버를 비롯해 남아 있던 서버를 모두 붙였습니다.

연결만 한 것이 아니라 인프라 구조부터 조사해 문서로 정리했습니다. 첫 세션에서 데이터베이스 구조를 자동으로 분석해 문서화하고, "데이터베이스를 백업하고 사용자 확인을 받는다"는 규칙을 BNOW 자체 저장소에 기록했습니다.

그렇게 전부 연결되자 에이전트 하나가 인프라 전체를 보게 됐습니다. 서버별로 따로 놀던 작업이 하나로 합쳐졌고, 그때부터 실제 작업을 맡길 수 있었습니다.

일주일이 걸리지 않았습니다

BNOW가 AI 에이전트 도입을 검토하던 시기와 Alpacon 활용 시나리오가 겹쳤습니다. 데모를 한 번 보고 바로 적용에 들어갔습니다.

데모 이후 인프라 전부를 연결하기까지 일주일이 채 걸리지 않았습니다. 별도의 도입 기간이나 교육 과정은 없었습니다.

결과

원격에서 한 번에 진단합니다

이전에는 알림이 나가지 않은 원인을 찾으려면 서버마다 직접 들어가 하나씩 확인해야 했습니다. 서버마다 에이전트를 따로 설치해야 했고, 각각에게 따로 지시해야 했습니다.

지금은 자기 PC 한 대에서 끝납니다.

"이 알림이 며칟날 안 나갔어, 왜 안 나갔을까. VM 세 개 정도 체크해서 걔네들이 체크한 것 중에 시뮬레이션까지 돌려가지고 왜 안 나갔는지 나한테 알려줘. 이게 돼요." (BNOW 센터장)

원인을 찾고 알고리즘을 고치고 GitHub에 올려 서버에 반영하는 것까지 한 흐름으로 이어집니다. 길게는 4시간 넘게 걸리던 일이 아무리 오래 걸려도 1시간 안에 끝납니다.

업무 시간이 아닐 때도 바로 조치됩니다

장애는 여전히 금요일 저녁이나 주말에 생깁니다. 달라진 것은 그때 무엇을 할 수 있느냐입니다.

현장에서 연락이 오면 이제 대표가 먼저 인지하고 직접 조치합니다. 외부에 요청을 넣고 답을 기다리는 구간이 없어졌습니다.

"지금은 이제 Alpacon에 내가 들어가서 리부팅을 시키죠. 거꾸로. 근데 옛날에는 몰랐으니까." (추동현 대표)

팀을 확장하지 않고도 가능합니다

인프라를 전담할 사람이 필요한 상황이었지만, BNOW는 지금 팀 그대로 이 문제를 풀었습니다. 장애 원인을 외부에 물어야 했던 회사가, 지금은 사내에서 직접 진단하고 조치합니다.

"대기업이나 서버를 엄청 많이 운영해서 서버 보안팀이 있으면 보안팀이 쓰는 툴이겠지만, 우리 같은 경우에는 그 서버를 관리하는 Alpacon이 보안팀이 되는 거지." (추동현 대표)

Taeyeong Baek
저자 소개Taeyeong BaekGTM Associate

Taeyeong Baek works on go-to-market at AlpacaX, covering Alpacon, an AI-native PAM platform with runtime execution control for AI agents. He works where the product meets its users—supporting proof-of-concept deployments and building the demo videos and onboarding emails that teams see first—and writes the product updates from there: what changed, and what it makes easier for teams running AI agents in production.


Testimonial: 장애가 나면 외부에 전화해서 해결하던 팀이, 이제는 직접 진단하고 해결합니다 | AlpacaX