우리는 고객의 이름을 밝히지 않습니다. 신원이 드러나는 사례 연구도 공개하지 않습니다. 우리가 공유할 수 있는 것은 아키텍처입니다 — 해결한 문제, 구축한 시스템, 그리고 납품한 인프라에 대한 익명화된 설명입니다.
고객은 이전 공급업체가 배포한 독립적인 레거시 하이퍼바이저 클러스터(VMware)로 3개 물리적 사이트를 운영했으며, 사이트 간 장애 조치가 없었고 수명이 다해 가는 노후 SAN 인프라를 보유하고 있었습니다. Broadcom 인수 이후 VMware 라이선스 비용은 계속 증가했습니다. 공개 클라우드는 규제 체계에 따라 계약상 금지되어 있었습니다.
Ceph(ceph.io) 스토리지, Layer 2 확장용 VXLAN 오버레이, 30초 미만의 복구 시간을 갖춘 자동 장애 조치를 포함한 3-사이트 Proxmox VE 클러스터를 설계하고 배포했습니다. 기본적으로 에어갭(air-gapped)으로 구축되어 모든 노드가 인터넷 접속 없이 운영되며, 업데이트는 VPRS 프록시를 통해 전달됩니다. 사이트 간 연결은 동적 경로 선택을 위한 BGP와 함께 WireGuard 메시로 구성됩니다.
18개월 동안 계획 외 다운타임이 단 한 건도 없었습니다. 독점 SAN에서 범용 하드웨어 기반 Ceph(ceph.io)로 전환하여 스토리지 비용이 60% 절감되었습니다. 고객은 이제 3개 물리적 위치에 걸쳐 단일 논리 데이터센터를 운영하고 있습니다.
세그멘테이션이 없는 플랫 네트워크 아키텍처였습니다. VPN 접근이 광범위한 네트워크 수준 권한을 부여하고 있었고, 신원에 기반한 접근 제어가 없었습니다. 네트워크 세그멘테이션 및 권한 있는 접근 관리 부재로 여러 차례 보안 감사에서 지적을 받았습니다.
위협 탐지 및 규정 준수 모니터링을 위해 모든 엔드포인트에 Wazuh SIEM을 배포했습니다. 상태 검사(posture checking)를 지원하는 Netbird 제로 트러스트 메시 VPN을 구현했습니다 — 모든 연결은 터널 설정 전에 OS 패치 수준, 디스크 암호화 상태, 기기 신원을 확인합니다. 모든 권한 있는 접근에 세션 녹화와 Kratos 일회용 비밀번호 적용을 갖춘 VPMS(JumpServer)를 배포했습니다. 네트워크를 12개 VLAN으로 분할하고 OPNsense를 통해 VLAN 간 방화벽 정책을 관리했습니다.
이후 보안 감사에서 지적 사항 없이 통과했습니다. 보안 이벤트 탐지 평균 시간이 며칠에서 몇 분으로 단축되었습니다. 이제 모든 권한 있는 세션이 기록되고 감사 가능합니다.
고객은 내부 애플리케이션을 위한 컨테이너 오케스트레이션 플랫폼이 필요했지만 어떤 인프라도 공개 인터넷에 노출할 수 없었습니다. 기존 배포 프로세스는 수동이었습니다 — 서버에 SSH로 접속하고, 바이너리를 복사하고, 수작업으로 설정했습니다.
완전히 에어갭된 Kubernetes 클러스터로 VKBS(Talos Linux + Cilium + containerd)를 배포했습니다. 컨테이너 이미지는 푸시 시점에 안티바이러스 API 스캔을 수행하는 VCRS(Harbor)에서 제공됩니다. OS 업데이트는 VPRS 프록시를 통해 전달됩니다. DNS 해석은 스플릿 호라이즌 구성의 VDNS가 처리합니다. 모든 클러스터 통신은 내부 VXLAN으로 제한됩니다 — 어떤 노드도 외부 네트워크로의 기본 경로(default route)가 없습니다.
애플리케이션 배포 시간이 몇 시간에서 몇 분으로 단축되었습니다. 조직 최초의 에어갭 Kubernetes 배포였습니다. 이 플랫폼은 이제 내부 호스팅 GitLab 러너를 통한 자동화된 CI/CD로 40개 이상의 내부 서비스를 운영하고 있습니다.
재해 복구 기능이 없는 단일 사이트 배포였습니다. 백업 전략은 수동이고 테스트되지 않았으며 프로덕션과 동일한 물리 인프라에 저장되어 있었습니다. 기본 데이터센터에서 냉각 장애가 발생하면 데이터가 전부 손실될 상황이었습니다.
불변(immutable) 백업 체인을 갖춘 VBKS를 VNAS 스토리지에 배포했습니다. 72시간마다 자동화된 장애 조치 테스트와 함께 WireGuard 터널을 통한 보조 사이트 복제를 구성했습니다. 사이트 간 쿼럼(quorum)이 구성된 Proxmox VE HA 클러스터를 설정했습니다. 문서화되고 테스트된 복구 런북을 마련했습니다 — 전체 사이트 장애 조치가 4분 이내에 완료됩니다.
자동화된 테스트를 통해 5분의 복구 시간 목표(RTO)를 달성하고 검증했습니다. 복구 시점 목표(RPO)는 15분입니다. 고객은 기본 사이트 정전 상황에서 데이터 손실 없이 3분의 서비스 중단만으로 대응했습니다.
고객은 전체 애플리케이션 스택의 인증을 Microsoft Entra ID에 의존하고 있었습니다. 업계의 규제 변경으로 아이덴티티 데이터가 미국 기반 인프라에 노출되지 않고 EU 관할권 내에 유지되어야 했습니다. Microsoft 365와 Entra ID는 이 요구사항을 충족할 수 없었습니다.
드롭인 교체(drop-in replacement)로 VIDS(Zitadel 기반 아이덴티티 시스템)를 배포했습니다. 500개 이상의 사용자 아이덴티티를 마이그레이션하고, 12개 내부 애플리케이션에 OpenID Connect 및 SAML 통합을 구성했으며, 고객의 기존 LDAP 디렉터리와 페더레이션했습니다. 회사 전체 비밀번호 관리를 위해 VPWS(Vaultwarden)를 배포했습니다. 전환 전에 Entra ID와 VIDS를 30일간 병행 운영했습니다.
인증 다운타임 없이 전체 마이그레이션을 완료했습니다. 모든 아이덴티티 데이터는 이제 EU 인프라에 저장됩니다. 고객은 더 이상 미국 기반 아이덴티티 제공업체에 의존하지 않습니다.
“이 페이지가 존재하는 이유는 인프라 엔지니어링이 증거 기반이기 때문입니다. 우리는 고객의 이름을 밝힐 수 없습니다. 하지만 우리의 작업을 설명할 수는 있습니다. 더 자세한 내용이 필요하다면 고객이 되어 주십시오 — 직접 확인하실 수 있습니다.”