이 글은 Happy Eyeballs·QUIC가 아니라 MSS clamp·BBR·SSH 재전송률만 다룹니다. 다중 리전 VPS/점프 호스트에서 아티팩트 회수 p95를 안정화하는 검수표입니다.

문제 이미지

일본·한국·홍콩·싱가포르·미서부를 잇는 경로에서는 평균값보다 p95 꼬리가 먼저 깨집니다. MTU가 구간마다 다르면 SSH 세션은 붙어도 대용량 아티팩트 회수에서 세그먼트 재전송이 급증합니다. 이때 DNS보다 먼저 확인할 항목이 MSS clamp 일관성BBR 실험군 상태입니다.

파라미터 표

항목시작값수락 기준
MSS clamp1452(경로 MTU 기반)재전송률 30% 이상 급등 없음
BBRfq + bbrp95 하락 + 손실률 악화 없음
SSH ConnectTimeout8초점프 체인 연결 실패율 1% 미만
# /etc/sysctl.d/90-halo-bbr.conf
net.core.default_qdisc=fq
net.ipv4.tcp_congestion_control=bbr
net.ipv4.tcp_mtu_probing=1

sudo sysctl -a | grep -E 'tcp_congestion_control|default_qdisc|tcp_mtu_probing' > /var/tmp/pre-halo-sysctl.txt
sudo sysctl --system
# ~/.ssh/config (운영자 그룹)
Host halo-jump-*
  ConnectTimeout 8
  ServerAliveInterval 20
  ControlMaster auto
  ControlPersist 5m

# 보안 경계: StrictHostKeyChecking=no 금지

분지역 검수

일본·한국은 근거리라 미세 손실에 민감하므로 5분 이동평균으로 판정합니다. 홍콩·싱가포르는 사업자 혼합 구간이라 30분 창 기준이 안정적입니다. 미서부는 절대 지연이 크므로 p95 단독이 아니라 재전송률·복구시간을 함께 봅니다.

운영 실무에서는 지역 기준선을 주간 단위로 고정해 두는 것이 중요합니다. 기준선이 없으면 동일한 장애를 매번 다른 원인으로 해석하게 되고, 결과적으로 MSS와 BBR 모두 불필요한 토글만 반복하게 됩니다.

  • 동일 시각에 SSH 왕복, 1GB 아티팩트 회수, 인터페이스 재전송 카운터를 같이 수집합니다.
  • 수락 조건: 재전송률 안정 + p95 하락 + 24시간 유지.

회귀(롤백)

1) BBR 실험군 비율을 0으로 내리고 2) sysctl 백업으로 CUBIC 복귀, 3) SSH 제어 소켓 재시작, 4) MSS 규칙 원복, 5) 동일 지표 재측정 순서로 처리합니다. 이 순서를 지키면 장애 범위를 작게 유지할 수 있습니다.

FAQ

Q. HE/QUIC가 있는데 왜 MSS/BBR이 필요합니까?
HE/QUIC는 경로 선택 계층이고, SSH와 대용량 회수의 꼬리 지연은 전송계층 튜닝이 좌우합니다.

Q. 전 리전에 한 번에 BBR 적용해도 되나요?
아니요. 지역 특성이 달라 카나리 방식으로 단계 적용해야 안전합니다. 야간 배포를 권장합니다.

안내: 수치는 운영 시작선입니다. 변경은 승인 절차와 로그 기록을 전제로 적용하세요.
글로벌 진입 검수 시작

노드 패키지·도움말·Halo 매트릭스 글을 함께 확인하세요

노드 선택 후 도움말의 SSH 기준을 맞추고, 관련 Halo 매트릭스 글과 동일한 검수표로 팀 표준을 고정하면 배포 리스크를 빠르게 낮출 수 있습니다.

노드 패키지 보기 도움말 관련 Halo 매트릭스 글