Chapter 03

AP(SoC): 폰의 두뇌

엄지손톱보다 작은 실리콘 한 조각에 CPU 여덟 개 남짓, 그래픽 프로세서, 인공지능 가속기, 카메라 영상 처리기, 그리고 많은 경우 셀룰러 모뎀까지 들어 있다. 이 칩을 애플리케이션 프로세서(AP, Application Processor) 또는 시스템 온 칩(SoC, System on Chip)이라 부른다. 이 장에서는 다이 위의 블록을 하나씩 짚어 보고, 그 블록들이 왜 3~5 W라는 작은 전력 예산 안에 갇혀 사는지, 그리고 그 제약이 폰 전체 설계를 어떻게 좌우하는지 시뮬레이터로 따라간다.

SoC란 무엇인가: 한 칩 위의 컴퓨터

데스크톱 PC를 열면 CPU, 그래픽 카드, 메모리 모듈, 메인보드의 칩셋, 네트워크 카드가 따로따로 꽂혀 있다. 스마트폰에는 그럴 공간도, 전력도 없다. 칩과 칩 사이를 오가는 신호는 패키지 핀과 보드 배선을 거치면서 비트당 수 pJ의 에너지를 쓰지만, 같은 다이 안에서 오가면 그보다 한두 자릿수 적은 에너지로 끝난다. 그래서 폰은 컴퓨터 한 대 분량의 기능을 하나의 다이에 몰아넣는다. 이것이 SoC다.

SoC 안의 블록들은 온칩 인터커넥트(NoC, Network on Chip)라는 고속 도로망으로 연결되고, 모두가 같은 DRAM을 나눠 쓴다. 공유 메모리로 가는 길목에는 시스템 레벨 캐시(SLC, System Level Cache)가 있어 블록 사이의 데이터 교환을 DRAM까지 내려가지 않고 처리한다. 카메라 사진 한 장이 찍히는 과정만 봐도 ISP → NPU → GPU → 디스플레이 컨트롤러로 데이터가 넘어가는데, 이 모든 이동이 SLC와 DRAM을 거친다.

SoC 다이 CPU 클러스터1+3+4 코어 GPU그래픽·연산 NPUAI 가속 ISP카메라 DSP센서·오디오 코덱비디오 온칩 인터커넥트 (NoC) · 코히어런시 시스템 캐시SLC 8–24 MB 메모리 컨트롤러LPDDR5X × 4ch 모뎀5G 기저대역 보안 영역키·생체 I/O PHYUFS·MIPI·USB DRAM (PoP, 칩 위에 적층)
그림 3-1. SoC의 논리 구조. 연산 블록(위)은 NoC를 통해 공유 캐시와 메모리 컨트롤러(아래)에 붙는다. 모든 블록이 같은 DRAM을 나눠 쓰므로 메모리 대역폭은 블록들 사이의 공동 자원이다.
블록주된 일잘하는 것대표 지표
CPUOS, 앱 로직, 브라우저, 게임 로직분기 많은 범용 코드, 낮은 지연IPC × 클럭, 단일/멀티 코어 점수
GPU3D 렌더링, UI 합성, 범용 병렬 연산수천 개의 같은 연산을 동시에TFLOPS(FP32/FP16), fps/W
NPU신경망 추론(사진·음성·LLM)저정밀 행렬 곱TOPS(INT8/INT4), TOPS/W
ISP센서 원시 데이터 → 사진·영상고정 파이프라인 픽셀 처리Gpixel/s, 동시 카메라 수
모뎀4G/5G 기저대역 신호 처리채널 부호·복호, MIMO 연산최대 다운로드 속도, 대기 전류
DSP / 센서 허브오디오, 항상 켜진 센서·키워드 감지mW 이하의 상시 동작µW~mW 대기 전력
비디오 코덱H.265/AV1 인코딩·디코딩전용 하드웨어로 수십 배 효율8K30 / 4K120 등 처리 능력

핵심은 전용 하드웨어의 효율이다. 같은 4K 동영상 디코딩을 CPU가 소프트웨어로 하면 수 W가 들지만, 전용 디코더는 수백 mW 이하로 해낸다. 범용성을 포기한 만큼 에너지가 줄어든다. 그래서 SoC의 역사는 "자주 하는 일을 전용 블록으로 떼어 내는 역사"이기도 하다. 이미지 신호 처리는 ISP로, 신경망은 NPU로, 오디오와 센서 감시는 저전력 DSP로 옮겨 갔다. 카메라 ISP의 파이프라인은 자매편 SensorBook의 ISP 장에서 자세히 다룬다.

폰 안의 위치

AP는 메인보드 하판, 폰의 위쪽 3분의 1 지점에 있다. 바로 위에는 DRAM 패키지가 겹쳐 올라가 있고(PoP, 4장), 그 위로 열 인터페이스 물질과 베이퍼 챔버가 붙어 열을 화면 쪽 넓은 판으로 퍼뜨린다. 배터리와는 일부러 떨어져 있다. 배터리는 45 °C를 넘으면 수명이 빨리 줄기 때문이다. 아래 모델을 돌려 보고, 칩을 눌러 위치를 확인해 보자.

3D

폰 속의 AP와 베이퍼 챔버

드래그로 회전 · 부품 클릭
강조할 부품
해볼 것: 분해를 0으로 줄이면 AP(빨간 고리)와 베이퍼 챔버가 위아래로 정확히 겹친다. 열이 지나가는 경로는 다이 → DRAM 패키지 → TIM → 베이퍼 챔버 → 미드플레이트·디스플레이 순이다.

이 배치에는 이유가 있다. AP는 메모리·전원 IC와 짧게 연결되어야 하고(고속 신호와 큰 전류), 베이퍼 챔버의 한가운데에 있어야 하며, 손으로 쥐는 아래쪽보다 위쪽에 있어야 덜 뜨겁게 느껴진다. 반대로 카메라와 가까우면 ISP로 가는 MIPI 배선이 짧아진다. 보드 위의 위치 하나에도 신호, 열, 사용자 경험이 얽혀 있다.

다이 평면도: 블록별 역할

칩을 패키지에서 꺼내 위에서 찍으면 회색 사각형 조각보처럼 보인다. 각 조각이 하나의 기능 블록이다. 플래그십 SoC의 다이는 대략 100~150 mm², 손톱만 한 크기에 트랜지스터 150억~200억 개 이상이 들어간다. 아래 평면도는 공개된 다이 사진들의 공통 경향을 바탕으로 그린 개략도다(실제 배치는 제품마다 다르다). 블록을 눌러 보자.

SIMULATOR

클릭하는 SoC 다이 평면도

모뎀
강조
다이 면적(개략)—
선택 블록 비중—
트랜지스터 수(추정)—
해볼 것: 모뎀을 외장으로 바꾸면 다이가 작아진다. 대신 그 칩은 보드 위 어딘가에 따로 놓여야 하고 자기 전원·메모리가 필요하다(10절). 메모리 PHY가 다이 가장자리를 둘러싸는 이유도 생각해 보자. 신호가 칩 밖으로 나가는 곳이 가장자리이기 때문이다.

평면도에서 눈에 띄는 경향 몇 가지:

공정 노드: 트랜지스터를 더 작게, 그리고 그 대가

"3 nm 공정"이라는 이름은 더 이상 어떤 물리적 길이도 뜻하지 않는다. 게이트 길이나 금속 배선 간격은 이름보다 훨씬 크다(최소 금속 피치가 20 nm대). 노드 이름은 세대의 상표에 가깝고, 실질적인 지표는 트랜지스터 밀도(MTr/mm²), 같은 성능에서의 전력, 같은 전력에서의 성능이다.

노드(세대)소자 구조논리 밀도(공칭, MTr/mm²)이전 세대 대비 (대략)모바일 적용
7 nm급FinFET~90–100—2018–2020
5 nm급FinFET~130–170전력 −20~30% 또는 성능 +15%2020–2022
4 nm급FinFET~140–1805 nm급의 개량2022–2024
3 nm급FinFET / 첫 GAA~200–290전력 −25~35% 또는 성능 +10~15%2023–2026
2 nm급GAA 나노시트~300+전력 −25~30%2025–

표의 밀도는 논리 셀만으로 계산한 공칭값이다. 실제 칩은 SRAM, 아날로그, I/O가 섞여 있어 다이 전체 평균은 이보다 훨씬 낮다(3 nm급 실제 모바일 SoC가 ~130–160 MTr/mm² 수준). 특히 SRAM 셀은 5 nm → 3 nm에서 거의 줄지 않았다. 캐시를 늘리는 비용이 상대적으로 커졌다는 뜻이다.

FinFET에서 GAA로

트랜지스터를 작게 만들면 게이트가 채널을 장악하는 힘이 약해져, 꺼져 있어야 할 때 전류가 새는 단채널 효과가 커진다. 해법은 게이트가 채널을 더 많은 면에서 감싸게 하는 것이다. 평면 트랜지스터는 위 한 면, FinFET은 지느러미 모양 채널의 세 면, GAA(Gate-All-Around)는 얇은 나노시트를 네 면 모두 감싼다. 시트 폭을 셀마다 다르게 정할 수 있어, 고성능 셀에는 넓게, 저전력 셀에는 좁게 쓸 수 있다는 것도 GAA의 장점이다.

게이트 실리콘 기판 평면 (~28 nm까지) 게이트가 1면 제어 채널(주황)·절연막(노랑) 게이트 FinFET (22–3 nm급) 핀의 3면 제어 세로로 선 핀이 채널 GAA 나노시트 (3–2 nm급~) 시트의 4면 제어 시트 2–4장을 적층
그림 3-2. 채널 방향으로 자른 트랜지스터 단면(개략). 게이트(파랑)가 채널(주황)을 감싸는 면이 늘어날수록 꺼짐 상태의 누설이 줄고, 같은 누설에서 문턱 전압과 동작 전압을 낮출 수 있다.

면적이 곧 원가다

칩 원가의 출발점은 300 mm 웨이퍼 한 장의 가격이다. 최신 노드일수록 노광 단계(EUV)와 공정 단계가 늘어 웨이퍼 가격이 오른다. 대략 5 nm급이 1.5만 달러대, 3 nm급이 2만 달러 안팎, 2 nm급은 그 이상으로 알려져 있다(계약 조건에 따라 크게 다르다). 웨이퍼 한 장에서 나오는 다이 수와 그중 정상인 비율(수율)이 다이 원가를 정한다.

$$N_\text{die} \approx \frac{\pi (d/2)^2}{A} - \frac{\pi d}{\sqrt{2A}},\qquad Y = e^{-D_0 A},\qquad C_\text{die} = \frac{C_\text{wafer}}{N_\text{die}\,Y}$$
\(d\): 웨이퍼 지름(300 mm), \(A\): 다이 면적, 둘째 항은 가장자리에서 잘려 나가는 다이. \(D_0\): 단위 면적당 치명 결함 수(성숙 공정 ~0.05–0.1 /cm², 초기 공정 0.2 /cm² 이상). 포아송 수율 모델은 큰 다이에 보수적이며, 실무에서는 결함 군집을 반영한 Murphy·음이항 모델도 쓴다.
SIMULATOR

웨이퍼, 결함, 그리고 다이 한 개의 값

웨이퍼당 다이—
양품(이번 웨이퍼)—
수율 (모델)—
양품 다이 원가—
해볼 것: 면적을 120 → 240 mm²로 두 배 늘려 보자. 다이 수는 절반 이하가 되고, 수율도 떨어져 원가는 두 배를 훌쩍 넘는다. 큰 다이가 이중으로 비싼 이유다. 패키징·테스트 비용(수 달러~)은 별도다.

그래서 SoC 설계팀은 mm² 단위로 면적을 다툰다. GPU 코어 하나를 더 넣을지, SLC를 4 MB 늘릴지, 모뎀을 온다이로 넣을지가 모두 원가 계산서에 올라간다. 플래그십 AP는 폰 재료비(BOM)에서 디스플레이와 함께 가장 비싼 부품 중 하나로, 대략 BOM의 15~25%로 추정된다.

동적 전력과 DVFS: 왜 전력은 주파수의 세제곱인가

CMOS 논리 게이트가 0에서 1로 바뀔 때마다 출력에 달린 배선과 다음 게이트의 정전 용량 \(C\)를 \(V\)까지 충전하고, 1에서 0으로 바뀔 때 방전한다. 한 번 충방전할 때 전원에서 꺼내 열로 버리는 에너지가 \(CV^2\)이다. 이것이 초당 \(\alpha f\)번 일어나면:

$$P_\text{dyn} = \alpha\, C\, V^2 f, \qquad P_\text{leak} = V\, I_\text{leak}(V, T)$$
\(\alpha\): 활동률(클럭당 실제로 바뀌는 노드 비율, 0.05–0.3), \(C\): 스위칭 정전 용량, \(V\): 공급 전압, \(f\): 클럭 주파수. 누설 전류는 온도가 오를수록 지수적으로 늘어 25 °C 오를 때마다 대략 두 배가 된다.

여기서 함정은 \(V\)와 \(f\)가 독립이 아니라는 점이다. 트랜지스터가 더 빨리 스위칭하려면 더 많은 전류가 필요하고, 그러려면 게이트 전압이 문턱 전압 \(V_{th}\)보다 충분히 높아야 한다. 즉 높은 클럭에는 높은 전압이 필요하다. 근사적으로 \(f \propto (V - V_{th})^{\beta}/V\) (\(\beta\) ≈ 1.3–1.5)이며, 문턱 전압보다 꽤 높은 영역에서는 \(V\)가 \(f\)에 거의 비례해 오른다. 그러면

$$V \propto f \;\Rightarrow\; P_\text{dyn} \propto V^2 f \propto f^3, \qquad E_\text{task} = P\cdot t \propto f^3 \cdot \frac{1}{f} = f^2$$

클럭을 20% 올리면 전력은 70% 늘고, 같은 일을 하는 데 드는 에너지도 44% 늘어난다. 반대로 최소 전압 \(V_\text{min}\)(SRAM이 안정적으로 동작하는 하한, 대략 0.5–0.6 V)에 닿은 뒤에는 전압을 더 내릴 수 없어 전력이 \(f\)에 비례해서만 줄고, 누설 전력은 그대로 남는다. 이 때문에 "가능한 한 느리게"가 늘 최선은 아니다. 일정 클럭 아래로는 일을 빨리 끝내고 잠드는 쪽(race-to-idle)이 유리해진다.

DVFS(Dynamic Voltage and Frequency Scaling)는 부하에 맞춰 이 전압-주파수 쌍(OPP, Operating Performance Point)을 수 ms 단위로 바꾸는 기법이다. 각 CPU 클러스터, GPU, NPU가 각자의 전압 레일과 OPP 표를 갖고, PMIC가 빠르게 전압을 바꿔 준다(6장).

SIMULATOR

전압-주파수 곡선과 전력

아래 그래프
필요 전압—
동적 / 누설—
성능/W (상대)—
에너지/작업 (상대)—
해볼 것: 클럭을 3.0 → 4.0 GHz로 올리면(성능 +33%) 전력은 두 배 넘게 뛴다. 온도를 100 °C로 올리면 누설이 커져 저클럭에서의 작업당 에너지 곡선이 위로 휜다. 에너지 최소점(최적 효율 클럭)이 생기는 것을 확인하자. 칩마다 Vth가 조금씩 달라 같은 클럭에 필요한 전압이 다르다. 이를 칩별로 측정해 OPP 표를 조정하는 것이 비닝이다.
전압이 1% 아까운 이유

\(P \propto V^2\)이므로 전압 1% 여유(가드밴드)는 동적 전력 2%에 해당한다. 그래서 최신 SoC는 칩마다 측정한 전압 표(AVS, Adaptive Voltage Scaling)를 쓰고, 온칩 센서로 순간 전압 강하를 감지해 클럭을 잠깐 늦추는 회로(droop detector)로 가드밴드를 줄인다. 전원 무결성(4장)이 나쁘면 이 여유를 다시 늘려야 하므로 보드 설계가 곧 전력 효율이다.

이종 코어와 스케줄링: big.LITTLE

앞 절의 결론을 뒤집어 보면, 한 종류의 코어로는 넓은 성능 범위를 효율적으로 덮을 수 없다. 높은 클럭에 최적화된 큰 코어(넓은 실행 폭, 큰 캐시, 깊은 비순차 실행 창)는 낮은 클럭에서도 스위칭 정전 용량 \(C\)가 커서 전력을 많이 쓴다. 작은 코어는 최고 성능은 낮지만 저부하 구간에서 훨씬 효율적이다. 그래서 모바일 CPU는 크기가 다른 코어를 섞는다. 2011년 Arm이 제안한 big.LITTLE에서 출발해, 지금은 대개 세 단계(프라임 1–2 + 성능 3–5 + 효율 0–4)로 나뉜다.

코어 등급최대 클럭(대략)상대 IPC코어당 최대 전력주 용도
프라임(초고성능)3.8–4.3 GHz1.04–6 W앱 실행, 웹 페이지 로딩, 터치 응답 버스트
성능(중간)2.8–3.5 GHz~0.7–0.81.5–3 W게임 로직, 멀티스레드 작업
효율(소형)1.8–2.2 GHz~0.35–0.50.2–0.5 W백그라운드 동기화, 음악, 대기 중 작업

운영체제 스케줄러(리눅스의 EAS(Energy Aware Scheduling))는 각 코어의 전력 모델을 알고 있어서, 작업의 "필요 성능"(최근 부하로 추정한 utilization)을 보고 그 성능을 가장 적은 에너지로 낼 수 있는 코어와 클럭을 고른다. 아래 시뮬레이터 위쪽은 세 종류 코어의 성능-전력 곡선이고, 아래쪽은 짧은 사용 시나리오를 정책별로 배치한 결과다.

SIMULATOR

어느 코어에서 돌릴까: 성능-전력 곡선과 스케줄링

스케줄링 정책 (아래 타임라인)
프라임성능효율요구 성능 미달(버벅임)
이 부하에 최적인 코어—
그때 전력—
시나리오 에너지—
요구 미달 시간—
해볼 것: 요구 성능이 0.5 근처일 때 효율 코어의 전력이 프라임 코어의 몇 분의 1인지 보자. 0.9를 넘으면 효율 코어 곡선이 끝나 버린다(그 성능을 아예 낼 수 없다). "항상 프라임"은 버벅임이 없지만 에너지가 크고, "항상 효율"은 에너지는 작지만 앱 실행 버스트에서 요구 성능을 못 맞춘다.

두 곡선이 교차하는 점이 중요하다. 그 아래에서는 작은 코어가, 위에서는 큰 코어가 효율적이다. 효율 코어를 아예 빼는 설계(프라임+성능 코어만)도 등장했는데, 성능 코어를 낮은 클럭에서도 효율적으로 다듬고 저부하 작업을 DSP·센서 허브로 넘길 수 있다면 면적 대비 이득이 크다는 판단이다. 정답은 하나가 아니라 코어 설계, 공정, 소프트웨어 스케줄러의 조합이다.

체감 성능은 "첫 100 ms"가 결정한다

사용자가 화면을 터치하면 스케줄러는 부하가 쌓이기를 기다리지 않고 클럭과 코어를 미리 올린다(touch boost, uclamp). 앱 실행 직후 수백 ms만 프라임 코어를 최고 클럭으로 쓰고 바로 내려오는 것이 체감 속도와 배터리를 동시에 지키는 요령이다.

순간 성능 vs 지속 성능: 열 스로틀링

벤치마크 점수는 대개 시원한 칩이 처음 몇십 초 동안 내는 순간 성능이다. 게임을 30분 하면 이야기가 달라진다. 폰에는 팬이 없고, 열은 결국 손에 닿는 표면(화면과 뒷면)에서 대류와 복사로 공기 중에 버려진다. 사람 손이 불편해지지 않는 표면 온도는 대략 43~45 °C, 실온 25 °C에서 폰 전체가 계속 버릴 수 있는 열은 크기와 재질에 따라 대략 3~5 W다. 이 값이 SoC의 지속 전력 예산이다(디스플레이 등 다른 부품의 전력도 이 예산을 나눠 쓴다).

$$C_\text{th}\frac{dT_s}{dt} = P - \frac{T_s - T_a}{R_\text{sa}}, \qquad T_j = T_s + P\,R_\text{js}$$
\(T_s\): 표면(가장 뜨거운 곳) 온도, \(T_a\): 주변 온도, \(R_\text{sa}\): 표면→공기 열저항(폰 전체 ~4–6 K/W), \(C_\text{th}\): 폰의 열용량(~100–150 J/K, 무게 200 g 안팎), \(T_j\): 다이 접합 온도, \(R_\text{js}\): 다이→표면 열저항. 시정수 \(R_\text{sa}C_\text{th}\)는 수~10분이다.

폰의 열 시정수가 수 분이라는 것은, 처음 몇 분은 열용량에 빚을 내서 지속 예산보다 훨씬 큰 전력을 쓸 수 있다는 뜻이다. 열관리 소프트웨어는 표면 온도 추정값(여러 서미스터 + 모델)이 한계에 가까워지면 클럭 상한을 내린다. 이것이 열 스로틀링이다. 접합 온도(대략 95~105 °C 한계)는 짧은 버스트에서 먼저 걸리는 별도 제한이다.

SIMULATOR

30분 게임: 온도와 클럭의 시간축

방열
초기 성능—
지속 성능(마지막 10분)—
안정성(지속/초기)—
스로틀 시작—
해볼 것: 베이퍼 챔버를 빼면 핫스폿이 집중되어 같은 전력에서 표면 최고 온도가 높아지고 스로틀이 빨리 걸린다. 두꺼운 케이스는 열저항을 키운다. 요청 전력을 4 W로 낮추면 거의 스로틀이 걸리지 않는다. "최고 클럭을 조금 낮게 설계한 칩"이 지속 성능에서는 이기는 경우가 많다.

스로틀링이 성능을 깎는 정도는 전력-성능 곡선의 모양에 달려 있다. 전력이 \(f^3\)에 가깝다면 전력을 절반으로 줄여도 클럭은 \(0.5^{1/3}\) ≈ 79%로만 줄어든다. 그래서 9 W를 요구하던 칩이 4 W로 내려와도 성능은 70~80% 수준을 유지한다. 지속 성능을 결정하는 것은 최고 클럭이 아니라 3~5 W 근처에서의 효율(성능/W)이다. 열 확산 구조는 열 관리 장에서 자세히 다룬다.

메모리 대역폭과 캐시 계층

연산 유닛이 아무리 빨라도 데이터가 제때 오지 않으면 논다. 모바일 SoC의 주 메모리는 LPDDR(Low-Power DDR) DRAM이다. 현재 플래그십은 LPDDR5X(핀당 7.5~10.7 Gbps), 차세대는 LPDDR6다. LPDDR5X는 채널당 16비트 폭이고, 폰은 보통 4채널 = 64비트 버스를 쓴다.

$$BW_\text{peak} = \text{데이터율(MT/s)} \times \frac{\text{버스 폭(bit)}}{8}$$
예: 8,533 MT/s × 64 bit / 8 = 68.3 GB/s. 실제 유효 대역폭은 뱅크 충돌, 리프레시, 읽기/쓰기 전환 때문에 피크의 60–80%다.
SIMULATOR

LPDDR 대역폭 계산기: 누가 대역폭을 먹나

메모리 규격
채널 수(×16 bit)
피크 대역폭—
유효 대역폭—
요구 합계—
DRAM I/O 전력(추정)—
해볼 것: LLM을 켜면 다른 작업과 동시에 대역폭이 모자라는 것을 볼 수 있다. 메모리 트래픽은 공짜가 아니다. LPDDR5X 접근 에너지를 비트당 ~4–6 pJ로 잡으면 40 GB/s는 1.5 W 안팎으로, SoC 지속 예산의 3분의 1이다. 그래서 SLC 히트율을 올리고 데이터를 압축하는 기법(프레임 버퍼 압축 등)이 중요하다.

캐시 계층: 가까울수록 빠르고 작다

DRAM까지 가는 왕복은 100 ns가 넘는다. 4 GHz 코어에게는 400 사이클 이상 기다리는 시간이다. 그래서 코어 가까이에 작고 빠른 SRAM을 여러 단계로 둔다.

레지스터 L1 64–128 KB L2 1–4 MB (코어별·클러스터) L3 / SLC 8–24 MB (공유) LPDDR5X DRAM 8–16 GB ~0.25 ns~1 ns~3–5 ns~10–30 ns~100–150 ns ~0.1 pJ/B~0.5 pJ/B~1–2 pJ/B~30–50 pJ/B
그림 3-3. 메모리 계층(개략). 왼쪽은 접근 지연, 오른쪽은 바이트당 이동 에너지의 대략적 크기. 한 단계 내려갈 때마다 용량은 수~수십 배, 지연과 에너지는 수 배씩 커진다.
SIMULATOR

작업 세트 크기와 평균 접근 지연

접근 패턴
평균 지연—
4 GHz에서—
주로 머무는 계층—
해볼 것: 작업 세트를 키우면 지연이 계단처럼 오른다. 계단의 모서리가 각 캐시의 용량이다. SLC를 0으로 줄이면 L2를 벗어나자마자 DRAM으로 떨어진다. 순차 접근에서는 프리페처가 데이터를 미리 가져와 큰 작업 세트에서도 지연이 숨겨진다.

공식으로 쓰면 평균 메모리 접근 시간(AMAT)은 \(\text{AMAT} = t_{L1} + m_{L1}\,(t_{L2} + m_{L2}\,(t_{L3} + m_{L3}\,t_\text{DRAM}))\)이다(\(m\): 각 단계의 미스율). 큰 캐시는 미스율을 줄이지만 면적과 누설 전력을 먹고, 캐시가 커지면 접근 지연 자체도 늘어난다. 다이 평면도에서 SRAM이 큰 면적을 차지하는 것은 이 계산의 결과다.

NPU와 온디바이스 AI: TOPS와 정밀도

신경망 추론의 대부분은 행렬 곱, 즉 곱셈-누산(MAC, Multiply-Accumulate)의 반복이다. NPU는 MAC 유닛 수천~수만 개를 2차원 배열로 깔고, 가중치와 활성값을 온칩 SRAM에 붙잡아 둔 채 흘려보내는 전용 가속기다. 성능은 보통 TOPS(초당 조 단위 연산)로 표시한다.

$$\text{TOPS} = 2 \times N_\text{MAC} \times f \times 10^{-12}$$
MAC 한 번 = 곱셈 + 덧셈 = 2연산. 예: INT8 MAC 16,384개 × 1.4 GHz × 2 ≈ 46 TOPS. 같은 회로로 INT4를 처리하면 MAC 수가 사실상 두 배가 되어 공칭 TOPS도 두 배가 된다. 그래서 TOPS를 비교할 때는 어떤 정밀도인지, 희소성(0 건너뛰기) 가정이 들어갔는지 확인해야 한다.

정밀도를 낮추는 이유는 단순하다. 곱셈기의 면적과 에너지는 비트 수의 대략 제곱에 비례하고, 메모리 이동량은 비트 수에 비례한다. FP16 → INT8로 가면 연산 에너지는 수 분의 1, 가중치 크기는 절반, INT4는 다시 절반이다. 대신 양자화 오차가 생기므로, 학습 후 보정이나 양자화 인지 학습으로 정확도를 지킨다.

그런데 대형 언어 모델(LLM)의 토큰 생성(디코드)은 사정이 다르다. 토큰 하나를 만들 때마다 모델의 모든 가중치를 한 번씩 DRAM에서 읽어야 하는데, 가중치 하나당 연산은 2회뿐이다. 연산 강도(연산/바이트)가 너무 낮아 NPU의 TOPS가 아니라 메모리 대역폭이 속도를 정한다. 아래 루프라인(roofline) 그래프로 확인하자.

SIMULATOR

NPU 루프라인: 연산이 한계인가, 대역폭이 한계인가

가중치 정밀도
NPU 피크—
모델 가중치 크기—
디코드 속도 상한—
이때 NPU 활용률—
해볼 것: MAC 수를 두 배로 늘려도 LLM 디코드 점(빨강)은 움직이지 않는다. 대역폭 기울기 아래에 갇혀 있기 때문이다. 대신 INT4로 바꾸면 읽을 바이트가 줄어 토큰 속도가 두 배 가까이 오른다. 반면 사진 처리 CNN(초록)과 프롬프트 처리(prefill, 보라)는 연산 강도가 높아 NPU 피크에 닿는다. 8 GB 폰이라면 OS와 앱이 쓰고 남은 메모리도 모델 크기를 제한한다.
온디바이스 AI 작업특성병목
사진 분할·노이즈 제거 (CNN)작은 모델, 큰 활성값, 반복 사용연산(TOPS), 온칩 SRAM
음성 인식·키워드 감지상시 동작, 작은 모델대기 전력(DSP/NPU 저전력 모드)
LLM 프롬프트 처리(prefill)토큰 수백 개를 한꺼번에 행렬 곱연산(TOPS)
LLM 토큰 생성(decode)토큰 하나마다 전체 가중치 읽기메모리 대역폭, 메모리 용량
이미지 생성(디퓨전)수십 단계 반복, 큰 모델연산 + 지속 전력(열)

그래서 온디바이스 AI 경쟁은 TOPS만이 아니라 DRAM 용량(12~16 GB로 증가), 대역폭(LPDDR5X → LPDDR6), 저비트 양자화의 경쟁이기도 하다. 그리고 결국 같은 3~5 W 지속 예산 안에서 돌아야 한다.

모뎀: 통합할 것인가, 따로 둘 것인가

셀룰러 모뎀(기저대역 프로세서)은 4G/5G 신호의 변조·복조, 채널 부호화, MIMO 처리를 맡는다. 5G 모뎀은 그 자체로 DSP와 전용 가속기를 품은 큰 블록이며, RF 트랜시버(별도 칩)와 연결되어 안테나까지 이어진다(7장). 이 모뎀을 AP 다이 안에 넣을지(통합), 별도 칩으로 둘지(외장)는 오랜 설계 논쟁이다.

통합 모뎀 CPU·GPU 모뎀 DRAM 공유 AP 1개 (DRAM 공유) RF + 보드 면적 작음 · 칩 간 링크 없음 − 다이 커짐 · 공정이 모뎀에 과할 수 있음 외장 모뎀 AP 모뎀 칩+ 자체 메모리 PCIe RF + 최적 공정 각각 · 모뎀 교체·재사용 쉬움 − 보드 면적·전원 레일·링크 전력 추가
그림 3-4. 통합 모뎀과 외장 모뎀. 외장 모뎀은 칩 간 고속 링크(PCIe 등)와 별도 전원·메모리가 필요해 보드 위에 대략 1 cm² 이상의 공간이 더 든다.
관점통합 모뎀외장 모뎀
보드 면적작다모뎀 패키지 + 전원 부품 + 경우에 따라 별도 DRAM
전력칩 간 링크 없음, 대기 전력 관리 쉬움링크 구동 전력, 유휴 시 링크 관리 필요
공정모뎀도 최신(비싼) 공정으로모뎀은 한 세대 이전 공정으로 원가 절감 가능
열5G 고속 전송 시 AP와 열 예산 공유열원이 분산됨
제품 전략AP와 모뎀 세대를 함께 바꿈지역·통신사별로 모뎀만 바꾸거나 자체 모뎀 개발 가능

최근 경향은 보급형·중급형은 거의 모두 통합, 플래그십은 회사마다 다르다. 공정과 패키징 기술이 발달하면서 "한 패키지 안에 다이 두 개"(칩렛) 같은 중간 해법도 늘고 있다.

패키징: 다이를 보드에 붙이기

다이는 그 자체로 보드에 납땜할 수 없다. 다이의 범프 간격(수십 µm)과 보드의 패드 간격(0.3–0.4 mm)이 너무 다르기 때문이다. 그 사이를 이어 주는 것이 패키지다. PC CPU는 두꺼운 유기 기판의 FC-BGA를 쓰지만, 폰은 두께가 아까워 다른 방식을 쓴다.

기판형 PoP (FC 기판) DRAM 패키지 (다이 적층) AP 다이 기판 메인보드 총 높이 ~1.0–1.3 mm InFO-PoP (팬아웃) DRAM 패키지 AP 다이 RDL 메인보드 기판 대신 얇은 재배선층(RDL) · 몰드 관통 비아 공통점: DRAM을 AP 바로 위에 올려 배선 길이를 mm 이하로 → 고속·저전력, 보드 면적 절약 대가: 열이 DRAM을 지나 위로 가야 함 · 두 패키지의 휨(warpage)을 맞춰야 함
그림 3-5. 모바일 AP의 대표적 패키지(개략, 두께 과장). 팬아웃(InFO 등)은 두꺼운 유기 기판을 얇은 재배선층으로 바꿔 높이와 전기적 경로를 줄인다. 보드 쪽 이야기는 4장 PoP 절에서 3D로 분해해 본다.

PoP(Package on Package)는 모바일의 상징 같은 구조다. AP 패키지 가장자리에 솔더볼(또는 몰드 관통 비아)을 세우고 그 위에 DRAM 패키지를 얹는다. 신호 경로가 짧아 LPDDR의 고속 동작에 유리하고, 보드 면적은 칩 하나 분량이다. 대가는 열이다. AP의 열이 DRAM을 거쳐 위로 나가야 하고 DRAM은 85~95 °C를 넘으면 리프레시를 더 자주 해야 한다. 그래서 일부 설계는 DRAM을 옆에 나란히 두거나, 열 경로를 보드 쪽으로도 뽑는 시도를 한다.

설계 시 무엇이 중요한가

폰 제조사 입장에서 AP는 직접 설계하든 사 오든 폰 전체 설계의 출발점이다. 칩이 정해지면 PMIC와 전원 레일 구성, 메모리 종류, 보드 면적, 열 설계, 배터리 크기가 줄줄이 결정된다. 핵심 지표와 트레이드오프를 정리하면 다음과 같다.

지표왜 중요한가얽힌 부품
3–5 W에서의 성능/W지속 성능과 게임 배터리 시간을 동시에 결정. 최고 클럭보다 중요열(베이퍼 챔버), 배터리
순간 최대 전력PMIC 전류 용량, 배터리 순간 방전, 전원 무결성 설계를 결정PMIC, 배터리, 보드 PDN
저부하·대기 전력하루 사용 시간의 대부분을 차지하는 구간(스크롤, 대기, 음악)배터리
다이 면적·공정칩 원가, 공급 안정성BOM, 가격대
패키지 크기·높이보드 면적과 두께 예산메인보드, 두께
메모리 대역폭·용량AI, 카메라, 게임의 상한DRAM 원가, PoP 열
모뎀 통합 여부보드 면적, 전력, 출시 지역 전략RF, 안테나, 보드
SIMULATOR

칩 선택이 폰 전체에 미치는 영향

AP 등급
모뎀
방열
게임 성능(상대)—
표면 최고 온도—
게임 연속 시간—
AP 관련 원가(상대)—
교육용 단순 모델: 배터리 18 Wh(외장 모뎀이면 보드 면적 증가로 −0.5 Wh), 화면 등 나머지 소비 1.6 W, 주변 25 °C. 해볼 것: 전력 상한을 8 W로 올리면 성능은 조금 오르지만 표면 온도가 한계를 넘는다. 중급 칩을 같은 전력에 묶으면 성능 차이가 생각보다 작다. 효율 곡선의 아래쪽에서는 공정 차이보다 전력 상한이 더 큰 변수다.

흔한 실패 사례

핵심 정리

  1. SoC는 CPU·GPU·NPU·ISP·모뎀·DSP·코덱·메모리 컨트롤러·시스템 캐시를 한 다이에 모아 칩 간 통신 에너지를 없앤다. 자주 하는 일은 전용 블록이 수~수십 배 효율적으로 처리한다.
  2. 칩 원가는 웨이퍼 가격 ÷ (웨이퍼당 다이 수 × 수율)이다. 면적이 커지면 다이 수와 수율이 동시에 줄어 원가가 면적보다 빠르게 오른다.
  3. 동적 전력은 \(\alpha C V^2 f\)이고 높은 클럭에는 높은 전압이 필요하므로 전력은 대략 \(f^3\), 작업당 에너지는 \(f^2\)에 비례해 늘어난다. 최소 전압 아래에서는 누설 때문에 에너지 최적점이 생긴다.
  4. 이종 코어는 넓은 성능 범위를 각기 효율적인 코어로 나눠 덮고, 에너지 인지 스케줄러가 요구 성능을 가장 적은 에너지로 내는 코어를 고른다.
  5. 폰은 표면 온도 43–45 °C 한계 때문에 지속 전력이 3–5 W로 묶인다. 열용량 덕분에 처음 몇 분은 더 쓸 수 있지만 결국 스로틀링된다. 지속 성능은 그 전력에서의 성능/W가 결정한다.
  6. LPDDR5X 64비트 버스는 피크 60–85 GB/s 수준이며 모든 블록이 공유한다. 캐시 계층이 지연과 메모리 에너지를 줄인다.
  7. NPU의 TOPS는 정밀도(INT8/INT4)에 따라 달라지며, LLM 토큰 생성은 TOPS보다 메모리 대역폭과 용량에 묶인다.
  8. 칩 선택은 PMIC·보드 면적·배터리·열 설계·원가를 연쇄적으로 결정한다. 모뎀 통합, PoP 패키징 같은 결정은 면적·전력·열 사이의 트레이드오프다.

확인 퀴즈

1. 전압이 주파수에 비례해 오른다고 가정하면, 클럭을 10% 올릴 때 동적 전력은 대략 얼마나 늘어나는가?

\(P \propto V^2 f \propto f^3\)이므로 \(1.1^3 \approx 1.33\), 약 33% 증가한다.

2. 다이 면적이 두 배가 되면 양품 다이 원가는 어떻게 되는가?

웨이퍼당 다이 수가 절반 이하(가장자리 손실 증가)로 줄고, 수율 \(e^{-D_0A}\)도 함께 떨어지므로 원가는 두 배를 넘는다.

3. 스마트폰 SoC의 지속 전력 예산이 3–5 W 정도로 묶이는 가장 직접적인 이유는?

손에 닿는 표면이 43–45 °C를 넘지 않으면서 자연 대류·복사로 버릴 수 있는 열이 폰 크기에서 대략 그 수준이다. 접합 온도 한계는 짧은 버스트에서 먼저 걸리는 별도 제한이다.

4. 에너지 인지 스케줄러가 낮은 부하(요구 성능이 작음)의 작업을 효율 코어에 배치하는 이유로 가장 알맞은 것은?

큰 코어는 낮은 클럭에서도 C가 크고 누설이 많아, 낮은 성능 구간에서는 작은 코어의 성능-전력 곡선이 아래에 있다.

5. LPDDR5X 8,533 MT/s, 64비트 버스의 피크 대역폭은?

8,533 × 10⁶ × 64 / 8 ≈ 68.3 GB/s. 실제 유효 대역폭은 이의 60–80%다.

6. 30억 파라미터 LLM을 INT4로 양자화해 폰에서 돌린다. 토큰 생성 속도를 가장 직접적으로 올리는 방법은?

디코드 단계는 토큰마다 모든 가중치를 읽어야 하고 바이트당 연산이 적어 메모리 대역폭에 묶인다(루프라인의 기울기 영역).

7. 모뎀을 외장 칩으로 둘 때의 장점으로 알맞은 것은?

외장 모뎀은 보드 면적과 링크 전력이 늘지만, 공정 선택과 제품 전략의 유연성을 얻는다.

8. PoP 구조의 단점으로 가장 알맞은 것은?

DRAM이 AP 바로 위에 있어 배선은 짧고 면적은 작지만, 열 경로를 막고 DRAM 온도를 올린다.