AP(SoC): 폰의 두뇌
엄지손톱보다 작은 실리콘 한 조각에 CPU 여덟 개 남짓, 그래픽 프로세서, 인공지능 가속기, 카메라 영상 처리기, 그리고 많은 경우 셀룰러 모뎀까지 들어 있다. 이 칩을 애플리케이션 프로세서(AP, Application Processor) 또는 시스템 온 칩(SoC, System on Chip)이라 부른다. 이 장에서는 다이 위의 블록을 하나씩 짚어 보고, 그 블록들이 왜 3~5 W라는 작은 전력 예산 안에 갇혀 사는지, 그리고 그 제약이 폰 전체 설계를 어떻게 좌우하는지 시뮬레이터로 따라간다.
- SoC 다이 평면도에서 CPU·GPU·NPU·ISP·모뎀·메모리 컨트롤러·시스템 캐시의 역할과 대략적인 면적 비중을 설명한다.
- 웨이퍼당 다이 수와 결함 밀도로 칩 원가를 계산하고, 공정 노드(FinFET → GAA)의 의미를 이해한다.
- 동적 전력 \(P=\alpha C V^2 f\)와 DVFS로부터 전력이 주파수의 세제곱에 가깝게 늘어나는 이유를 유도한다.
- 이종 코어(big.LITTLE) 스케줄링, 순간 성능과 지속 성능, 열 스로틀링을 정량적으로 비교한다.
- LPDDR5X 대역폭, 캐시 계층의 지연, NPU의 TOPS와 정밀도가 온디바이스 AI 성능을 어떻게 제한하는지 계산한다.
- 칩 선택이 보드 면적·배터리·열 설계·원가에 미치는 영향을 트레이드오프로 판단한다.
SoC란 무엇인가: 한 칩 위의 컴퓨터
데스크톱 PC를 열면 CPU, 그래픽 카드, 메모리 모듈, 메인보드의 칩셋, 네트워크 카드가 따로따로 꽂혀 있다. 스마트폰에는 그럴 공간도, 전력도 없다. 칩과 칩 사이를 오가는 신호는 패키지 핀과 보드 배선을 거치면서 비트당 수 pJ의 에너지를 쓰지만, 같은 다이 안에서 오가면 그보다 한두 자릿수 적은 에너지로 끝난다. 그래서 폰은 컴퓨터 한 대 분량의 기능을 하나의 다이에 몰아넣는다. 이것이 SoC다.
SoC 안의 블록들은 온칩 인터커넥트(NoC, Network on Chip)라는 고속 도로망으로 연결되고, 모두가 같은 DRAM을 나눠 쓴다. 공유 메모리로 가는 길목에는 시스템 레벨 캐시(SLC, System Level Cache)가 있어 블록 사이의 데이터 교환을 DRAM까지 내려가지 않고 처리한다. 카메라 사진 한 장이 찍히는 과정만 봐도 ISP → NPU → GPU → 디스플레이 컨트롤러로 데이터가 넘어가는데, 이 모든 이동이 SLC와 DRAM을 거친다.
| 블록 | 주된 일 | 잘하는 것 | 대표 지표 |
|---|---|---|---|
| CPU | OS, 앱 로직, 브라우저, 게임 로직 | 분기 많은 범용 코드, 낮은 지연 | IPC × 클럭, 단일/멀티 코어 점수 |
| GPU | 3D 렌더링, UI 합성, 범용 병렬 연산 | 수천 개의 같은 연산을 동시에 | TFLOPS(FP32/FP16), fps/W |
| NPU | 신경망 추론(사진·음성·LLM) | 저정밀 행렬 곱 | TOPS(INT8/INT4), TOPS/W |
| ISP | 센서 원시 데이터 → 사진·영상 | 고정 파이프라인 픽셀 처리 | Gpixel/s, 동시 카메라 수 |
| 모뎀 | 4G/5G 기저대역 신호 처리 | 채널 부호·복호, MIMO 연산 | 최대 다운로드 속도, 대기 전류 |
| DSP / 센서 허브 | 오디오, 항상 켜진 센서·키워드 감지 | mW 이하의 상시 동작 | µW~mW 대기 전력 |
| 비디오 코덱 | H.265/AV1 인코딩·디코딩 | 전용 하드웨어로 수십 배 효율 | 8K30 / 4K120 등 처리 능력 |
핵심은 전용 하드웨어의 효율이다. 같은 4K 동영상 디코딩을 CPU가 소프트웨어로 하면 수 W가 들지만, 전용 디코더는 수백 mW 이하로 해낸다. 범용성을 포기한 만큼 에너지가 줄어든다. 그래서 SoC의 역사는 "자주 하는 일을 전용 블록으로 떼어 내는 역사"이기도 하다. 이미지 신호 처리는 ISP로, 신경망은 NPU로, 오디오와 센서 감시는 저전력 DSP로 옮겨 갔다. 카메라 ISP의 파이프라인은 자매편 SensorBook의 ISP 장에서 자세히 다룬다.
폰 안의 위치
AP는 메인보드 하판, 폰의 위쪽 3분의 1 지점에 있다. 바로 위에는 DRAM 패키지가 겹쳐 올라가 있고(PoP, 4장), 그 위로 열 인터페이스 물질과 베이퍼 챔버가 붙어 열을 화면 쪽 넓은 판으로 퍼뜨린다. 배터리와는 일부러 떨어져 있다. 배터리는 45 °C를 넘으면 수명이 빨리 줄기 때문이다. 아래 모델을 돌려 보고, 칩을 눌러 위치를 확인해 보자.
폰 속의 AP와 베이퍼 챔버
이 배치에는 이유가 있다. AP는 메모리·전원 IC와 짧게 연결되어야 하고(고속 신호와 큰 전류), 베이퍼 챔버의 한가운데에 있어야 하며, 손으로 쥐는 아래쪽보다 위쪽에 있어야 덜 뜨겁게 느껴진다. 반대로 카메라와 가까우면 ISP로 가는 MIPI 배선이 짧아진다. 보드 위의 위치 하나에도 신호, 열, 사용자 경험이 얽혀 있다.
다이 평면도: 블록별 역할
칩을 패키지에서 꺼내 위에서 찍으면 회색 사각형 조각보처럼 보인다. 각 조각이 하나의 기능 블록이다. 플래그십 SoC의 다이는 대략 100~150 mm², 손톱만 한 크기에 트랜지스터 150억~200억 개 이상이 들어간다. 아래 평면도는 공개된 다이 사진들의 공통 경향을 바탕으로 그린 개략도다(실제 배치는 제품마다 다르다). 블록을 눌러 보자.
클릭하는 SoC 다이 평면도
평면도에서 눈에 띄는 경향 몇 가지:
- GPU가 가장 크다. 그래픽은 병렬 연산 유닛을 늘리는 만큼 성능이 오르므로 면적을 아낌없이 쓴다. 대략 다이의 15~25%.
- CPU 코어 자체는 작다. 고성능 코어 하나가 L2 캐시를 포함해 2~4 mm² 수준이다. CPU 클러스터 면적의 절반 가까이는 캐시다.
- SRAM 캐시가 상당 부분을 차지한다. SLC, L2/L3를 합치면 다이의 10~15%가 SRAM이다. 문제는 SRAM이 최신 공정에서 잘 줄어들지 않는다는 점이다(4절).
- 가장자리는 I/O 차지다. LPDDR PHY, UFS·PCIe·MIPI·USB PHY는 아날로그 회로가 섞여 있어 공정이 바뀌어도 거의 줄지 않는다.
공정 노드: 트랜지스터를 더 작게, 그리고 그 대가
"3 nm 공정"이라는 이름은 더 이상 어떤 물리적 길이도 뜻하지 않는다. 게이트 길이나 금속 배선 간격은 이름보다 훨씬 크다(최소 금속 피치가 20 nm대). 노드 이름은 세대의 상표에 가깝고, 실질적인 지표는 트랜지스터 밀도(MTr/mm²), 같은 성능에서의 전력, 같은 전력에서의 성능이다.
| 노드(세대) | 소자 구조 | 논리 밀도(공칭, MTr/mm²) | 이전 세대 대비 (대략) | 모바일 적용 |
|---|---|---|---|---|
| 7 nm급 | FinFET | ~90–100 | — | 2018–2020 |
| 5 nm급 | FinFET | ~130–170 | 전력 −20~30% 또는 성능 +15% | 2020–2022 |
| 4 nm급 | FinFET | ~140–180 | 5 nm급의 개량 | 2022–2024 |
| 3 nm급 | FinFET / 첫 GAA | ~200–290 | 전력 −25~35% 또는 성능 +10~15% | 2023–2026 |
| 2 nm급 | GAA 나노시트 | ~300+ | 전력 −25~30% | 2025– |
표의 밀도는 논리 셀만으로 계산한 공칭값이다. 실제 칩은 SRAM, 아날로그, I/O가 섞여 있어 다이 전체 평균은 이보다 훨씬 낮다(3 nm급 실제 모바일 SoC가 ~130–160 MTr/mm² 수준). 특히 SRAM 셀은 5 nm → 3 nm에서 거의 줄지 않았다. 캐시를 늘리는 비용이 상대적으로 커졌다는 뜻이다.
FinFET에서 GAA로
트랜지스터를 작게 만들면 게이트가 채널을 장악하는 힘이 약해져, 꺼져 있어야 할 때 전류가 새는 단채널 효과가 커진다. 해법은 게이트가 채널을 더 많은 면에서 감싸게 하는 것이다. 평면 트랜지스터는 위 한 면, FinFET은 지느러미 모양 채널의 세 면, GAA(Gate-All-Around)는 얇은 나노시트를 네 면 모두 감싼다. 시트 폭을 셀마다 다르게 정할 수 있어, 고성능 셀에는 넓게, 저전력 셀에는 좁게 쓸 수 있다는 것도 GAA의 장점이다.
면적이 곧 원가다
칩 원가의 출발점은 300 mm 웨이퍼 한 장의 가격이다. 최신 노드일수록 노광 단계(EUV)와 공정 단계가 늘어 웨이퍼 가격이 오른다. 대략 5 nm급이 1.5만 달러대, 3 nm급이 2만 달러 안팎, 2 nm급은 그 이상으로 알려져 있다(계약 조건에 따라 크게 다르다). 웨이퍼 한 장에서 나오는 다이 수와 그중 정상인 비율(수율)이 다이 원가를 정한다.
웨이퍼, 결함, 그리고 다이 한 개의 값
그래서 SoC 설계팀은 mm² 단위로 면적을 다툰다. GPU 코어 하나를 더 넣을지, SLC를 4 MB 늘릴지, 모뎀을 온다이로 넣을지가 모두 원가 계산서에 올라간다. 플래그십 AP는 폰 재료비(BOM)에서 디스플레이와 함께 가장 비싼 부품 중 하나로, 대략 BOM의 15~25%로 추정된다.
동적 전력과 DVFS: 왜 전력은 주파수의 세제곱인가
CMOS 논리 게이트가 0에서 1로 바뀔 때마다 출력에 달린 배선과 다음 게이트의 정전 용량 \(C\)를 \(V\)까지 충전하고, 1에서 0으로 바뀔 때 방전한다. 한 번 충방전할 때 전원에서 꺼내 열로 버리는 에너지가 \(CV^2\)이다. 이것이 초당 \(\alpha f\)번 일어나면:
여기서 함정은 \(V\)와 \(f\)가 독립이 아니라는 점이다. 트랜지스터가 더 빨리 스위칭하려면 더 많은 전류가 필요하고, 그러려면 게이트 전압이 문턱 전압 \(V_{th}\)보다 충분히 높아야 한다. 즉 높은 클럭에는 높은 전압이 필요하다. 근사적으로 \(f \propto (V - V_{th})^{\beta}/V\) (\(\beta\) ≈ 1.3–1.5)이며, 문턱 전압보다 꽤 높은 영역에서는 \(V\)가 \(f\)에 거의 비례해 오른다. 그러면
클럭을 20% 올리면 전력은 70% 늘고, 같은 일을 하는 데 드는 에너지도 44% 늘어난다. 반대로 최소 전압 \(V_\text{min}\)(SRAM이 안정적으로 동작하는 하한, 대략 0.5–0.6 V)에 닿은 뒤에는 전압을 더 내릴 수 없어 전력이 \(f\)에 비례해서만 줄고, 누설 전력은 그대로 남는다. 이 때문에 "가능한 한 느리게"가 늘 최선은 아니다. 일정 클럭 아래로는 일을 빨리 끝내고 잠드는 쪽(race-to-idle)이 유리해진다.
DVFS(Dynamic Voltage and Frequency Scaling)는 부하에 맞춰 이 전압-주파수 쌍(OPP, Operating Performance Point)을 수 ms 단위로 바꾸는 기법이다. 각 CPU 클러스터, GPU, NPU가 각자의 전압 레일과 OPP 표를 갖고, PMIC가 빠르게 전압을 바꿔 준다(6장).
전압-주파수 곡선과 전력
\(P \propto V^2\)이므로 전압 1% 여유(가드밴드)는 동적 전력 2%에 해당한다. 그래서 최신 SoC는 칩마다 측정한 전압 표(AVS, Adaptive Voltage Scaling)를 쓰고, 온칩 센서로 순간 전압 강하를 감지해 클럭을 잠깐 늦추는 회로(droop detector)로 가드밴드를 줄인다. 전원 무결성(4장)이 나쁘면 이 여유를 다시 늘려야 하므로 보드 설계가 곧 전력 효율이다.
이종 코어와 스케줄링: big.LITTLE
앞 절의 결론을 뒤집어 보면, 한 종류의 코어로는 넓은 성능 범위를 효율적으로 덮을 수 없다. 높은 클럭에 최적화된 큰 코어(넓은 실행 폭, 큰 캐시, 깊은 비순차 실행 창)는 낮은 클럭에서도 스위칭 정전 용량 \(C\)가 커서 전력을 많이 쓴다. 작은 코어는 최고 성능은 낮지만 저부하 구간에서 훨씬 효율적이다. 그래서 모바일 CPU는 크기가 다른 코어를 섞는다. 2011년 Arm이 제안한 big.LITTLE에서 출발해, 지금은 대개 세 단계(프라임 1–2 + 성능 3–5 + 효율 0–4)로 나뉜다.
| 코어 등급 | 최대 클럭(대략) | 상대 IPC | 코어당 최대 전력 | 주 용도 |
|---|---|---|---|---|
| 프라임(초고성능) | 3.8–4.3 GHz | 1.0 | 4–6 W | 앱 실행, 웹 페이지 로딩, 터치 응답 버스트 |
| 성능(중간) | 2.8–3.5 GHz | ~0.7–0.8 | 1.5–3 W | 게임 로직, 멀티스레드 작업 |
| 효율(소형) | 1.8–2.2 GHz | ~0.35–0.5 | 0.2–0.5 W | 백그라운드 동기화, 음악, 대기 중 작업 |
운영체제 스케줄러(리눅스의 EAS(Energy Aware Scheduling))는 각 코어의 전력 모델을 알고 있어서, 작업의 "필요 성능"(최근 부하로 추정한 utilization)을 보고 그 성능을 가장 적은 에너지로 낼 수 있는 코어와 클럭을 고른다. 아래 시뮬레이터 위쪽은 세 종류 코어의 성능-전력 곡선이고, 아래쪽은 짧은 사용 시나리오를 정책별로 배치한 결과다.
어느 코어에서 돌릴까: 성능-전력 곡선과 스케줄링
두 곡선이 교차하는 점이 중요하다. 그 아래에서는 작은 코어가, 위에서는 큰 코어가 효율적이다. 효율 코어를 아예 빼는 설계(프라임+성능 코어만)도 등장했는데, 성능 코어를 낮은 클럭에서도 효율적으로 다듬고 저부하 작업을 DSP·센서 허브로 넘길 수 있다면 면적 대비 이득이 크다는 판단이다. 정답은 하나가 아니라 코어 설계, 공정, 소프트웨어 스케줄러의 조합이다.
사용자가 화면을 터치하면 스케줄러는 부하가 쌓이기를 기다리지 않고 클럭과 코어를 미리 올린다(touch boost, uclamp). 앱 실행 직후 수백 ms만 프라임 코어를 최고 클럭으로 쓰고 바로 내려오는 것이 체감 속도와 배터리를 동시에 지키는 요령이다.
순간 성능 vs 지속 성능: 열 스로틀링
벤치마크 점수는 대개 시원한 칩이 처음 몇십 초 동안 내는 순간 성능이다. 게임을 30분 하면 이야기가 달라진다. 폰에는 팬이 없고, 열은 결국 손에 닿는 표면(화면과 뒷면)에서 대류와 복사로 공기 중에 버려진다. 사람 손이 불편해지지 않는 표면 온도는 대략 43~45 °C, 실온 25 °C에서 폰 전체가 계속 버릴 수 있는 열은 크기와 재질에 따라 대략 3~5 W다. 이 값이 SoC의 지속 전력 예산이다(디스플레이 등 다른 부품의 전력도 이 예산을 나눠 쓴다).
폰의 열 시정수가 수 분이라는 것은, 처음 몇 분은 열용량에 빚을 내서 지속 예산보다 훨씬 큰 전력을 쓸 수 있다는 뜻이다. 열관리 소프트웨어는 표면 온도 추정값(여러 서미스터 + 모델)이 한계에 가까워지면 클럭 상한을 내린다. 이것이 열 스로틀링이다. 접합 온도(대략 95~105 °C 한계)는 짧은 버스트에서 먼저 걸리는 별도 제한이다.
30분 게임: 온도와 클럭의 시간축
스로틀링이 성능을 깎는 정도는 전력-성능 곡선의 모양에 달려 있다. 전력이 \(f^3\)에 가깝다면 전력을 절반으로 줄여도 클럭은 \(0.5^{1/3}\) ≈ 79%로만 줄어든다. 그래서 9 W를 요구하던 칩이 4 W로 내려와도 성능은 70~80% 수준을 유지한다. 지속 성능을 결정하는 것은 최고 클럭이 아니라 3~5 W 근처에서의 효율(성능/W)이다. 열 확산 구조는 열 관리 장에서 자세히 다룬다.
메모리 대역폭과 캐시 계층
연산 유닛이 아무리 빨라도 데이터가 제때 오지 않으면 논다. 모바일 SoC의 주 메모리는 LPDDR(Low-Power DDR) DRAM이다. 현재 플래그십은 LPDDR5X(핀당 7.5~10.7 Gbps), 차세대는 LPDDR6다. LPDDR5X는 채널당 16비트 폭이고, 폰은 보통 4채널 = 64비트 버스를 쓴다.
LPDDR 대역폭 계산기: 누가 대역폭을 먹나
캐시 계층: 가까울수록 빠르고 작다
DRAM까지 가는 왕복은 100 ns가 넘는다. 4 GHz 코어에게는 400 사이클 이상 기다리는 시간이다. 그래서 코어 가까이에 작고 빠른 SRAM을 여러 단계로 둔다.
작업 세트 크기와 평균 접근 지연
공식으로 쓰면 평균 메모리 접근 시간(AMAT)은 \(\text{AMAT} = t_{L1} + m_{L1}\,(t_{L2} + m_{L2}\,(t_{L3} + m_{L3}\,t_\text{DRAM}))\)이다(\(m\): 각 단계의 미스율). 큰 캐시는 미스율을 줄이지만 면적과 누설 전력을 먹고, 캐시가 커지면 접근 지연 자체도 늘어난다. 다이 평면도에서 SRAM이 큰 면적을 차지하는 것은 이 계산의 결과다.
NPU와 온디바이스 AI: TOPS와 정밀도
신경망 추론의 대부분은 행렬 곱, 즉 곱셈-누산(MAC, Multiply-Accumulate)의 반복이다. NPU는 MAC 유닛 수천~수만 개를 2차원 배열로 깔고, 가중치와 활성값을 온칩 SRAM에 붙잡아 둔 채 흘려보내는 전용 가속기다. 성능은 보통 TOPS(초당 조 단위 연산)로 표시한다.
정밀도를 낮추는 이유는 단순하다. 곱셈기의 면적과 에너지는 비트 수의 대략 제곱에 비례하고, 메모리 이동량은 비트 수에 비례한다. FP16 → INT8로 가면 연산 에너지는 수 분의 1, 가중치 크기는 절반, INT4는 다시 절반이다. 대신 양자화 오차가 생기므로, 학습 후 보정이나 양자화 인지 학습으로 정확도를 지킨다.
그런데 대형 언어 모델(LLM)의 토큰 생성(디코드)은 사정이 다르다. 토큰 하나를 만들 때마다 모델의 모든 가중치를 한 번씩 DRAM에서 읽어야 하는데, 가중치 하나당 연산은 2회뿐이다. 연산 강도(연산/바이트)가 너무 낮아 NPU의 TOPS가 아니라 메모리 대역폭이 속도를 정한다. 아래 루프라인(roofline) 그래프로 확인하자.
NPU 루프라인: 연산이 한계인가, 대역폭이 한계인가
| 온디바이스 AI 작업 | 특성 | 병목 |
|---|---|---|
| 사진 분할·노이즈 제거 (CNN) | 작은 모델, 큰 활성값, 반복 사용 | 연산(TOPS), 온칩 SRAM |
| 음성 인식·키워드 감지 | 상시 동작, 작은 모델 | 대기 전력(DSP/NPU 저전력 모드) |
| LLM 프롬프트 처리(prefill) | 토큰 수백 개를 한꺼번에 행렬 곱 | 연산(TOPS) |
| LLM 토큰 생성(decode) | 토큰 하나마다 전체 가중치 읽기 | 메모리 대역폭, 메모리 용량 |
| 이미지 생성(디퓨전) | 수십 단계 반복, 큰 모델 | 연산 + 지속 전력(열) |
그래서 온디바이스 AI 경쟁은 TOPS만이 아니라 DRAM 용량(12~16 GB로 증가), 대역폭(LPDDR5X → LPDDR6), 저비트 양자화의 경쟁이기도 하다. 그리고 결국 같은 3~5 W 지속 예산 안에서 돌아야 한다.
모뎀: 통합할 것인가, 따로 둘 것인가
셀룰러 모뎀(기저대역 프로세서)은 4G/5G 신호의 변조·복조, 채널 부호화, MIMO 처리를 맡는다. 5G 모뎀은 그 자체로 DSP와 전용 가속기를 품은 큰 블록이며, RF 트랜시버(별도 칩)와 연결되어 안테나까지 이어진다(7장). 이 모뎀을 AP 다이 안에 넣을지(통합), 별도 칩으로 둘지(외장)는 오랜 설계 논쟁이다.
| 관점 | 통합 모뎀 | 외장 모뎀 |
|---|---|---|
| 보드 면적 | 작다 | 모뎀 패키지 + 전원 부품 + 경우에 따라 별도 DRAM |
| 전력 | 칩 간 링크 없음, 대기 전력 관리 쉬움 | 링크 구동 전력, 유휴 시 링크 관리 필요 |
| 공정 | 모뎀도 최신(비싼) 공정으로 | 모뎀은 한 세대 이전 공정으로 원가 절감 가능 |
| 열 | 5G 고속 전송 시 AP와 열 예산 공유 | 열원이 분산됨 |
| 제품 전략 | AP와 모뎀 세대를 함께 바꿈 | 지역·통신사별로 모뎀만 바꾸거나 자체 모뎀 개발 가능 |
최근 경향은 보급형·중급형은 거의 모두 통합, 플래그십은 회사마다 다르다. 공정과 패키징 기술이 발달하면서 "한 패키지 안에 다이 두 개"(칩렛) 같은 중간 해법도 늘고 있다.
패키징: 다이를 보드에 붙이기
다이는 그 자체로 보드에 납땜할 수 없다. 다이의 범프 간격(수십 µm)과 보드의 패드 간격(0.3–0.4 mm)이 너무 다르기 때문이다. 그 사이를 이어 주는 것이 패키지다. PC CPU는 두꺼운 유기 기판의 FC-BGA를 쓰지만, 폰은 두께가 아까워 다른 방식을 쓴다.
PoP(Package on Package)는 모바일의 상징 같은 구조다. AP 패키지 가장자리에 솔더볼(또는 몰드 관통 비아)을 세우고 그 위에 DRAM 패키지를 얹는다. 신호 경로가 짧아 LPDDR의 고속 동작에 유리하고, 보드 면적은 칩 하나 분량이다. 대가는 열이다. AP의 열이 DRAM을 거쳐 위로 나가야 하고 DRAM은 85~95 °C를 넘으면 리프레시를 더 자주 해야 한다. 그래서 일부 설계는 DRAM을 옆에 나란히 두거나, 열 경로를 보드 쪽으로도 뽑는 시도를 한다.
설계 시 무엇이 중요한가
폰 제조사 입장에서 AP는 직접 설계하든 사 오든 폰 전체 설계의 출발점이다. 칩이 정해지면 PMIC와 전원 레일 구성, 메모리 종류, 보드 면적, 열 설계, 배터리 크기가 줄줄이 결정된다. 핵심 지표와 트레이드오프를 정리하면 다음과 같다.
| 지표 | 왜 중요한가 | 얽힌 부품 |
|---|---|---|
| 3–5 W에서의 성능/W | 지속 성능과 게임 배터리 시간을 동시에 결정. 최고 클럭보다 중요 | 열(베이퍼 챔버), 배터리 |
| 순간 최대 전력 | PMIC 전류 용량, 배터리 순간 방전, 전원 무결성 설계를 결정 | PMIC, 배터리, 보드 PDN |
| 저부하·대기 전력 | 하루 사용 시간의 대부분을 차지하는 구간(스크롤, 대기, 음악) | 배터리 |
| 다이 면적·공정 | 칩 원가, 공급 안정성 | BOM, 가격대 |
| 패키지 크기·높이 | 보드 면적과 두께 예산 | 메인보드, 두께 |
| 메모리 대역폭·용량 | AI, 카메라, 게임의 상한 | DRAM 원가, PoP 열 |
| 모뎀 통합 여부 | 보드 면적, 전력, 출시 지역 전략 | RF, 안테나, 보드 |
칩 선택이 폰 전체에 미치는 영향
흔한 실패 사례
- 벤치마크용 클럭에 맞춘 열 설계. 출시 리뷰에서 순간 점수는 좋지만 10분 뒤 성능이 반토막 나고 "발열 폰" 평판을 얻는다. 지속 예산을 먼저 정하고 클럭 테이블을 맞춰야 한다.
- PDN 여유 부족. 프라임 코어 버스트의 수 A급 전류 계단에서 전압이 순간적으로 떨어져 오동작하거나, 이를 막으려 전압 가드밴드를 올려 전력이 늘어난다(4장).
- 배터리 노화 무시. 오래된 배터리는 내부 저항이 커져 순간 최대 전류에서 전압이 크게 떨어진다. 피크 전력을 노화 상태에 맞춰 제한하지 않으면 갑작스러운 꺼짐이 생긴다(5장).
- 메모리 용량 과소. 출시 때는 충분했던 8 GB가 2~3년 뒤 온디바이스 AI 기능을 막는다. 폰의 수명 동안의 소프트웨어 요구를 예측해야 한다.
- AP를 열원 근처에 몰아넣기. 카메라 모듈·충전 회로·5G 모뎀 같은 다른 열원과 겹치면 같은 전력에서도 핫스폿이 생긴다. 보드 배치 단계에서 열원 분산을 고려한다.
핵심 정리
- SoC는 CPU·GPU·NPU·ISP·모뎀·DSP·코덱·메모리 컨트롤러·시스템 캐시를 한 다이에 모아 칩 간 통신 에너지를 없앤다. 자주 하는 일은 전용 블록이 수~수십 배 효율적으로 처리한다.
- 칩 원가는 웨이퍼 가격 ÷ (웨이퍼당 다이 수 × 수율)이다. 면적이 커지면 다이 수와 수율이 동시에 줄어 원가가 면적보다 빠르게 오른다.
- 동적 전력은 \(\alpha C V^2 f\)이고 높은 클럭에는 높은 전압이 필요하므로 전력은 대략 \(f^3\), 작업당 에너지는 \(f^2\)에 비례해 늘어난다. 최소 전압 아래에서는 누설 때문에 에너지 최적점이 생긴다.
- 이종 코어는 넓은 성능 범위를 각기 효율적인 코어로 나눠 덮고, 에너지 인지 스케줄러가 요구 성능을 가장 적은 에너지로 내는 코어를 고른다.
- 폰은 표면 온도 43–45 °C 한계 때문에 지속 전력이 3–5 W로 묶인다. 열용량 덕분에 처음 몇 분은 더 쓸 수 있지만 결국 스로틀링된다. 지속 성능은 그 전력에서의 성능/W가 결정한다.
- LPDDR5X 64비트 버스는 피크 60–85 GB/s 수준이며 모든 블록이 공유한다. 캐시 계층이 지연과 메모리 에너지를 줄인다.
- NPU의 TOPS는 정밀도(INT8/INT4)에 따라 달라지며, LLM 토큰 생성은 TOPS보다 메모리 대역폭과 용량에 묶인다.
- 칩 선택은 PMIC·보드 면적·배터리·열 설계·원가를 연쇄적으로 결정한다. 모뎀 통합, PoP 패키징 같은 결정은 면적·전력·열 사이의 트레이드오프다.
확인 퀴즈
1. 전압이 주파수에 비례해 오른다고 가정하면, 클럭을 10% 올릴 때 동적 전력은 대략 얼마나 늘어나는가?
2. 다이 면적이 두 배가 되면 양품 다이 원가는 어떻게 되는가?
3. 스마트폰 SoC의 지속 전력 예산이 3–5 W 정도로 묶이는 가장 직접적인 이유는?
4. 에너지 인지 스케줄러가 낮은 부하(요구 성능이 작음)의 작업을 효율 코어에 배치하는 이유로 가장 알맞은 것은?
5. LPDDR5X 8,533 MT/s, 64비트 버스의 피크 대역폭은?
6. 30억 파라미터 LLM을 INT4로 양자화해 폰에서 돌린다. 토큰 생성 속도를 가장 직접적으로 올리는 방법은?
7. 모뎀을 외장 칩으로 둘 때의 장점으로 알맞은 것은?
8. PoP 구조의 단점으로 가장 알맞은 것은?