1. 서문

대규모 언어 모델과 딥러닝 분야가 발전하면서, MoE(혼합 전문가 모델)는 조건부 계산 특성과 높은 확장성 덕분에 점차 연구 분야의 핵심 화제로 떠올랐습니다. 이 글은 MoE 모델의 기본 원리, 전체적인 아키텍처 설계, 그리고 핵심 기술들을 정리하는 데 목적이 있습니다. 또한 몇 가지 오픈소스 사례를 함께 살펴보며, 대표적인 MoE 모델이 구현 측면에서 어떤 방식으로 설계되는지와 주요 적용 시나리오를 간략히 소개합니다.

2. MoE란 무엇인가?

MoE를 본격적으로 이해하기에 앞서, 고전적인 Transformer 아키텍처를 먼저 되짚어 보겠습니다. 표준 Transformer에서 각 Encoder/Decoder 층은 멀티헤드 어텐션(Multi-Head Attention)과 완전연결 피드포워드 네트워크(Feed-Forward Network, 보통 FNN으로 약칭)를 포함합니다. 이 FNN은 모든 입력 token에 대해 동일한 선형 변환과 비선형 매핑을 수행하므로, 계산이 조밀하게(dense) 발생하고 자원 소모가 큽니다.

혼합 전문가 모델(Mixture of Experts, MoE) 기술은 FNN 위치에 ‘전문가(Expert)’ 메커니즘을 도입합니다. 즉, 대규모 피드포워드 네트워크를 여러 개의 서브 네트워크(전문가)로 분해하고, 게이팅 네트워크(라우터, Router)가 token을 동적으로 라우팅합니다. 구체적으로 게이팅 네트워크는 token의 특성(예: 단어 임베딩이나 어텐션 컨텍스트)에 따라 각 전문가에 대한 점수(score)를 계산하고, 점수가 가장 높은 K개의 전문가만 활성화하여 계산에 참여시킵니다. 나머지 전문가들은 유휴 상태로 남습니다. 이를 통해 모델 전체 파라미터 수는 수천억 규모까지 커질 수 있지만, 실제 한 번의 연산에서 활성화되는 파라미터(Activated Parameters)는 그중 일부에 불과하며, 전형적으로 5%~15% 정도에 머무릅니다. 그 결과 계산 비용과 GPU 메모리 점유가 크게 줄어듭니다.

  • Transformer와 MoE의 본질적 차이
    • 조밀 계산(dense computation): 표준 Transformer의 FNN은 모든 파라미터를 동일하게 사용합니다.
    • 조건부 계산(conditional computation): MoE는 일부 전문가만 계산에 참여시켜 희소(sparse) 활성화를 구현합니다.
  • 왜 이런 설계를 하는가? 주요 이유는 다음과 같습니다.
    • 확장성: 예산이 허용되는 범위에서 전문가 수를 늘려 모델 용량을 키울 수 있습니다.
    • 효율: 활성화되는 파라미터가 적어 FLOPs와 GPU 메모리 사용량을 즉시 낮출 수 있습니다.
    • 전문화: 서로 다른 전문가가 서로 다른 유형의 특징이나 작업에 특화되어 전체 성능을 높일 수 있습니다.
예를 들어, 도서관(Transformer)에 수많은 책(파라미터)이 있다고 가정해 보겠습니다. 어떤 정보를 찾으려면 모든 책을 뒤져야 합니다. 반면 MoE는 사서(게이팅 네트워크)가 질문에 맞는 몇 권의 책(전문가)만 골라 읽게 해 주는 방식과 비슷합니다. 시간을 절약하면서도 효율적입니다.

3. MoE의 핵심 구성 요소

MoE의 동작은 크게 두 모듈에 의존합니다.

  1. 전문가(Experts)
    • 각 전문가는 독립적인 피드포워드 네트워크 서브 레이어(보통 활성화 함수를 포함한 2층 선형 변환)입니다. 이는 모델 파라미터 공간의 부분집합에 대해 전문적으로 학습하는 것과 같습니다(관련 내용: 《Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer》).
    • 전문가 간 분할 전략으로는 파라미터 클러스터링(Balanced K‑Means), 공활성화 그래프 분할(Co‑activation Graph), 혹은 그라디언트 인지 분할(Gradient-aware Partitioning) 등이 사용될 수 있습니다. 목적은 각 전문가가 자신이 잘하는 영역에서 최적의 파라미터 구성을 갖도록 하는 데 있습니다.
  2. 게이팅 네트워크(Router)
    • 입력 x는 선형 매핑을 거쳐 전문가 점수 H(x)=xW_g 를 얻고, 학습 가능한 노이즈를 추가해 매끄럽게 만듭니다: H'(x)=H(x)+SoftPlus(xW_n)⊙𝒩(0,1) (이를 Noisy Gating이라고 합니다).
    • Top‑K 선택 전략을 사용합니다. 점수가 가장 높은 K개 전문가만 남기고, 정규화 후 G(x)=Softmax(KeepTopK(H'(x),K)) 를 출력하며, 입력을 선택된 K개 전문가에 할당합니다.
    • 또한 token이 각 전문가에 얼마나 배정되는지의 분산을 최소화하기 위해 보조 부하 손실 L_aux=λ·CV(n_1,…,n_E) 를 사용하여 ‘인기 전문가’ 과부하를 방지합니다.

4. MoE는 왜 이렇게 효율적인가?

1) 조건부 계산으로 FLOPs 감소

표준 Transformer의 FNN은 모든 입력 Token에 대해 동일한 계산을 수행하므로, 복잡도는 O(N·d^2) 수준입니다. 반면 MoE는 K개의 전문가만 활성화하므로 복잡도는 O(K·d^2)로 줄어듭니다. K가 N보다 훨씬 작다면, 계산량은 대략 N/K배에 가까운 수준으로 선형적으로 감소합니다.

2) 과매개변수화와 표현 능력

초대형 모델은 복잡한 패턴을 학습하기 위해 많은 파라미터가 필요하지만, 조밀하게(dense) 파라미터를 늘리면 연산 병목이 발생합니다. MoE는 희소 라우팅을 통해 훈련 과정에서 활성화 파라미터보다 몇 배 더 큰 전역 파라미터량(E·d^2)을 허용하여, 다양한 패턴을 포착하는 능력을 키울 수 있습니다.

3) 전문화된 분업과 분산 병렬 처리

각 전문가는 서브공간의 특징을 학습해 기능적으로 분업할 수 있습니다. 또한 전문가 병렬(Expert Parallelism)은 서로 다른 전문가를 서로 다른 장치에 배치하여, 백본 네트워크 동기화 비용을 줄입니다. Pipeline 병렬이나 Tensor 병렬과 결합하면 더 높은 처리량과 더 낮은 지연시간을 달성할 수 있습니다(관련 내용: 《GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding》).

4) 실험적 검증

  • GLaM 모델은 1.2조 파라미터 규모에서 8%만 활성화하고도 29개 NLP 태스크에서 175B 규모의 GPT‑3를 능가해, 조건부 계산의 장점을 보여주었습니다.
  • Switch Transformer는 Top‑1 라우팅 전략으로 처리량을 약 2배 가까이 높이면서도 성능 저하를 최소화했습니다.

5. MoE의 기술적 디테일

전통적인 대규모 신경망(예: Transformer)은 ‘전천후 선수’처럼 매번 데이터를 처리할 때 모든 파라미터를 동원해야 하므로 비용이 큽니다.

반면 MoE는 ‘필요할 때만 호출’(즉, 조건부 계산) 방식으로 일부 전문가만 계산에 참여시키며, 불필요한 자원 낭비를 줄입니다.

1) 희소 활성화와 활성화 파라미터

Transformer의 FFN 층은 이론상 모든 token에 대해 전체 계산을 수행하지만, 실제로는 일부 뉴런만 활성화되는 경향이 관측됩니다(《MoEfication: Transformer Feed-forward Layers are Mixtures of Experts》). MoE는 이 점에 착안해, 큰 FNN을 E개의 전문가로 분할하고 각 token에 대해 K개의 전문가만 선택합니다.

지표설명
총 파라미터 수수십억~수천억 규모까지 가능
활성화 파라미터 수총 파라미터 수 × (K/E) 비율에 해당하며, 보통 5%~15% 수준
장점FLOPs 및 GPU 메모리 사용량이 비례하여 감소, 학습/추론 효율이 크게 향상

2) 게이팅 네트워크와 라우팅 전략의 동작

전문가 선택은 게이팅 네트워크(Router) 가 담당하며, 흔히 다음과 같이 구현됩니다.

  1. 선형 매핑: H(x)=xW_g
  2. 노이즈 주입: H'(x)=H(x)+g·StandardNormal()⊙SoftPlus(H(x)) (Noisy Gating)
  3. Top‑K 선택: G(x)=Softmax(KeepTopK(H'(x),K))
  • Top‑2 vs. Top‑1: GShard는 Top‑2를 사용해 출력을 혼합하여 견고함을 높였고, Switch Transformer는 Top‑1을 사용해 통신 복잡도를 단순화했습니다(《GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding》, 《Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity》).
  • 계층적 희소성: Qwen3 계열 모델은 네트워크 깊이에 따라 K 값을 동적으로 조정해 더 세밀한 조건부 계산을 수행합니다.

3) 부하 균형과 보조 손실

일부 전문가는 점수가 높아 계속 활성화되어 과부하가 발생할 수 있습니다. 이를 방지하기 위해 MoE는 보조 부하 손실(Auxiliary Load Loss) 을 도입하며, 보통 전문가가 처리한 token 수의 변이계수(Coefficient of Variation)로 정의됩니다.

L_aux = λ · CV(n₁, n₂, …, n_E) 여기서 nᵢ는 현재 배치에서 i번째 전문가가 처리한 token 수이며, λ는 균형 가중치입니다.

이 손실은 사전학습 과정에서 메인 손실과 함께 최적화되어, 각 전문가의 활용률이 대체로 균등하게 유지되도록 합니다(GShard 및 transformers 라이브러리의 aux_loss 구현 참고).

6. 대표적인 MoE 모델 사례

시간 순으로 몇 가지 대표적인 오픈소스 MoE 모델을 소개합니다.

1) Sparsely-Gated Mixture-of-Experts Layer (2017)

Google Brain 팀의 Shazeer 등이 제안한 기법(논문 《Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer》)으로, FFN 층에 게이팅 라우팅을 처음 도입했습니다. 학습 가능한 노이즈 Top‑K 게이팅(Noisy Top‑K Gating)을 사용했고, 보조 부하 손실(Auxiliary Load Loss)로 전문가 간 부하를 균형 있게 만드는 방법을 제안했습니다. 이는 조건부 계산(Conditional Computation)의 기반을 마련해, 대규모 파라미터 환경에서 희소 활성화와 효율적 학습을 가능하게 했습니다.

2) GShard (2020)

Google Research 팀의 Lepikhin 등이 제안한 논문 《GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding》에서 제시되었습니다. Transformer 각 FFN 층에 Top‑2 게이팅 MoE 구조를 배치하고, 전문가 용량(capacity) 개념을 도입했으며, 여러 머신/여러 GPU에 전문가를 자동으로 배치할 수 있습니다. 또한 랜덤 라우팅과 부하 균형 전략을 사용하여, 머신 간 전문가 병렬(Expert Parallelism)과 자동 파라미터 샤딩을 구현했습니다. 6,000억 파라미터급 모델 학습/추론을 지원하며 확장성을 크게 향상했습니다.

3) Switch Transformer (2021)

Google Research 팀의 Fedus 등이 제안한 논문 《Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity》에서 소개되었습니다. 각 token이 단 하나의 전문가만 방문하는 Top‑1 게이팅 전략을 제안해 통신 복잡도를 줄였고, 용량 계수(Capacity Factor)로 전문가 부하를 조절했으며, bfloat16 학습도 지원합니다. 통신 비용과 처리량 사이의 균형을 잘 맞춰, 1조 파라미터 규모까지 모델을 확장하면서도 높은 효율을 유지했습니다.

4) GLaM (2021)

Google Research 팀의 Du 등이 제안한 논문 《GLaM: Efficient Scaling of Language Models with Mixture-of-Experts》에서 소개되었습니다. 64개의 전문가를 두고 각 층에서 2개를 활성화하며, Mixture-of-Modality 라우팅으로 서로 다른 모달리티(텍스트/코드 등)를 특정 전문가로 보낼 수 있습니다. 활성화되는 파라미터는 전체의 8%에 불과합니다. 희소 활성화가 성능을 유지하는 것을 넘어, 멀티모달·멀티태스크 학습 효과까지 높일 수 있음을 보여주었습니다.

5) DeepSeek-MoE (2024)

DeepSeek AI 팀의 논문 《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》에서 소개되었습니다. 세밀한 전문가 분할(Fine-Grained Expert Segmentation)로 FFN을 더 작은 전문가들로 나누고, 공유 전문가(Shared Experts)로 공통 지식을 처리합니다. 각 token은 6개의 전문가를 활성화합니다. 전문화 향상과 중복 정보 감소에 대한 새로운 아이디어를 제공하며, 다중 전문가 융합 및 공유 메커니즘의 잠재력을 보여줍니다.

6) LLaMA-MoE (2024)

Sys4NLP 팀이 Meta LLaMA2 기반으로 개발한 모델로, 《LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training》를 참고할 수 있습니다. 랜덤/클러스터링/공활성화 그래프 등 다양한 전문가 분할 방법을 지원하며, Top‑K 노이즈 게이팅과 Switch 단일 전문가 게이팅을 제공합니다. 전문가 파라미터 설계도 더 경량화되는 추세입니다. 이는 중간 규모 혹은 소규모 파라미터 모델에서도 MoE를 적용할 수 있는 경로를 보여줍니다.

7) Qwen3-235B-A22B (2025)

알리바바 통의 천문(Qwen) 팀이 공개한 모델로, 공식 문서와 오픈소스 저장소를 참고할 수 있습니다. 총 파라미터는 2,350억, 전문가 128개를 두며, 계층적 희소 스케줄링으로 활성화 전문가 수를 동적으로 조절합니다. 각 token은 8개의 전문가를 활성화합니다. 기본 32K 컨텍스트 길이를 지원하며, YaRN 기술로 128K까지 확장할 수 있습니다. 또한 GQA 어텐션과 비동기 오프로딩(Asynchronous Offloading) 등으로 병렬 계산 효율을 최적화합니다. 계층적 스케줄링과 동적 활성화를 결합해, 초장문 텍스트와 고처리량 시나리오에서의 추론 비용을 더욱 낮추는 해결책을 제시합니다.

7. MoE의 적용 시나리오와 한계

실제 배포 환경에서는 MoE와 기존 Transformer가 각각 장점을 가지며, 자원과 요구사항에 따라 선택해야 합니다.

  • 다중 머신·고처리량 환경에는 MoE가 더 적합
    • 전문가 병렬: MoE의 전문가 서브 네트워크를 여러 머신/여러 장치로 분산해 병렬 실행할 수 있습니다. 각 머신은 일부 전문가만 담당하므로, 전체 모델 복제에 따른 GPU 메모리 부담이 줄어듭니다.
    • 조건부 라우팅: 게이팅 네트워크는 필요한 라우팅 정보만 전달하면 되므로, 모든 파라미터를 동기화하는 비용이 필요하지 않습니다. 그 결과 통신 오버헤드가 크게 감소하고 처리량이 증가합니다.
    • 탄력적 확장: 클러스터 확장 시 전문가를 추가하거나 재배치하면 되며, 모델 용량과 하드웨어 자원이 높은 수준으로 분리됩니다.
  • 단일 머신·저메모리·저처리량 요구에는 조밀 Transformer가 더 적합
    • 라우팅/스케줄링 오버헤드: 단일 머신 환경에서는 게이팅 계산, 전문가 상태 관리, 장치 간 통신 등의 오버헤드 비중이 커져 오히려 지연시간이 늘고 구현이 복잡해질 수 있습니다.
    • 배포가 단순: 표준 Transformer는 추가적인 부하 균형이나 라우팅 전략이 필요 없고, 코드/프레임워크도 성숙해 있어 모델 크기와 성능을 더 쉽게 트레이드오프할 수 있습니다.
    • 자원 효율 최적화: GPU 메모리와 연산 자원이 제한된 환경에서는 프루닝, 양자화, 지식 증류 등으로 조밀 모델을 최적화해 더 높은 가성비를 얻을 수 있습니다.

8. 결론 및 전망

MoE 발전 흐름을 살펴보면, 초기의 ‘노이즈 Top‑K 게이팅’에서 ‘머신 간 자동 샤딩’, 그리고 ‘단일 전문가 라우팅’, ‘다중 모달 전문가’, ‘세밀한 분할’, ‘계층적 희소 스케줄링’ 등 다양한 혁신으로 이어져 왔음을 확인할 수 있습니다. 각 세대의 기술은 ‘더 큰 모델 용량’과 ‘더 적은 계산 자원’ 사이의 균형점을 찾기 위해 진화해 왔습니다. MoE의 핵심은 조건부 계산(Conditional Computation)이며, 이는 높은 확장성과 효율을 제공하는 동시에 라우팅, 부하 균형, 통신 등에서 새로운 도전과제도 동반합니다.

MoE는 딥러닝 대규모 모델 분야의 중요한 분기로 자리잡았습니다. 그 설계 원리와 적용 시나리오를 이해하는 것은 차세대 고효율 지능 시스템을 발전시키는 데 매우 중요합니다.


일부 용어

Token:모델이 텍스트 처리를 수행할 때 사용하는 최소 단위입니다. 예를 들어 한 글자(한자/한글) 또는 한 개의 영어 단어가 될 수 있습니다.

参数(Parameters):신경망에서 학습 가능한 수치로, 레고 블록 개수에 비유할 수 있습니다. 파라미터가 많을수록 모델은 더 복잡해집니다.

条件计算(Conditional Computation):입력 내용에 따라 모델의 일부 전문가만 활성화해 계산하는 메커니즘입니다. 모든 사람이 참여하는 회의를 여는 대신, 해당 분야의 선생님(전문가)에게만 질문하는 것과 같습니다.

专家(Expert):MoE 모델 내부의 서브 네트워크입니다. 각 전문가는 특정 유형의 데이터나 특징을 처리하는 역할을 담당합니다.

门控网络(Router/Gating Network):각 입력 token을 어떤 전문가에게 보낼지 결정하는 모듈입니다. 업무를 배분하는 스케줄러에 비유할 수 있습니다.

激活参数(Activated Parameters):한 번의 계산에서 실제로 연산에 참여하는 파라미터 수를 의미하며, 보통 전체 파라미터 수보다 훨씬 작습니다.

稀疏激活(Sparse Activation):매 계산마다 일부 전문가 또는 파라미터만 활성화되는 것을 뜻하며, 계산 자원을 절약할 수 있습니다.

稠密模型(Dense Model):전통적인 모델로, 매 계산 때 모든 파라미터를 호출해 연산합니다. 모든 구성원이 회의에 참여하는 것과 같습니다.

FLOPs(浮点运算次数):모델의 계산량을 나타내는 지표입니다. 값이 낮을수록 계산이 더 효율적입니다.

显存(GPU Memory):GPU에서 모델 파라미터 및 중간 결과를 저장하는 공간입니다. 사용량이 낮을수록 대형 모델 배포가 쉬워집니다.

前馈网络(Feed-Forward Network,FFN):Transformer 아키텍처의 신경망 층으로, 입력 데이터를 비선형 변환하는 역할을 합니다.

多头注意力(Multi-Head Attention):Transformer의 메커니즘으로, 입력의 서로 다른 부분에 동시에 주의를 기울일 수 있게 합니다.

Top-K选择/路由(Top-K Routing):게이팅 네트워크가 점수가 가장 높은 K개 전문가를 선택해 계산에 참여시키는 전략입니다.

Noisy Gating(噪声门控):전문가 선택 과정에 노이즈를 주입해, 모델의 견고함과 부하 균형을 개선하는 기법입니다.

辅助负载损失(Auxiliary Load Loss):전문가들의 작업량을 균형 있게 만들기 위한 손실 함수입니다. 인기 전문가의 과도한 바쁨을 방지합니다.

变异系数(Coefficient of Variation,CV):전문가 부하 균형 정도를 나타내는 통계량입니다. CV가 작을수록 더 균등하게 분배된 것입니다.

专家并行(Expert Parallelism):서로 다른 전문가를 여러 머신에 분산 배치해 각 머신이 자신이 담당하는 서브 네트워크만 실행하는 방식입니다.

分布式并行(Distributed Parallelism):모델 또는 데이터를 여러 장치에 분산하여 동시에 계산하는 방식으로, 효율 향상을 목적으로 합니다.

Pipeline并行:모델의 각 부분을 서로 다른 장치에 배치해, 파이프라인처럼 단계적으로 처리하는 병렬화 방식입니다.

Tensor并行:단일 신경망 층의 연산을 여러 장치로 분산해 병렬 수행하는 방식입니다.

容量因子(Capacity Factor):각 전문가가 한 번의 forward 계산에서 처리할 수 있는 token 최대 수를 제어하는 파라미터로, 과부하를 방지합니다.

专家容量(Expert Capacity):각 전문가가 한 번의 forward 계산에서 처리 가능한 token 수의 최대치를 의미합니다.

细粒度专家切分(Fine-Grained Expert Segmentation):피드포워드 네트워크를 더 많고 더 작은 전문가들로 세분화하는 기법으로, 전문화를 높입니다.

共享专家(Shared Experts):여러 작업/입력에서 공유되는 전문가로, 공통 지식을 처리합니다.

分层稀疏(Hierarchical Sparsity):네트워크의 서로 다른 계층에서 활성화 전문가 수를 동적으로 조정해 더 세밀한 조건부 계산을 수행하는 방법입니다.

GQA(Grouped Query Attention):추론 효율을 높이는 고효율 어텐션 메커니즘입니다.

异步卸载(Asynchronous Offloading):일부 계산 작업이나 데이터를 비동기적으로 다른 장치로 옮겨, 자원 사용을 최적화하는 기법입니다.

Mixture-of-Modality:입력 모달리티(텍스트, 코드 등)에 따라 서로 다른 전문가에게 분배해 처리하는 메커니즘입니다.

剪枝(Pruning):중요하지 않은 파라미터를 제거해 모델 크기와 계산량을 줄이는 기법입니다.

量化(Quantization):더 낮은 정밀도의 데이터 타입으로 파라미터 저장·계산을 수행해 자원 소모를 줄이는 기법입니다.

蒸馏(Distillation):대형 모델의 지식을 소형 모델에 전이시키는 학습 기법입니다.

路由(Routing):게이팅 네트워크가 입력 token을 적절한 전문가로 선택·분배하는 전체 과정입니다.

主损失(Main Loss):모델 학습에서의 주요 최적화 목표(예: 교차 엔트로피 손실)입니다.

辅助损失(Auxiliary Loss):부하 균형 등 특정 특성을 개선하기 위한 보조 최적화 목표입니다.

专家切分(Expert Partitioning):대형 네트워크를 여러 전문가로 나누는 과정으로, 클러스터링/그래프 분할 등으로 구현할 수 있습니다.

共激活图分割(Co-activation Graph Partitioning):뉴런 활성화 상관관계에 기반해 전문가를 분할하는 방법입니다.

梯度感知分割(Gradient-aware Partitioning):그라디언트 정보를 활용해 전문가를 분할하는 방법입니다.

专家路由(Expert Routing):입력을 적절한 전문가에게 라우팅하는 과정을 의미합니다.

Top-1/Top-2 路由:각 token을 점수가 가장 높은 1개 또는 2개 전문가에만 보내는 전략입니다.

容量(Capacity):각 전문가가 한 번의 forward 계산에서 처리할 수 있는 token의 최대량을 의미합니다.

激活比例(Activation Ratio):각 계산에서 활성화된 파라미터가 전체 파라미터에서 차지하는 비율입니다.

吞吐率(Throughput):단위 시간당 모델이 처리할 수 있는 데이터량입니다. 높을수록 효율이 좋습니다.

延迟(Latency):모델이 한 번의 입력을 처리하는 데 걸리는 시간입니다. 낮을수록 좋습니다.

自动分片(Automatic Sharding):모델 파라미터를 여러 장치에 자동으로 분배해 병렬 계산 효율을 높이는 기법입니다.

bfloat16:대형 모델 학습에서 자주 쓰이는 저정밀 부동소수점 형식으로, GPU 메모리를 절약합니다.

YaRN技术:컨텍스트 길이를 확장하는 기술로, 장문 텍스트 처리 능력을 향상합니다.