[LLM Pipeline 6] 언어 모델 헤드(LM Head)와 디코딩 전략: Temperature, Top-k, Top-p
·
Programming/Dev notes
참조 사이트SKALA 4기 - LLM과 Transformer 아키텍처 (SK AX SKALA)The Curious Case of Neural Text Degeneration (Holtzman et al., 2019)Hugging Face - How to generate text: using different decoding strategies개요지난 [LLM Pipeline 5]에서는 어텐션을 거친 텐서들이 깊은 신경망 레이어를 지나며 안정적으로 순전파되도록 지탱해 주는 잔차 연결(Residual Connection)과 정규화(RMSNorm), 그리고 비선형 사실적 지식을 저장하고 변환하는 SwiGLU FFN 기반의 트랜스포머 블록 연산을 살펴보았다.트랜스포머 블록의 최종 레이어를 거쳐 출력된 결과물은 ..
[LLM Pipeline 5] 트랜스포머: 텐서의 심층 순전파 흐름: Residual Connection, LayerNorm, 그리고 FFN
·
Programming/Dev notes
참조 사이트SKALA 4기 - LLM과 Transformer 아키텍처 (SK AX SKALA)Attention Is All You Need (Vaswani et al., 2017)Deep Residual Learning for Image Recognition (He et al., 2015)Root Mean Square Normalization (Zhang et al., 2019)GLU Variants Improve Transformer (Shazeer, 2020)개요지난 [LLM Pipeline 4]에서는 단어 간 상호 연관성을 동적으로 계산하여 문맥 정보를 융합하는 셀프 어텐션(Self-Attention)과 멀티헤드 어텐션(Multi-Head Attention)의 핵심 원리를 살펴보았다.어텐션 연산을 ..
[LLM Pipeline 4] 트랜스포머: Q·K·V 수식 분해와 4대 어텐션(Attention) 메커니즘
·
Programming/Dev notes
참조 사이트SKALA 4기 - LLM과 Transformer 아키텍처 (SK AX SKALA)Attention Is All You Need (Vaswani et al., 2017)The Illustrated Transformer (Jay Alammar)개요지난 [LLM Pipeline 3]에서는 데이터로더로부터 전달받은 [Batch, Time] (이하 [B, T]) 정수 토큰 배치를 고차원 의미 공간의 밀집 좌표로 변환하고 어순 감각을 부여하는 토큰 임베딩(Token Embedding)과 위치 인코딩(Positional Encoding & RoPE)을 살펴보았다.임베딩과 위치 정보 결합을 거친 결과물은 단어의 고유 의미와 위치 정보가 결합된 [Batch, Time, Dimension] (이하 [B, T,..
[LLM Pipeline 3] 토큰 임베딩(Token Embedding)과 위치 인코딩(Positional Encoding & RoPE)
·
Programming/Dev notes
참조 사이트SKALA 4기 - LLM과 Transformer 아키텍처 (SK AX SKALA)Attention Is All You Need (Vaswani et al., 2017)RoFormer: Enhanced Transformer with Rotary Position Embedding (Su et al., 2021)개요지난 [LLM Pipeline 2]에서는 1차원 거대 토큰 스트림을 슬라이딩 윈도우와 스트라이드로 분절하고 배치로 묶어주는 데이터로더(DataLoader) 파이프라인을 살펴보았다.데이터로더를 거쳐 모델 최입력단에 들어오는 데이터는 [Batch, Time] (이하 [B, T]) 형태의 정수형 토큰 ID 배치 텐서(Token ID Matrix)이다. 하지만 신경망은 단순한 정수 번호를 직접..
[LLM Pipeline 2] Sliding Window와 Stride 기반 데이터로더(DataLoader) 파이프라인
·
Programming/Dev notes
참조 사이트SKALA 4기 - LLM과 Transformer 아키텍처 (SK AX SKALA)Attention Is All You Need (Vaswani et al., 2017)PyTorch Documentation - Datasets & DataLoaders개요 지난 [LLM Pipeline 1]에서는 텍스트를 최적의 부단어(Subword) 단위로 분절하고 정수 번호로 매핑하는 토크나이저(Tokenizer)와 BPE 알고리즘을 살펴보았다.토크나이저를 거친 최종 출력물은 [Batch, Time] (이하 [B, T]) 형태의 정수형 토큰 ID 배열(Token ID Matrix)이다. 하지만 신경망은 단순한 정수 번호를 직접 사칙연산하거나 의미적 좌표로 해석할 수 없다. 정수 ID 자체는 단어의 내재적 의..
[LLM Pipeline 1] 토크나이저(Tokenizer)와 BPE 알고리즘
·
Programming/Dev notes
참조 사이트SKALA 4기 - LLM과 Transformer 아키텍처 (SK AX SKALA)Hugging Face - Summary of the tokenizersOpenAI - tiktoken개요SKALA 4기 수업 중 'LLM과 Transformer 아키텍처' 과정을 학습하며 정리한 첫 번째 글이다.LLM(대형 언어 모델)이 자연어 텍스트를 처리하고 다음 단어를 생성하기까지의 전체 플로우 중 가장 첫 번째 관문이자 데이터 전처리의 핵심인 토크나이저(Tokenizer)와 BPE(Byte Pair Encoding) 알고리즘에 대해 깊이 있게 다루어 보았다. 1. 토크나이저(Tokenizer)란 무엇이며 왜 필요한가?① 기계는 문자를 직접 계산할 수 없다신경망(Neural Network) 모델은 본질적으..
[LLM Pipeline 0] LLM 전체 아키텍처와 5단계 데이터 파이프라인
·
Programming/Dev notes
참조 사이트SKALA 4기 - LLM과 Transformer 아키텍처 (SK AX SKALA)Attention Is All You Need (Vaswani et al., 2017)OpenAI GPT-4 Technical Report개요SKALA 4기 과정 중'LLM과 Transformer 아키텍처'를 학습하며, LLM(대형 언어 모델)의 전체 데이터 처리 흐름과 동작 원리를 단계별로 깊이 있게 탐구하는 [LLM Pipeline] 시리즈를 시작한다.본격적으로 각 세부 모듈(토크나이저, 임베딩, 어텐션 등)을 세세하게 들여다보기 전에, "우리가 자연어로 질문을 던졌을 때 신경망 내부에서 어떤 단계를 거쳐 다음 단어가 출력되는가?"에 대한 전체 아키텍처 조감도(Big Picture)와 5단계 데이터 파이프라인..
[python] 프로그래머스 2025 코드챌린지 1차 예선 : 홀짝노드
·
Algorithms/Programmers
링크: https://school.programmers.co.kr/learn/courses/30/lessons/388354 프로그래머스SW개발자를 위한 평가, 교육의 Total Solution을 제공하는 개발자 성장을 위한 베이스캠프programmers.co.kr 문제루트 노드가 설정되지 않은 1개 이상의 트리가 있습니다. 즉, 포레스트가 있습니다.모든 노드들은 서로 다른 번호를 가지고 있습니다.각 노드는 홀수 노드, 짝수 노드, 역홀수 노드, 역짝수 노드 중 하나입니다. 각 노드의 정의는 다음과 같으며, 0은 짝수입니다.홀수 노드노드의 번호가 홀수이며 자식 노드의 개수가 홀수인 노드입니다.짝수 노드노드의 번호가 짝수이며 자식 노드의 개수가 짝수인 노드입니다.역홀수 노드노드의 번호가 홀수이며 자식 노드..
[Dev notes] Spring Boot 실행 방식 비교 (bootRun, bootJar, java -jar, Docker)
·
Programming/Dev notes
참조 사이트Spring Boot Gradle Plugin Reference GuideSpring Boot Reference Documentation - Executable JarsGradle User Manual - Working with Archives 개요SKALA 4기 수업 중 Pure Java로 구현했던 간단한 로그인/회원가입 로직을 Spring Boot로 리팩토링하는 실습을 진행했다.수업 가이드에서는 IntelliJ와 같은 IDE 환경을 사용하지 않고, 터미널 환경에서 아래 명령어를 통해 빌드 및 실행하도록 안내되었다../gradlew clean bootJarjava -jar build/libs/loginauth-springboot-0.0.1-SNAPSHOT.jar하지만 개발 과정에서 매번 JA..
[코드트리후기] 코드트리 코딩테스트 독학 루틴
·
Algorithms/코드트리
https://www.codetree.ai/[알고리즘] 코드트리 7회차: 800일 넘는 스트릭을 이어온 비결, 코드트리 동기부여 시스템 활용기알고리즘 공부는 마라톤과 같다. 아무리 좋은 커리큘럼이 있어도 '꾸준함'이 뒷받침되지 않으면 실력 향상으로 이어지기 어렵다. 나는 평소에도 잔디를 심으며 알고리즘 문제 풀이 스트릭을 800일 넘게 유지해 오고 있을 만큼 꾸준함을 중요하게 생각한다. 하지만 때로는 지치거나 바쁜 일상에 치여 흐름이 깨질 뻔한 위기가 오곤 하는데, 이번 코드트리 청약 통장 챌린지를 진행하면서는 코드트리만의 정교한 동기부여 시스템 덕분에 슬럼프 없이 7회차까지 완주 페이스를 이어올 수 있었다.코드트리의 강력한 동기부여: 깃허브 연동과 학습 리마인더 알림톡내가 이번 챌린지에서 가장 유용하게..