8. AI/ML
TL;DR
이 글은 2025년도 봄학기 KAIST 전산학부 대학원 면접을 준비하며, 면접 참고자료(AI/ML)에 대한 대답을 정리한 글입니다.
문제에 대한 정답이 아니며, 제가 공부하며 생각한 바들을 정리한 것입니다.
후에 같은 목표로 면접을 준비하는 학우분들께 도움이 되기를 바랍니다.
이 풀이노트는 질문만 본 상태에서 답변한 내용에 대한 채점, 그리고 이 면접을 준비하며 이전에 한번 LLM과 함께 작성해본 답안이 이어져 있습니다.
문제
Problem Solving
A* 알고리즘에서는 goal까지의 거리를 예측하는 휴리스틱 함수가 쓰인다. 이 휴리스틱 함수는 어떤 조건을 만족해야 하는가?
f(x) = g(x) + h(x)에서 h(x)는 휴리스틱 함수입니다. 이를 h(x)가 0일 때 다익스트라 알고리즘이 되며, 아날로그 환경에서의 보정을 위해 휴리스틱 함수가 쓰입니다. 대표적인 예시로 택시거리가 있습니다.
admissible: h(x)는 실제 최단거리보다 작거나 같아야 합니다. consistent: h(x) <= c(x, y) + h(y) (y는 x의 이웃 노드) 이 두 조건을 만족해야 A* 알고리즘이 최적해를 보장합니다.
Machine Learning
K-Means 목적함수와 알고리즘을 각각 설명하시오
목적함수는 k개의 중심으로부터 다른 점들의 거리 합입니다. K-means 는 랜덤한 k개의 중심으로부터 클러스터를 만듭니다. 그리고 클러스터의 중심으로 중심을 옮깁니다. 이를 더이상 클러스터 바뀌지 않을 떄까지 반복합니다.
Degree 4의 Polynomial Regression 모델이 오버피팅하고 있다면 모델의 Degree를 어떻게 바꾸어야하는지, 왜 그렇게 하여야하는지 설명하시오
Degree를 낮추어야 합니다. 차수가 높을수록 주어진 데이터에 맞추어 조절하는 파라미터 수가 증가하고, 오버피팅이 심해집니다.
20세~40세 성인의 얼굴 사진을 보고 나이를 예측하는 모델을 만들려고 한다. Classification과 Regression 중 어떤 접근법이 적합한가? 왜 그런지 설명하시오.
Regression이 적합합니다. 나이 예측에선 정확히 예측하는 것만큼 가까운 나이로 예측하는 것이 중요한데, Classification은 나이차이가 크게 발생하는 에러 케이스가 많을 것 같습니다.
MNIST 데이터셋의 10-way classification 문제를 베이지안 방법론으로 모델링할 경우, 사전확률(Prior Distribution), 우도함수(Likelihood Function), 사후확률(Posterior Distribution)을 각각 어떻게 정의할지 설명하시오
Deep Learning
인공신경망을 학습할 때 사용하는 Dropout 테크닉이 무엇인지, 그리고 왜 필요한지 설명하시오.
dropout은 오버피팅을 방지하기 위해 일부 가중치를 랜덤하게 제거하는 테크닉입니다. 드롭아웃이 없다면 딥러닝 모델은 특정 수렴지점으로 쉽게 수렵합니다. 하지만 이것이 최적의 수렴 지점이 아닐 수 있습니다. 그렇다면 학습 과정 중에 랜덤한 노이즈를 주어 수렴을 탈출해야하는데 이 방법 중 하나가 드롭아웃 입니다.
Reinforcement Learning
강화학습에서 Exploration과 Exploitation의 개념이 무엇인지 각각 설명하시오
exploitaion은 학습된 최적 경로를 선택하는 것을 의미합니다. exploration은 새로운 경로를 시도하며 학습하는 것을 의미합니다.