전체 글
-
5. Meta-label ModelPJT/Quant 2026. 9. 4. 10:27
이전에 Primary Model과 Triple-barrier로 거래 방향과 성공 기준을 정의하고, 경제적 난이도와 시간 안정성을 기준으로 Label 후보를 선택했다. 경제적 난이도는 Meta-label Model 없이 모든 거래에 진입할 때 손익분기에 필요한 Precision 개선 수준이다.Meta-label Model은 Primary Model이 제안한 거래가 정해진 시간 안에 PT에 도달할지를 진입 시점의 Feature로 예측한다. 1. 기본 실험 모델과 Feature 구성1.1 실험 모델 선정AFML[1]에서는 Meta-label Model로 Random Forest를 사용하지만, 특정 모델을 반드시 사용해야 하는 것은 아니라고 판단했다. 레이블 후보가 많고 반복적으로 Walk-forward OOS..
-
Codependence - 2. 연속형 Feature와 이진 Label 간의 의존성 측정ML DL DS/etc. 2026. 9. 4. 01:55
이전 글에서 Codependence를 표현하는 Copula, 관계를 요약하는 Dependence measure와 이를 거리로 사용하는 Metric을 구분했다. Feature Selection에서는 Label과의 관련성을 높이고 Feature 사이의 중복성을 줄이는 두 문제가 함께 존재한다.이번 글에서는 그중 연속형 Feature와 이진 Label 사이의 관련성 측정에 집중한다. 여러 측정값이 선형·비선형 관계, Noise와 표본 수의 변화에 어떻게 반응하는지 모의실험으로 비교한다. 1. 연속형 Feature와 이진 Label이번 문제에서 변수의 형태는 다음과 같다.\(X\): 진입 시점에 계산한 연속형 Feature\(Y\): PT 도달 여부를 나타내는 이진 Label\(Y=1\): PT에 먼저 도달\(..
-
Codependence - 1. Copula와 의존성 측정ML DL DS/etc. 2026. 9. 4. 01:34
두 변수가 함께 움직인다고 할 때, ‘함께’는 여러 뜻을 가질 수 있다. 같은 방향으로 비례해 움직일 수도 있고, 순서만 비슷할 수도 있으며, 특정 구간이나 꼬리에서만 관계가 나타날 수도 있다. Codependence는 이처럼 한 변수를 알았을 때 다른 변수의 불확실성이 달라지는 통계적 연관성을 넓게 부르는 표현이다. 연관성은 인과관계를 의미하지 않는다.이 글에서는 Pearson 상관계수에서 시작해 Mutual Information과 Copula로 범위를 넓힌다. 기존 Information Theory 글에서 엔트로피와 Mutual Information의 기본 개념을 정리했으므로, 여기서는 의존성 측정과 실제 추정에 필요한 부분만 다룬다.Codependence를 다루는 개념은 다음과 같이 구분할 수 있다..
-
4. Primary Model과 Label 최적화PJT/Quant 2026. 9. 2. 01:40
1. Primary Model: 거래 방향 가설 생성 Sampling이 정한 사건 시점마다 아래 9개의 규칙으로 Long 또는 Short 방향을 부여했다. 조건을 만족하지 못해 방향이 생성되지 않은 사건은 Label로 이어지지 않는다. Primary Model 계열 설명 정해야 하는 파라미터 Label 감소 가능성 Long-only 고정 방향 모든 사건에 Long 방향 부여 없음 없음 Short-only 고정 방향 모든 사건에 Short 방향 부여 없..
-
2. 검증 결과와 운영 대시보드PJT/Quant 2026. 8. 29. 16:31
1. 실험 성과아래 20개 포트폴리오를 중첩한 결과, 2025.01–2026.07 월별 Walk-forward OOS에서 왕복 거래비용 20bp 반영 후 연환산 Sharpe 1.93, PSR 87.5%(Sharpe > 1), MDD 16.64%, 일별 CVaR 5% -2.59%를 기록했다.현재 배포 20개 Portfolio Selector Head의 OOS 성과서로 다른 목적함수와 선택 기준을 가진 20개의 Portfolio Selector Head가 현재 배포에 사용된다. 그래프는 각 Head의 2025년 1월 이후 누적 OOS 순수익을 동일한 Multiplier 100 기준으로 비교하며, 최종 포트폴리오는 이들을 중첩해 구성한다.2. GrafanaGrafana는 MSS·Prediction·CES가 기..
-
1. 개발 동기와 문제 정의PJT/Quant 2026. 8. 28. 15:59
개발 동기1. 실력 점검연구소와 스타트업에서 약 3년 동안 철강 공정과 부동산 분야의 AI/ML 문제를 풀었다. 데이터 수집 단계부터 문제를 정의하기도 했고, 개발한 모델을 실제 서비스에 배포하는 경험도 했다.다만 일을 하면서도 “조금 더 경험이 많은 사람이라면 이 문제를 어떻게 정의하고 접근했을까?”라는 궁금증은 계속 있었다.퇴사 후 금융에서 머신러닝을 접목한 책(AFML)을 읽으면서 샘플링, 레이블링, 검증 등 금융 문제를 정의하는 다양한 방식을 접할 수 있었다. 이를 계기로 하나의 복잡한 문제를 처음부터 끝까지 직접 풀어보면서, 지금까지 쌓아온 문제 해결 방식과 ML 역량을 점검해보고 싶었다.2. 성장어려운 문제를 깊게 고민했던 경험이 이후의 문제 해결에 가장 많이 남는다고 생각한다. 한 번 고민했..
-
통계적 가설 검정 (Statistical hypothesis testing)Math/etc. 2022. 9. 30. 22:27
통계적 가설 검정 (Statistical hypothesis testing) Section 1. General Information데이터의 종류 요약 통계량데이터가 정규분포를 따르는 경우: 평균과 표준편차로 요약이 적절정규분포를 따르지 않는 경우(skewed): 중앙값과 IQR 요약이 적절순위척도(ordinal): 중앙값과 IQR 요약이 적절명목적도: 최빈값→ 이를 통해, 이상치를 확인할 수 있다.시각화적절한 통계적 검정 방안 고르기연구주제가 어떤 것인지, 변수들의 종류가 어떻게 되는지 알아야 한다. 그리고 종속 변수의 데이터가 연속형(정규성, 정규성X), 범주형(순위척도/명목척도)인지에 알아야한다.이외에 설명변수는 얼마나 많고 어떤 데이터 종류인지. 관계나 평균의 차이가 관심사인지. 동일한 실험자에게 ..