f-lab-edu / f-lab-edu/ecsplain

[Features] 훈련 데이터셋 확보 사전 작업으로서의 비용 추정

Open
#32 1 comment 1 reaction 0 assignees View on GitHub
Dominant language
No language data
Stars
1
Forks
0
PR merge metrics
No merged PRs in 30d

Description

LLM을 파인튜닝 하기 전에 훈련 데이터 셋을 구성하기 위한 사전 작업으로서 비용 추정

[배경 설명]
훈련 데이터 셋을 구성하기 위해 비용 및 시간 문제로 LLM으로 생성하기로 한 상황
이 상황에서 GPT-5.2를 사용할 예정인데 이 때 생성 비용이 얼마나 드는 지에 대한 추정을
위한 작업 수행

[작업 순서]
1. validation dataset에서 일부 데이터를 샘플링
- 총 30개 정도의 데이터를 샘플링할 예정
- validation dataset을 활용하는 이유는 비용 추정 과정에서 LLM에 설명 생성을 요청하는데
이렇게 생성된 결과를 현재 구현된 LLM eval에 대한 human evaluation과의 alignment를
추정하는 과정에서 사용될 수 있기 때문임

2. 비용 추정
- 비용에 대한 신뢰 구간을 추정하기로 함 (상한을 구해서 최악의 상황에 대해 대비하기 위함)
- 추정 방법
- 모수적 추정 방법
1. 정규 분포 기반 신뢰 구간 추정
2. student t 분포 기반 신뢰 구간 추정
- 비모수적 추정 방법 (부트스트랩 기반 신뢰 구간 추정)
3. percentile 기반 신뢰 구간 추정
4. BCa (Bias Corrected and accelerated)

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.