프리미엄
예측대회
투자분석
아카데미
커뮤니티
Valley AI 시작하기시작하기
Valley Space인기
통계적 도구를 쓸 때는
똥공장똥

통계적 도구를 쓸 때는

avatar
리탭
2024.08.20조회수 16회

샘플사이즈가 굉장히 중요하다

특히 샘플사이즈가 작을때는 더 중요하다


그런데 이런 상황을 가정해보자


10분 전부터의 가격변화로 10분 후 가격변화를 예측해야 하는 과제:


그럼 11시 기준으로 할 때랑 11시 1분 기준으로 할 때랑

인풋아웃풋모두에 강한상관관계가 걸린다


그런데 여기서 통계적 도구를 적용하려고 보면(표준편차, 신뢰구간 등)

인풋에 상관관계가 걸려있으니 인풋간의 유사성이 클 확률이 높은데,

그럼 그 인풋들과 유사한 상황에서 그 데이터 두개를 예측에 사용하게 되면

(수학적으로 엄밀하지 않은 접근이지만 애초에 엄밀할 수가 없음)

아웃풋 두개가 독립적으로 결정되지 않았으므로

마치 그 인풋들과 유사한 상황에서 그 아웃풋을 지지하는 데이터가 2개인것 같은 착각을 ...

회원가입만 해도
이 글을 무료로 읽을 수 있어요.

Basic 7일 무료 체험 시작하기
이미 계정이 있으신가요?로그인하기
댓글 5개
avatar
리탭
구독자 33명구독중 14명
알팀장님과 함께하는 즐거운 합법도박 라이프
avatar
리탭
작성자
2024.08.20

N_eff까진 생각했었는데 어느 데이터에 과대비중이 의도와다를게 적용될수 있을것이란 가능성은 방금 글쓰다가 이제 떠올렸다. 여기서 문제는 어느 상황에서는 비중이 쎄게걸리고 어느 상황에서는 비중이 약하게걸릴수있어서 일관적인 처리가 쉽지않다는 것이다. 분석점을 딱찍었을때 관계성이큰데이터포인터들이 많이 뭉쳐있을수도 있고 근처에 독립적인 데이터포인트들이 많이 희석시켜주었을 수도 있다. 이것은 프레딕션에 강한 편향을 걸 수 있기 때문에 반드시 해결해야 하는 문제이다. 인풋관계성을 무시하고(어차피 이부분은 특정 분석지점에서 유사한인풋이 두개가 들어오는 문제떄문에 고려해야하는 부분) 아웃풋간 연관관계를 정의할 수 있는 함수를 만들어서 각 분석지점에서 N_eff를 계산할때 데이터포인트간의 연관관계를 고려할수있게한다??

(수정됨)
avatar
Isekai Quant
2024.08.20

ML 모델을 쓰시는건지 classical time series 모델을 쓰시는건지 잘 모르겠지만.. 후자 관련해서 자체 autocorrelation이 큰 input output간의 regression 할 시 발생할 수 있는 문제점에 대해 저도 최근에 생각 중이어서 그냥 댓글 남깁니다. newey-west standard errors가 표준적인 해결방안으로 알고 있습니다만.. ML같은 경우에는 prediction이 중요하니 굳이 estimators에 대한 variance를 중요하게 생각하지 않는 것 같더라구요.

avatar
리탭
작성자
2024.08.20

오...좋은정보감사합니다 대충보니 바로이해는 안되는데 원리는 알것같네요. 비슷한스타일인거같은데 앞으로 자주얘기했으면 좋겠네요 전 지금은 변형kNN으로 접근하고있고 나중에 좀더 일반적인 모델로 각 포인트에서 prediction이랑 그변동성까지 둘 다 예측해서 maximum likelihood쪽으로 코스트함수 만들어서 해볼까 생각은하는데 둘 다 별차이 없을것같고 피쳐셀렉션이랑 모델의 자유도를 제한하기 위해 노력하는게 중요할 것 같다고 생각합니다. estimators에 대한 variance를 중요하게 생각하지 않는다는 것이 무슨 의미인지는 정확히 이해가 되지 않네요. 모델이 어느지점에서 prediction을 했을 때 prediction에 얼마나 자신이 있는지, 혹은 prediction과 트루값에 대한 차이의 변동성을 얼마 정도로 예상하는지를 크게 신경쓰지 않는다는 의미인가요? 그게 확실히 이쪽에서는 중요하긴하죠

avatar
Isekai Quant
2024.08.21

금융에서는 overlapping periods를 사용해 feature engineering를 할 때가 있습니다 (예: 매월 5년치 수익률을 계산해서 피쳐로 사용). 이런 상황에서 output도 non-stationary하다면 non-stationary output을 non-stationary input에 regress하는 일이 발생합니다. 그래서 실제로 아무 상관이 없으면서도 베타에 대한 분산이 굉장히 낮아 유의미한 관계가 있다라고 잘못된 결론을 내릴 수 있을 수 있습니다. 그래서 이런 경우에 hypothesis test를 그냥하면 안 되고 비정상 시계열끼리 회귀분석을 했다는 것을 감안한 Newey-West standard errors를 쓸 수 있습니다. 아무튼 이 얘기를 한 이유는 위에서 문제가 된 것은 estimators, 즉 베타입니다. 하지만 ML에서는 prediction이 중요하기 때문에 사실 뭘하든 out of sample error만 최소화 시키면 된다라고 알고 있습니다. 즉, 베타가 얼마인지, 베타가 robust한지, 베타가 무엇을 뜻하는지 굳이 관심을 가지지 않는다는 것이죠 (econometrician에 비해 상대적으로 관심을 덜 가진다는 뜻입니다). Overlapping Periods를 사용해서 feature engineering를 하는것에 대한 통계적 문제들은 금융에서 꽤나 다룬 주제로 알고 있습니다. 실용적인 관점에서 밑에 있는 stack exchange 아티클 읽어보시는 거 추천드립니다. https://quant.stackexchange.com/questions/35216/how-can-you-determine-the-correct-significance-of-the-shiller-p-e-regression 추후 결과나 과정 업뎃 기대하겠습니다. ^^

avatar
리탭
작성자
2024.08.21

우와 개고수시네요 댓글도 천천히 읽어보고 화이팅 해보겠습니다 감사합니다

똥 카테고리의 다른글

일

마음을 평화롭게 하고 작은 퍼즐들의 어려움과 가치를 인정해야 한다 작은 퍼즐들도 충분히 전문성이 필요하고 재능과 노력을 요구하는 특별한 작업들이다.
똥
2024. 08. 20
0
0
3

메모

특정상품에대해 거래에 참여하고 있거나 참여하는 자본들의 특성을 파악하여 행동을 읽어내야하고 그러기 위해 생각의 '변화'을 읽어내야 하고 저평가된 가능성에 베팅하고 참여자본이 꺼리거나 힘들거나 복잡하거나 어려운 가능성에 베팅 재미없거나, 화젯거리가 되지 못하거나, 사람들이 원하는 것에 반하거나, 사람들이 옳다고 여기는 것에 반하거나 하는 가능성에 베팅 내가 잘하는건뭘까 참여자본이 일관적인 행태, 생각의 변화를 보일 상품을 찾아나서기 코스피/닥 선물, 테마주 먼저,
똥
2024. 08. 17
0
0
4

여자친구를 공항에 데려다주고 돌아왔다

잠을 오랫동안 안잤는데 커피를 좀 마셔서 그런지 잠이 오지 않는다 다시 할일을 하기 전에 일을 쉬는동안 생각해봤던 것들을 생각나는 대로 끄집어내 보자 기술적분석은 추세와 거래량? 기술적분석을 그 단어가 주는 어감을 떠올리며 멋대로 정의해보자면 내재가치와 관계없이 인간의 심리적이유로 발생하는 가격변화패턴에 관한 분석인듯 하다. 그러나 내 관점에서 더 유의미한 정의는 데이터로부터의 귀납추론. 패턴서칭 이런 분석의 가장 큰 문제는 시도가 많아질수록 분석의 밸류가 떨어진다는 것, 데이터 수가 적을 때 효용이 감소한다는것. 그럼 연역추론은뭔가? 상대성이론이 한번도관측되지 않은 블랙홀을 예측하는 것처럼 광범위한 귀납적원리가 새로운조건에서 적용되었을 때? 뉴턴역학의 원리들을 귀납적으로 발견해내고 그것을 지금까지 한번도 시도해보지 않은 미지의 시작조건에서 적용했을때 어떻게 될지를 생각해보는게 연역적 추론? 귀납/연역 정의에 정확히 부합하지 않더라도 가격예측의 관점에서 내가 맘대로 분류해보자면 귀납: 그냥 데이터 가지고 통계분석(신뢰구간같은거). 포인트는 데이터 레이블 간의 관계성이 전혀 정의되지 않는다는거. 가격예측에 관하여, '추세관련변수'와 '오늘개똥이가먹은아침식사메뉴변수'를 동일하게 취급 연역: 똑같이 통계분석은 하는데, 데이터레이블간의 연결고리를 광범위한, 그리고 때로는 비 금융적인 물리적 원리를 통하여 연결된 정도와 그 방향을 어느 정도 미리 추론해내는것. 추세관련변수는 인간의 심리적 행동적 측면에서 자본이 이러이러한 생각을 하고 액션을 취하게 해서 추세의 연속성 혹은 때로 역추세를 유발할수 있을 것 같아보이니까 추세관련변수와 가격예측의 연결성을 개똥이의아침메뉴와 가격예측의 연결성보다 더 강하게 세팅해주는거 -> 단순통계적분석의 적은샘플많은모델 함정에서 빠져나오게 해줌. 결국 실질적으로 위와같이 내맘대로 생각해본 귀납연역은 ...
똥
2024. 08. 15
1
1
16

변동성장세

가왔다 일드커브가 반전되었을때부터 무언가가 일어날것이라고 생각해왔다. 무려 2년전이다... 일드커브반전후 본격적으로 금리인하기에 꽤오랜기간 규모있는 하락장이 올 가능성이 평소보다 아주 높아질 것으로 생각해왔다. 미장 폐장시간마다 깨어나서 오르고내림을 확인후 당일 강한변동의 역망향에 베팅하는 날먹전략을 시도해볼 때가 왔다. 하..프로그램을 진작만들었느면 굳이 내가일어나야할필요가없는데 아쉽다. 숏베팅은 항상조심할필요가 있는부분이다. 아직 함께할기회가 많지 않은 여친이랑 같이있어서 일에집중할수없다. 원래 하던일을 사실상그만두고 금융 걍제 투자 공부 및 프로그램제작을 시작한지 1년이 좀 더 넘은 듯 하다. 시드가 엄청나게 넉넉하지 못하여 돈이많이녹았다. 임의의 순간에 가족이 생길수도 있을것같은데 돈을 벌어야한다는 압박이 조금 커졌다. 여자친구는 약열흘후 다시 해외로간다. 이런저런 날먹각을 보면서 프로그램제작에 더 열을 올리고 싶다. 밸리ai강의초반부에 인간이 ai를 이길수 있는 이유를 이야기하는 부분이있다. 다만나는 동의하지 않으며 그런 ai의 한계가 생각보다 빨리 극복될 것이라고 생각한다. 비금융적 지식 및 직관/현실세계에 대한 물리적이해 등의 ...
똥
2024. 08. 08
0
0
8

여자친구가 와서

다소바쁘다. 아마 앞으로 한달정도 계속 추세처리함수는 코딩을 마쳤다 이제 인공데이터에 테스트, 실제데이터에 테스트 인공데이터에서는 비효율적인 브루트포스 함수와 비교하여 동일한 결과가 나오는 지 볼것이다. 피곤해서 그런지 생활패턴이 좀달라져서 그런지 약한 감기에걸렸다
똥
2024. 07. 21
1
0
14