프리미엄
예측대회
투자분석
아카데미
커뮤니티
Valley AI 시작하기시작하기
Valley Space인기
음 이제야 데이터가 안튀기는 하는군
똥공장똥

음 이제야 데이터가 안튀기는 하는군

avatar
리탭
2024.08.23조회수 14회
avatar
리탭
구독자 33명구독중 14명
알팀장님과 함께하는 즐거운 합법도박 라이프

이런식으로 대충 추세를 가진 랜덤 인공데이터셋을 만들어서

image.png


알고리즘에 넣고돌려서 테스트셋에서 예측값과 실제값의 관계를 확인해보면

image.png

이르케 이쁘게 나온다



image.png

고치기전에는 이렇게나온다 y좌표가 4위에있는데 이거는 알고리즘이 5일뒤에 주가가 1500% 이상 오를거라고 예측했다는 것이다. ㅋㅋ


근데 왜 결과들이 다시 달라지지...다시디버깅하러간다..

회원가입만 해도
이 글을 무료로 읽을 수 있어요.

Basic 7일 무료 체험 시작하기
이미 계정이 있으신가요?로그인하기
댓글 1개
똥 카테고리의 다른글

디버깅 후

실행시마다 결과가 다르게 나왔던 문제 -> mongoDB에서 데이터를 가져오는 과정에서 파이프라인에서 타임스탬프로 정렬을 안해줘서 생긴 문제였다 결과값이 튀는 문제 -> 예측해야하는 인풋좌표에 대해 주변의 유의미한 좌표들이 한쪽으로 치우쳐져있다 유의미한 좌표들의 총 수가 적다 유의미한 좌표들이 서로 아주 가까히 이웃하여있다 이럴 때 프리딕션을 가중평균으로 하면 괜찮은데 가중선형피팅으로 해버리면 피팅하는 하이퍼플레인이 원점기준으로 저 멀리서 타이타닉마냥 기울어져 형성되고(2, 3 요인의 조합) 그게 1 요인에 의해서 기울기가 누적되서 이 모든 요인들의 환상의 하모니로 인풋좌표에서의 예측이 골로 가있는 건데 일단 지금은 테스트하느라 총데이터수가 적고 또 유효좌표도 그냥 전체좌표의 1%로 해놔서 이런거긴 하지만 평균대신 피팅을 쓸 때 장점이 주변에 참고할 데이터가 한쪽으로 쏠려있을 때 평균내는거에 비하여 예측값이 더 적절할 수 있다는 건데 오히려 그런 상황에서 문제를 일으킨 것이다. 근본적으로 데이터에 노이즈가 많은 것도 이유 ...
똥
2024. 08. 23
0
2
8

기상

어제 인공데이터로 알고리즘클래스 및 DB핸들링클래스 테스트하다가 잤다 일단 알고리즘은 대충돌아가는거같은데 알고리즘에서 pvalue느낌의 노말디스트리뷰션의 꼬리영역의 크기 혹은 그값의 1/x를 사용하는 과정에서 숫자가 너무 작아지고 커질때가 있어서 이상한 튐현상이 발생하는 것 같다 가끔 에러도뜬다 분모 0처리 이런거 다 했는데도 np.NaN으로 가버리는 케이스들이 생긴다 이건 뭐 고치는데 별 문제 없을것 같다 또 둘째로 분명히 인공데이터생성할때 np.random.seed()로 초기시드를 고정하고 출발하여 rawdata가 동일한것을 확인했음에도 자꾸 최종결과가 실행마다 다르게 나온다 이게 DB와 상호작용하는데에서 문제가있는것인지, 알고리즘과정에서 문제가있는것인지는 모르겟다 처음 생성이후로는 np.random을 안쓰는데 어디서 튀어나오는지를 모르겠어서 실행결과랑 이전실행결과를 DB에 임시로 저장하면서 어디서부터 결과값이 달라지고 있는지를 확인할 예정이다.
똥
2024. 08. 21
0
1

이건 문제가크다

ㄹㅇ 쉽지않다. 일단 N_eff만 대충 적용해주고, 가능성까지만 메모해두고, 실전에 돌입하면서 생각해야한다 너무 상상속의괴물과 싸우고있는것은 안좋다는 것을 경험으로 알고있다 막상실전에서는 이런저런 날먹기술들이 중요할수도 있다 다만 이문제는 알고리즘의 본질을 흔들 수 있는 문제라 노트해둘 필요가 있따 투자에서 예측은 완벽한예측이 아니라 1% 10% 베팅엣지싸움이라 샘플사이즈가 적어도 보통 유의미한 경우가 많아 N_eff가 줄어드는 것은 그냥저냥 괜찮지만 아웃풋 가중평균 낼 떄 weight가 부적절하면 가중평균의 정당성/의미가 심히훼손되어 심히곤란하다
똥
2024. 08. 20
0
0
8

통계적 도구를 쓸 때는

샘플사이즈가 굉장히 중요하다 특히 샘플사이즈가 작을때는 더 중요하다 그런데 이런 상황을 가정해보자 10분 전부터의 가격변화로 10분 후 가격변화를 예측해야 하는 과제: 그럼 11시 기준으로 할 때랑 11시 1분 기준으로 할 때랑 인풋아웃풋모두에 강한상관관계가 걸린다 그런데 여기서 통계적 도구를 적용하려고 보면(표준편차, 신뢰구간 등) 인풋에 상관관계가 걸려있으니 인풋간의 유사성이 클 확률이 높은데, 그럼 그 인풋들과 유사한 상황에서 그 데이터 두개를 예측에 사용하게 되면 (수학적으로 엄밀하지 않은 접근이지만 애초에 엄밀할 수가 없음) 아웃풋 두개가 독립적으로 결정되지 않았으므로 마치 그 인풋들과 유사한 상황에서 그 아웃풋을 ...
똥
2024. 08. 20
1
5
16

일

마음을 평화롭게 하고 작은 퍼즐들의 어려움과 가치를 인정해야 한다 작은 퍼즐들도 충분히 전문성이 필요하고 재능과 노력을 요구하는 특별한 작업들이다.
똥
2024. 08. 20
0
0
3
8
통계적 도구를 쓸 때는
avatar
리탭
작성자
2024.08.23

음머지 왜달라지지 kNN때문에 hnswlib을 살짝 고쳐서 쓰는데 거기서 랜덤한뭔가를 쓰는게있었나... 보니 있었네... 근데 이것때문에 결과가 달라지는게 이상한데 왜그런지 확인해봐야겠다