프리미엄
예측대회
투자분석
아카데미
커뮤니티
Valley AI 시작하기시작하기
Valley Space인기
시그마가 중요한 이유
똥공장똥

시그마가 중요한 이유

avatar
리탭
2024.08.24조회수 9회
avatar
리탭
구독자 33명구독중 14명
알팀장님과 함께하는 즐거운 합법도박 라이프
산적왕

<사진: 히그마>


E[mu_sample(X(mu_true))] = mu_true 이지만

E[mu_true(X(mu_sample))] != mu_sample이기 때문에~


회원가입만 해도
이 글을 무료로 읽을 수 있어요.

Basic 7일 무료 체험 시작하기
이미 계정이 있으신가요?로그인하기
댓글 0개
아직 작성된 댓글이 없습니다.
똥 카테고리의 다른글

어제는 놀았다

오늘은 다시 열심히해볼까 일단 실제데이터에 한번 대충 테스트 돌려보고 그냥저냥 괜찮으면 바로 실전으로 돌입하려 한다 실전에서 조금 죽더라도 일단 돈이좀왔다갔다해야 동기부여가 되기때문이다 알고리즘이 아무리 구려도 그냥 1계약씩만 베팅하고 베팅 총롤링이 높지 않으면 기대수익관점에서 큰 문제가 없을 것이라 생각한다 다른사람들은 베팅을 공부나 생각보다 좋아하지만 나는 그 반대의 경향이 과도하게 커서 효율성이 최선이 아닐 때가 많다 그리고 동기부여의 관점에서 근시안적이어서 지금 당장 주어지는 보상이나 압박이 없으면 멍때리고 유튜브본다 이전에 하던 걸 멈추고 돈태우면서 이거한지도 벌써 1년 반쯤 되었다 시작할때쯤 친구가 군대에 갔는데 한달전쯤 전역한 것이다 자꾸 키움api 활성화시켜놓으면 한달지났는데 한번도안썻다고 비활성화 되는 걸 보면 얼마나 탱자탱자 사는지 알수있따 밸리ai도 배울려고 가입했다기보다는 나와 비슷한 생각을 하고 비슷한 성향을 가진 사람을 찾아 내 주변 사회적 환경으로부터 동기부여를 받기 위해 가입한것이다 확실히 내용 있는 사람들이 많이 모여있다는 생각이 든다. 난 기댈언덕이 없어 돈떨어지면 죽는다... 그냥 대충 최소한의 구색만 맞추고 일단 렛츠고하기 위해 최선을 다해보자 일단 실제데이터로 테스트한번만 돌려보고... 그것도 지금생각못한 변수가 있다면 의외로 오래걸릴 수도 있다 늘 그렇다
똥
2024. 08. 24
0
0
8

음 이제야 데이터가 안튀기는 하는군

이런식으로 대충 추세를 가진 랜덤 인공데이터셋을 만들어서 알고리즘에 넣고돌려서 테스트셋에서 예측값과 실제값의 관계를 확인해보면 이르케 이쁘게 나온다 고치기전에는 이렇게나온다 y좌표가 4위에있는데 이거는 알고리즘이 5일뒤에 주가가 1500% 이상 오를거라고 예측했다는 것이다. ㅋㅋ 근데 왜 결과들이 다시 달라지지...다시디버깅하러간다..
똥
2024. 08. 23
0
1
14

디버깅 후

실행시마다 결과가 다르게 나왔던 문제 -> mongoDB에서 데이터를 가져오는 과정에서 파이프라인에서 타임스탬프로 정렬을 안해줘서 생긴 문제였다 결과값이 튀는 문제 -> 예측해야하는 인풋좌표에 대해 주변의 유의미한 좌표들이 한쪽으로 치우쳐져있다 유의미한 좌표들의 총 수가 적다 유의미한 좌표들이 서로 아주 가까히 이웃하여있다 이럴 때 프리딕션을 가중평균으로 하면 괜찮은데 가중선형피팅으로 해버리면 피팅하는 하이퍼플레인이 원점기준으로 저 멀리서 타이타닉마냥 기울어져 형성되고(2, 3 요인의 조합) 그게 1 요인에 의해서 기울기가 누적되서 이 모든 요인들의 환상의 하모니로 인풋좌표에서의 예측이 골로 가있는 건데 일단 지금은 테스트하느라 총데이터수가 적고 또 유효좌표도 그냥 전체좌표의 1%로 해놔서 이런거긴 하지만 평균대신 피팅을 쓸 때 장점이 주변에 참고할 데이터가 한쪽으로 쏠려있을 때 평균내는거에 비하여 예측값이 더 적절할 수 있다는 건데 오히려 그런 상황에서 문제를 일으킨 것이다. 근본적으로 데이터에 노이즈가 많은 것도 이유 ...
똥
2024. 08. 23
0
2

기상

어제 인공데이터로 알고리즘클래스 및 DB핸들링클래스 테스트하다가 잤다 일단 알고리즘은 대충돌아가는거같은데 알고리즘에서 pvalue느낌의 노말디스트리뷰션의 꼬리영역의 크기 혹은 그값의 1/x를 사용하는 과정에서 숫자가 너무 작아지고 커질때가 있어서 이상한 튐현상이 발생하는 것 같다 가끔 에러도뜬다 분모 0처리 이런거 다 했는데도 np.NaN으로 가버리는 케이스들이 생긴다 이건 뭐 고치는데 별 문제 없을것 같다 또 둘째로 분명히 인공데이터생성할때 np.random.seed()로 초기시드를 고정하고 출발하여 rawdata가 동일한것을 확인했음에도 자꾸 최종결과가 실행마다 다르게 나온다 이게 DB와 상호작용하는데에서 문제가있는것인지, 알고리즘과정에서 문제가있는것인지는 모르겟다 처음 생성이후로는 np.random을 안쓰는데 어디서 튀어나오는지를 모르겠어서 실행결과랑 이전실행결과를 DB에 임시로 저장하면서 어디서부터 결과값이 달라지고 있는지를 확인할 예정이다.
똥
2024. 08. 21
0
1

이건 문제가크다

ㄹㅇ 쉽지않다. 일단 N_eff만 대충 적용해주고, 가능성까지만 메모해두고, 실전에 돌입하면서 생각해야한다 너무 상상속의괴물과 싸우고있는것은 안좋다는 것을 경험으로 알고있다 막상실전에서는 이런저런 날먹기술들이 중요할수도 있다 다만 이문제는 알고리즘의 본질을 흔들 수 있는 문제라 노트해둘 필요가 있따 투자에서 예측은 완벽한예측이 아니라 1% 10% 베팅엣지싸움이라 샘플사이즈가 적어도 보통 유의미한 경우가 많아 N_eff가 줄어드는 것은 그냥저냥 괜찮지만 아웃풋 가중평균 낼 떄 weight가 부적절하면 가중평균의 정당성/의미가 심히훼손되어 심히곤란하다
똥
2024. 08. 20
0
0
8
음 이제야 데이터가 안튀기는 하는군
8
8