데이터양은 얼마 안 되는데 Spark 조회만 느립니다. 어디를 봐야 원인이 나오고, 고친 뒤에는 무엇이 남을까요?왜 필요한가모델 학습 관련된 작업을 하던 중 학습과 추론 과정에서 소요시간이 너무 길게 잡히는 것을 확인했습니다.물론 학습에 필요한 데이터가 많기 때문에 어쩔 수 없이 오래 걸리는 건 당연하다고 생각했죠하지만 내가 생각했던 데이터량 대비 소요시간이 너무 길어 해당 현상을 조사하기 시작했습니다.우선 문제가 되는 API(학습 및 추론)의 소요시간을 측정해보기 시작했습니다. 학습 데이터 조회를 위해 약 10억 정도의 데이터를 조회하는 경우 위와같이 시간이 오래 걸리는것을 확인하게 되었다해당 글은 원인 확인을 위해 내가 확인했던 방법과 어떻게 해결하는지에 대한 과정을 담아 다른사람에게도 좋은 인사이트..