# \[furiosa-opt v0.8.1\] launch 제출 시 host CPU 사용 (CPU 2개 환경) 문의

**URL:** <https://forums.furiosa.ai/t/furiosa-opt-v0-8-1-launch-host-cpu-cpu-2/479>\
**Category:** 일반\
**Created:** [October 10, 2026, 10:18am UTC](https://forums.furiosa.ai/t/furiosa-opt-v0-8-1-launch-host-cpu-cpu-2/479 "2026-10-10T10:18:41Z")\
**Posts on this page:** 1\
**Page:** 1

<div class="post-metadata">

**Author:** ![hyeb1717](https://avatars.discourse-cdn.com/v4/letter/h/e9a140/32.png) [@hyeb1717](https://forums.furiosa.ai/u/hyeb1717)\
**Post date:** [October 10, 2026, 10:18am UTC](https://forums.furiosa.ai/t/furiosa-opt-v0-8-1-launch-host-cpu-cpu-2/479/1 "2026-10-10T10:18:41Z")

</div>

안녕하세요. 커스텀 커널을 queue로 이어 launch하는 파이프라인에서 host CPU 사용에 대해 여쭙습니다. Furiosa Opt 0.8.1(furiosa-opt-std 0.8.1), RNGD 1칩입니다.

CPU 2개가 할당된 환경에서 launch를 연속으로 많이 제출하면, host CPU가 할당량을 채워 throttle이 생기고 launch 사이 간격이 벌어졌습니다. 같은 바이너리를 CPU가 넉넉한 환경에서 돌리면 이 간격이 거의 없습니다.

- Function::run 뒤 첫 poll에서 응답을 최대 약 200 µs spin하는 것으로 보입니다. 커널이 그보다 길면 launch마다 CPU 약 200 µs가 쓰입니다.
- runtime의 io\_uring poller 스레드가 CPU 하나를 거의 계속 씁니다.

질문

1. 응답을 기다리지 않고 제출만 하는 공개 API가 있거나, spin 시간을 줄이는 설정이 있을까요?
2. #469 답변에서 "앞 launch가 도는 동안 다음 launch를 미리 제출할 수 있게 API를 개선하겠다"고 하셨는데, 그 일정과 형태를 알 수 있을까요?

감사합니다.
