vllm.entrypoints.serve.rlhf.api_router ¶

logger `module-attribute` ¶

logger = init_logger(__name__)

router `module-attribute` ¶

router = APIRouter()

attach_router ¶

attach_router(app: FastAPI)

Source code in vllm/entrypoints/serve/rlhf/api_router.py

def attach_router(app: FastAPI):
    if not envs.VLLM_SERVER_DEV_MODE:
        return
    app.include_router(router)

engine_client ¶

engine_client(request: Request) -> EngineClient

Source code in vllm/entrypoints/serve/rlhf/api_router.py

def engine_client(request: Request) -> EngineClient:
    return request.app.state.engine_client

get_world_size `async` ¶

get_world_size(
    raw_request: Request, include_dp: bool = Query(True)
)

Get the world size from the parallel config.

Parameters:

Name	Type	Description	Default
`include_dp`	`bool`	If True (default), returns the world size including data parallelism (TP * PP * DP). If False, returns the world size without data parallelism (TP * PP).	`Query(True)`

Source code in vllm/entrypoints/serve/rlhf/api_router.py

@router.get("/get_world_size")
async def get_world_size(
    raw_request: Request,
    include_dp: bool = Query(True),
):
    """Get the world size from the parallel config.

    Args:
        include_dp: If True (default), returns the world size including
            data parallelism (TP * PP * DP). If False, returns the world
            size without data parallelism (TP * PP).
    """
    parallel_config = engine_client(raw_request).vllm_config.parallel_config
    if include_dp:
        world_size = parallel_config.world_size_across_dp
    else:
        world_size = parallel_config.world_size
    return JSONResponse(content={"world_size": world_size})

init_weight_transfer_engine `async` ¶

init_weight_transfer_engine(raw_request: Request)

Source code in vllm/entrypoints/serve/rlhf/api_router.py

@router.post("/init_weight_transfer_engine")
async def init_weight_transfer_engine(raw_request: Request):
    try:
        body = await raw_request.json()
    except json.JSONDecodeError as e:
        raise HTTPException(status_code=400, detail="Invalid JSON format") from e  # noqa: B904
    init_info = body.get("init_info")
    if init_info is None:
        raise HTTPException(
            status_code=HTTPStatus.BAD_REQUEST.value,
            detail="Missing 'init_info' in request body",
        )
    await engine_client(raw_request).init_weight_transfer_engine(
        WeightTransferInitRequest(init_info=init_info)
    )
    return JSONResponse(content={"message": "Weight transfer initialized"})

is_paused `async` ¶

is_paused(raw_request: Request) -> JSONResponse

Return the current pause status.

Source code in vllm/entrypoints/serve/rlhf/api_router.py

@router.get("/is_paused")
async def is_paused(raw_request: Request) -> JSONResponse:
    """Return the current pause status."""

    engine = engine_client(raw_request)

    try:
        paused = await engine.is_paused()
    except Exception as err:  # pragma: no cover - defensive
        logger.exception("Failed to fetch pause status")
        return JSONResponse(
            content={"error": f"Failed to fetch pause status: {err}"},
            status_code=HTTPStatus.INTERNAL_SERVER_ERROR.value,
        )

    return JSONResponse(content={"is_paused": paused})

pause_generation `async` ¶

pause_generation(
    raw_request: Request,
    mode: Annotated[PauseMode, Query()] = "abort",
    wait_for_inflight_requests: bool = Query(False),
    clear_cache: Annotated[bool, Query()] = True,
) -> JSONResponse

Pause generation requests to allow weight updates.

Parameters:

Name	Type	Description	Default
`mode`	`Annotated[PauseMode, Query()]`	How to handle in-flight requests: - `"abort"`: Abort all in-flight requests immediately (default). - `"wait"`: Wait for in-flight requests to complete. - `"keep"`: Freeze requests in queue; they resume on /resume.	`'abort'`
`wait_for_inflight_requests`	`bool`	DEPRECATED. Use `mode="wait"` instead.	`Query(False)`
`clear_cache`	`Annotated[bool, Query()]`	DEPRECATED. Whether to clear KV/prefix caches after draining. Ignored when mode="keep".	`True`

Source code in vllm/entrypoints/serve/rlhf/api_router.py

@router.post("/pause")
async def pause_generation(
    raw_request: Request,
    mode: Annotated[PauseMode, Query()] = "abort",
    wait_for_inflight_requests: bool = Query(False),
    clear_cache: Annotated[bool, Query()] = True,
) -> JSONResponse:
    """Pause generation requests to allow weight updates.

    Args:
        mode: How to handle in-flight requests:
            - ``"abort"``: Abort all in-flight requests immediately (default).
            - ``"wait"``: Wait for in-flight requests to complete.
            - ``"keep"``: Freeze requests in queue; they resume on /resume.
        wait_for_inflight_requests: DEPRECATED. Use ``mode="wait"`` instead.
        clear_cache: DEPRECATED. Whether to clear KV/prefix caches after
            draining. Ignored when mode="keep".
    """

    engine = engine_client(raw_request)

    try:
        await engine.pause_generation(
            mode=mode,
            clear_cache=clear_cache,
            wait_for_inflight_requests=wait_for_inflight_requests,
        )
        return JSONResponse(
            content={"status": "paused"},
            status_code=HTTPStatus.OK.value,
        )

    except ValueError as err:
        return JSONResponse(
            content={"error": str(err)},
            status_code=HTTPStatus.BAD_REQUEST.value,
        )
    except Exception as err:  # pragma: no cover - defensive
        logger.exception("Failed to pause generation")
        return JSONResponse(
            content={"error": f"Failed to pause generation: {err}"},
            status_code=HTTPStatus.INTERNAL_SERVER_ERROR.value,
        )

resume_generation `async` ¶

resume_generation(raw_request: Request) -> JSONResponse

Resume generation after a pause.

Source code in vllm/entrypoints/serve/rlhf/api_router.py

@router.post("/resume")
async def resume_generation(raw_request: Request) -> JSONResponse:
    """Resume generation after a pause."""

    engine = engine_client(raw_request)

    try:
        await engine.resume_generation()
        return JSONResponse(
            content={"status": "resumed"},
            status_code=HTTPStatus.OK.value,
        )
    except Exception as err:  # pragma: no cover - defensive
        logger.exception("Failed to resume generation")
        return JSONResponse(
            content={"error": f"Failed to resume generation: {err}"},
            status_code=HTTPStatus.INTERNAL_SERVER_ERROR.value,
        )

update_weights `async` ¶

update_weights(raw_request: Request)

Source code in vllm/entrypoints/serve/rlhf/api_router.py

@router.post("/update_weights")
async def update_weights(raw_request: Request):
    try:
        body = await raw_request.json()
    except json.JSONDecodeError as e:
        raise HTTPException(status_code=400, detail="Invalid JSON format") from e  # noqa: B904
    update_info = body.get("update_info")
    if update_info is None:
        raise HTTPException(
            status_code=HTTPStatus.BAD_REQUEST.value,
            detail="Missing 'update_info' in request body",
        )
    await engine_client(raw_request).update_weights(
        request=WeightTransferUpdateRequest(update_info=update_info)
    )
    return JSONResponse(content={"message": "Weights updated"})

vllm.entrypoints.serve.rlhf.api_router ¶

logger module-attribute ¶

router module-attribute ¶

attach_router ¶

engine_client ¶

get_world_size async ¶

init_weight_transfer_engine async ¶

is_paused async ¶

pause_generation async ¶

resume_generation async ¶

update_weights async ¶

logger `module-attribute` ¶

router `module-attribute` ¶

get_world_size `async` ¶

init_weight_transfer_engine `async` ¶

is_paused `async` ¶

pause_generation `async` ¶

resume_generation `async` ¶

update_weights `async` ¶