support multi process to launch llmserver, add openai proxy api.

2025-09-28 04:51:29 +00:00 · 2023-06-12 21:29:16 +08:00
parent 62eb6c383e
commit 6e3b48c7c4
4 changed files with 21 additions and 12 deletions
--- a/pilot/configs/config.py
+++ b/pilot/configs/config.py
@@ -17,8 +17,9 @@ class Config(metaclass=Singleton):
    def __init__(self) -> None:
        """Initialize the Config class"""

-        # Gradio language version: en, cn
+        # Gradio language version: en, zh
        self.LANGUAGE = os.getenv("LANGUAGE", "en")
+        self.WEB_SERVER_PORT = int(os.getenv("WEB_SERVER_PORT", 7860))

        self.debug_mode = False
        self.skip_reprompt = False
--- a/pilot/server/llmserver.py
+++ b/pilot/server/llmserver.py
@@ -84,6 +84,11 @@ class ModelWorker:
        return get_embeddings(self.model, self.tokenizer, prompt)


+model_path = LLM_MODEL_CONFIG[CFG.LLM_MODEL]
+worker = ModelWorker(
+    model_path=model_path, model_name=CFG.LLM_MODEL, device=DEVICE, num_gpus=1
+)
+
 app = FastAPI()


@@ -157,11 +162,4 @@ def embeddings(prompt_request: EmbeddingRequest):


 if __name__ == "__main__":
-    model_path = LLM_MODEL_CONFIG[CFG.LLM_MODEL]
-    print(model_path, DEVICE)
-
-    worker = ModelWorker(
-        model_path=model_path, model_name=CFG.LLM_MODEL, device=DEVICE, num_gpus=1
-    )
-
    uvicorn.run(app, host="0.0.0.0", port=CFG.MODEL_PORT, log_level="info")
--- a/pilot/server/webserver.py
+++ b/pilot/server/webserver.py
@@ -658,7 +658,7 @@ def signal_handler(sig, frame):
 if __name__ == "__main__":
    parser = argparse.ArgumentParser()
    parser.add_argument("--host", type=str, default="0.0.0.0")
-    parser.add_argument("--port", type=int)
+    parser.add_argument("--port", type=int, default=CFG.WEB_SERVER_PORT)
    parser.add_argument("--concurrency-count", type=int, default=10)
    parser.add_argument(
        "--model-list-mode", type=str, default="once", choices=["once", "reload"]