llm.js 5.1 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153
  1. import { cpus } from "node:os";
  2. import { commercialApiHold } from "./model-policy.js";
  3. export function isLocalLlmDisabled(_env = process.env) {
  4. return true;
  5. }
  6. export function resolveLlamaGpuMode(_env = process.env) {
  7. return "cpu";
  8. }
  9. export function isQwen3EmbeddingModel(modelUri) {
  10. return /qwen.*embed/i.test(modelUri) || /embed.*qwen/i.test(modelUri);
  11. }
  12. export function formatQueryForEmbedding(query, modelUri) {
  13. if (modelUri && isQwen3EmbeddingModel(modelUri)) {
  14. return `Instruct: Retrieve relevant documents for the given query\nQuery: ${query}`;
  15. }
  16. return `task: search result | query: ${query}`;
  17. }
  18. export function formatDocForEmbedding(text, title, modelUri) {
  19. if (modelUri && isQwen3EmbeddingModel(modelUri)) {
  20. return title ? `${title}\n${text}` : text;
  21. }
  22. return `title: ${title || "none"} | text: ${text}`;
  23. }
  24. export const LFM2_GENERATE_MODEL = "commercial-api-required";
  25. export const LFM2_INSTRUCT_MODEL = "commercial-api-required";
  26. export const DEFAULT_EMBED_MODEL_URI = "commercial-api:embedding-unconfigured";
  27. export const DEFAULT_RERANK_MODEL_URI = "commercial-api:rerank-unconfigured";
  28. export const DEFAULT_GENERATE_MODEL_URI = "commercial-api:generation-unconfigured";
  29. export const DEFAULT_MODEL_CACHE_DIR = "commercial-api:no-local-cache";
  30. export async function pullModels(_models, _options = {}) {
  31. throw commercialApiHold("local model downloads are disabled");
  32. }
  33. function learnedModelHold(operation) {
  34. throw commercialApiHold(`${operation} requires an approved commercial API adapter`);
  35. }
  36. /** Historical SDK name retained as a fail-closed compatibility adapter. */
  37. export class LlamaCpp {
  38. static EMBED_CONTEXT_SIZE = 2048;
  39. static RERANK_CONTEXT_SIZE = 2048;
  40. static RERANK_TARGET_DOCS_PER_CONTEXT = 32;
  41. static RERANK_TEMPLATE_OVERHEAD = 32;
  42. embedModelName;
  43. constructor(config = {}) {
  44. this.embedModelName = config.embedModel ?? process.env.QMD_EMBED_MODEL_ID ?? DEFAULT_EMBED_MODEL_URI;
  45. }
  46. async tokenize(_text) {
  47. return learnedModelHold("tokenization");
  48. }
  49. async countTokens(_text) {
  50. return learnedModelHold("token counting");
  51. }
  52. async detokenize(_tokens) {
  53. return learnedModelHold("detokenization");
  54. }
  55. async embed(_text, _options = {}) {
  56. return learnedModelHold("embedding");
  57. }
  58. async embedBatch(_texts, _options = {}) {
  59. return learnedModelHold("batch embedding");
  60. }
  61. async generate(_prompt, _options = {}) {
  62. return learnedModelHold("generation");
  63. }
  64. async modelExists(modelUri) {
  65. return { name: modelUri, exists: false };
  66. }
  67. async expandQuery(_query, _options = {}) {
  68. return learnedModelHold("query expansion");
  69. }
  70. async rerank(_query, _documents, _options = {}) {
  71. return learnedModelHold("reranking");
  72. }
  73. async getDeviceInfo() {
  74. return { gpu: false, gpuOffloading: false, gpuDevices: [], cpuCores: cpus().length };
  75. }
  76. async unloadIdleResources() { }
  77. async dispose() { }
  78. }
  79. export class SessionReleasedError extends Error {
  80. constructor(message = "LLM session has been released or aborted") {
  81. super(message);
  82. this.name = "SessionReleasedError";
  83. }
  84. }
  85. class CommercialHoldSession {
  86. llm;
  87. released = false;
  88. controller = new AbortController();
  89. constructor(llm, options = {}) {
  90. this.llm = llm;
  91. if (options.signal?.aborted)
  92. this.controller.abort(options.signal.reason);
  93. options.signal?.addEventListener("abort", () => this.controller.abort(options.signal?.reason), { once: true });
  94. }
  95. get isValid() {
  96. return !this.released && !this.controller.signal.aborted;
  97. }
  98. get signal() {
  99. return this.controller.signal;
  100. }
  101. release() {
  102. this.released = true;
  103. this.controller.abort(new SessionReleasedError());
  104. }
  105. assertValid() {
  106. if (!this.isValid)
  107. throw new SessionReleasedError();
  108. }
  109. async embed(text, options) {
  110. this.assertValid();
  111. return this.llm.embed(text, options);
  112. }
  113. async embedBatch(texts, options) {
  114. this.assertValid();
  115. return this.llm.embedBatch(texts, options);
  116. }
  117. async expandQuery(query, options) {
  118. this.assertValid();
  119. return this.llm.expandQuery(query, options);
  120. }
  121. async rerank(query, documents, options) {
  122. this.assertValid();
  123. return this.llm.rerank(query, documents, options);
  124. }
  125. }
  126. let defaultLlamaCpp = null;
  127. export function getDefaultLlamaCpp() {
  128. defaultLlamaCpp ??= new LlamaCpp();
  129. return defaultLlamaCpp;
  130. }
  131. export function setDefaultLlamaCpp(llm) {
  132. defaultLlamaCpp = llm;
  133. }
  134. export async function disposeDefaultLlamaCpp() {
  135. if (defaultLlamaCpp)
  136. await defaultLlamaCpp.dispose();
  137. defaultLlamaCpp = null;
  138. }
  139. export async function withLLMSession(fn, options = {}) {
  140. return withLLMSessionForLlm(getDefaultLlamaCpp(), fn, options);
  141. }
  142. export async function withLLMSessionForLlm(llm, fn, options = {}) {
  143. const session = new CommercialHoldSession(llm, options);
  144. try {
  145. return await fn(session);
  146. }
  147. finally {
  148. session.release();
  149. }
  150. }
  151. export function canUnloadLLM() {
  152. return true;
  153. }