

本博客介紹了五個基本概念,闡述了大語言模型如何處理上下文窗口中的輸入。通過明確的例子和實踐中獲得的見解,本文介紹了多個與上下文窗口有關的基本概念,如詞元化、序列長度和注意力等。本文的目標是幫助讀者深入了解 AI 應用程序中的上下文如何影響模型行為。我們還通過用于評估系統行為的分析模型展示了相關結果,以演示當改變輸入和輸出序列長度時,對應的響應時間如何改變。演示結果表明,解碼更長的輸出需要花費更多時間。這意味著,在執行大規模高效推理時,HBM 等高速內存系統至關重要。對于正在使用或設計生成式 AI 系統提示詞的人,這些概念都非常有幫助。
了解詳情
https://www.micron.com/educatorhub
https://www.micron.com/educatorhub/courses/what-does-it-mean-for-ai-to-know-something
https://www.micron.com/hbm3e
1 https://lunary.ai/openai-tokenizer
2 https://cs.stanford.edu/~nfliu/papers/lost-in-the-middle.arxiv2023.pdf
3 https://docs.nvidia.com/nim/benchmarking/llm/latest/metrics.html
技術貢獻者
Felippe Vieira Zacarias
系統性能工程師
Shanya Chaubey
生態系統開發經理
本文作者

Evelyn Grevelink
內容戰略營銷負責人



