כשאנחנו מפעילים סוכני AI, שיחות בעלות קונטקסט רחב נתקלות בחומת זיכרון – מצב שבו זיכרון ה-GPU הופך לצוואר בקבוק ומגביל את נפח החישוב. זה נכון במיוחד בשיחות שנמשכות שבוע, לדוגמה, במהלכן אנחנו עוזבים וחוזרים ומערבבים פרומפטים בנושאים אחרים. אז איך אפשר לשפר את יכולת ניצול הזיכרון והאחסון של מודלי שפה, בלי לגעת בחומרה? על זה […]

קרא את הכתבה המלאה במקור