Large Language Models
160 views
QLoRA
Quick Definition
Combining 4-bit quantization with LoRA for efficiency
Full Definition
Combining 4-bit quantization with LoRA for memory-efficient fine-tuning of large models.
Examples
consumer GPU fine-tuning, large model adaptation
Related Terms
lora
quantization
fine-tuning
More Large Language Models Terms
Training LLM
Adjusting parameters on large datasets to learn language
KV Cache
Memory optimization storing key-values for faster generation
PEFT
Fine-tuning methods updating only small parameter subsets
Flash Attention
Memory-efficient attention using GPU SRAM block computation
Structured Output
Generating LLM responses in predefined machine-readable formats
Streaming
Sending LLM tokens to clients as they are generated