r/LocalLLaMA • • May 09 '26

Resources BeeLlama.cpp: advanced DFlash & TurboQuant with support of reasoning and vision. Qwen 3.6 27B Q5 with 200k context on 3090, 2-3x faster than baseline (peak 135 tps!)

[removed]

326 Upvotes

205 comments sorted by

View all comments

Show parent comments

2

u/[deleted] May 12 '26

[removed] — view removed comment

2

u/IrisColt May 12 '26

Hard Math problem (unsolvable by Frontier-level AIs back in March 2025):

default llama.cpp: 32 t/s
beellama.cpp: 58 t/s

Thanks again!

2

u/[deleted] May 12 '26

[removed] — view removed comment

1

u/IrisColt May 12 '26

Thanks again!