量化,也是大型语言模型 (LLM) 和生成式 KI 模型的简化设计,是完全符合质量要求的。 Jüngste Ungetüme wie Kimi K3 mit 2,8 Billionen 参数 werden ger nicht mit mehr als 4 bit Ausgeleifert, und auch ein gooter tail des Training hat scan mit 4 bit Staatgefunden.使用 32 位 Gleitkommazahlen 进行培训,然后使用 FP16-Gewichte。 Übliche Quantisierungsziele sind FP8,还有 Gleitkommazahlen mit 8 Bit Ausgaard 和 Q4,还有 4-Bit-Formate,无论是 Integerwerten speichern 还是 neue Gleitkommaformate wie NVFP4 (NviderFPoder) Dankenswerterweise 镀金 Faustregel:Je größer das模型(Anzahl 参数)是答案质量的量化指标。虽然 Modellen 带有 8 bis 12 Milliarden 参数在 Qualitätseinbußen noch deutlich pürbar sind 中,但在 100B-Liga 中失败了(B steht für das englische Billion,也称为 Milliarden)%sehr schon a Spätestens bei Modellen mit 300B und dauber (zB DeepSeek v4 Flash)或 Qwen 3.5 397B) 减少 4 位 Antwortqualität nicht mehr 的量化。
未来的日子
一般镀金啤酒,在定量分析中都采用质量分析,所有这些都是在特殊杂货店模型中进行的。此外,硬件也很合理,在 FP16-Genauigkeit 的模型中,它是最重要的。 Der Speicher ist der Limitierende Factor。例如,图形中的 12 GB VRAM,因此是带有 6B 参数的模型(FP16 = 2 字节专业参数)。此外,还可以访问 KV-Cache 的 Platz。现实的信德也是 4B-Modelle。坚果 4 位量化,可以使用 20B-Klasse 的大模型,该模型是 GPT-OSS 20B 或新的 AMD Instella 16B A3B。
线下钻头:钻头网和盆景
现在,在 Gespräch 中进行量化,然后将每个参数设置为 4 位。原则上Das ist nichts Neues。因此,Microsoft 将于 2025 年 4 月发布 BitNet b1.58 für Aufsehen,并发布 Nur 1,58 Bit pro Parameter auskommt。 Der schräge Wert ergibt sich aus der Mischkalkulation,wo viele 参数 verstächt nur mit mit 0 oder 1,也 einem Bit gefertig werden,manche Andere aber mit bis zu zu 4 Bit。
哎呀,姑娘们,战争范泽滕温德死了。然后炒作逐渐消退,4 位量化标准诞生了(etwa wenn man sich über ollama oder LM Studio ein Modell aus dem Katalog Lädt)。启动 Prism ML 的Jetzt,在 Qwen 3.6 中的 27B-Modell,在 Nemotron 3 Ultra (550B) erreicht 的快速模具质量基准测试中,durchauGfantisier Bonsai heiß die Modellfamilie 和 Soll 至少需要 4 GByte RAM。 Handy 和 Rechner 的 GPU 也可以使用 Nutzbar。为此,您需要 llama.cpp 的改编变体,einer gängigen Laufzeitumgebung für LLM-Inferencing。在测试中,Ubuntu konnte der Autor dieses Artikels mit der“Ternary”-Variante,die im Schnitt mit 1,7 Bit pro Gewicht auskommt und 7,2 GByte groß ist (Stat 54 Gbit in FP160 Super 4 Mitie RTX), 12 GB VRAM 50 Token per Seconde Generien. Das ist mehr al passabel。 Ab 30 Token per Sekunde (T/s) wirkt ein interaktiver Chat-Betrieb verzögerungsfrei, weil man nicht schneller lesen kann alsgeneriert wird.我的“推理”方式是,作为内部 Gebrach produziert 的模型最初令牌,最终 Antwort 和 Benatzer Geht,haben sich 60 t/s als akzeptabel establiert。 Das Bedutet 还为 den Nutzer(Ven Das Model 1000 思维令牌生成器)实现了 17 秒的 wartegeit。
Die Antwortqualität war dabei inhaltlich gut, allerdings von der sprachlichen Korrektheit im Deutschen sehr zweifelhaft. Wierd das Originalmodell trotz chinesische Wurzeln keinerlei Probleme mit deutscher Rechtschreibung, Wortwahl und Grammatik Hat, fiel Bonsai 27B durch kreative Wortneuschöpfungen und Rechtzhtschreibusen Hastier)。
Mobil 和 Auf der CPU:Noch ein Geduldspiel
未来的日子
使用 Asus Zenfone 9 进行智能手机测试,配备 8 GByte RAM 和应用程序“LLM AI server with llama.cpp”zum Einsatz。 Dart lassen sich 舒适的模型是拥抱脸这样的,hereenterladen 和 uber ein web-ui im 浏览器直接 verwenden。 Die App Misst Die Geschwindigkeit Nicht。 Gefühlt waren es allerdings rund 2 T/s。 Das einderte sich auch bei einem Wechsel von 27B- auf 8B- 或 4B-Varianten nicht grundlegend。
类似于 gilt für den CPU-Betrieb。 Ein flutter Intel Core i7-14700K mit 20 Kernen / 28 Threads erreichte nur 2 bis 3 T/s,是 nicht wirklich praktikabel ist。在 Schüblade 中,“网络展示实际应用中的细节”是 Kolibri einjuordnen:der Hersteller der Eigenen LLM-Laufzeitumgebung verspricht Ein stark quantisiertes GLM 5.4B ganz ohne GPU mit Nur 32 GByte RAM Laff zu Machen。 Das schint nach berichten im internet auch zu funktionieren. Allerdings mit 0,3 token pro secondarye, wen man ein schnelle SSD hat.对于 1000 个推理令牌 aus dem vorigen bisspiel wartet man 也快速 ein stunde。
(河粉)








Leave a Reply