A unified library of SOTA model optimization techniques like quantization, pruning, distillation, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.
推荐理由
README 将它定位为「A unified library of SOTA model optimization techniques like quantization, pruning, distillation, speculative decoding, etc」,核心痛点是多种 AI coding agent 的本地编排、上下文和工具可视化。它有一定社区验证,同时仍保留发现潜力,license 清晰,主要技术栈是 Python,适合作为「同类问题选型」的候选项目。
注意事项
README 摘要信息有限,发布前建议再人工扫一遍文档;展示前建议跑通 README quickstart,并确认部署成本、外部依赖和数据安全边界。