小编Aad*_*rni的帖子

Starcoder 微调 - 如何选择 GPU 以及如何估计微调所需的时间

我想在我的数据集和 GCP VM 实例上微调 Starcoder ( https://huggingface.co/bigcode/starcoder )。

文档中称,为了训练模型,他们使用了 512 个 Tesla A100 GPU,花了 24 天。

我还在 HuggingFace 的文件部分中看到了模型(.bin)文件(https://huggingface.co/bigcode/starcoder/tree/main

模型总大小约为64GB

根据所有这些信息,

  1. 如何确定哪个 GPU 最适合对我的数据集进行微调?
  2. 如何估计finetune 需要的时间?(例如,基于 epoch=1 等参数的假设)
  3. 选择硬件/计算时间是否考虑其他因素?

deep-learning language-model pytorch huggingface large-language-model

6
推荐指数
0
解决办法
587
查看次数

如何在自己的代码库上微调 LLM 模型?

我有 10 个 Javascript (VueJS) 代码存储库(每个存储库对应 1 个主题)

我想在这 10 个代码存储库上训练一个 LLM 模型,以便我可以使用提示生成新主题。

LLM模型以10个代码存储库的上下文为参考(因为所有存储库的文件结构都是相似的)

我是法学硕士和机器学习的初学者。

如何在我自己的代码库上微调 LLM 模型?

code-generation huggingface large-language-model

5
推荐指数
1
解决办法
1154
查看次数