LongLLaMA es un modelo de lenguaje de gran tamaño diseñado para gestionar contextos de texto extensos, capaz de procesar hasta 256.000 tokens. Se basa en OpenLLaMA y se optimiza mediante el método Focused Transformer (FoT). El repositorio ofrece una variante base 3B más pequeña de LongLLaMA con licencia Apache 2.0 para su uso en implementaciones existentes. Además, proporciona código para el ajuste de instrucciones y el preentrenamiento continuo de FoT. La principal innovación de LongLLaMA reside en su capacidad para gestionar contextos con una duración significativamente mayor que la de sus datos de entrenamiento, lo que lo hace útil para tareas que requieren una comprensión exhaustiva del contexto. Incluye herramientas para una fácil integración con Hugging Face para tareas de procesamiento del lenguaje natural.
Cargando contenido...
