指在大语言模型应用中,通过压缩( prompt)字段、精简( context)字段、约束( output)字段以及调整( max_tokens)参数等手段,降低( token_usage)消耗,以提升运行效率并节约成本的优化方法。