Skip to content

Commit 5c1aec3

Browse files
Yihukimergify[bot]
andauthored
Reduce memory usage for granite_speech. (#42933)
Signed-off-by: Yihuki <wangbovbvb@gmail.com> Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
1 parent 0c942c6 commit 5c1aec3

1 file changed

Lines changed: 1 addition & 3 deletions

File tree

‎vllm/model_executor/models/granite_speech.py‎

Lines changed: 1 addition & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -389,10 +389,8 @@ def forward(
389389
# shaw's relative positional embedding
390390
dist = attention_dists.to(hidden_states.device)
391391
rel_pos_emb = self.rel_pos_emb(dist)
392-
rel_pos_emb_expanded = rel_pos_emb.view([1, 1, 1] + list(rel_pos_emb.shape))
393392
pos_attn = (
394-
torch.sum(query_states.unsqueeze(-2) * rel_pos_emb_expanded, dim=-1)
395-
* self.scale
393+
torch.einsum("bnhid,ijd->bnhij", query_states, rel_pos_emb) * self.scale
396394
)
397395

398396
if remainder > 0:

0 commit comments

Comments
 (0)