LLVM 24.0.0git
X86InstrInfo.cpp
Go to the documentation of this file.
1//===-- X86InstrInfo.cpp - X86 Instruction Information --------------------===//
2//
3// Part of the LLVM Project, under the Apache License v2.0 with LLVM Exceptions.
4// See https://llvm.org/LICENSE.txt for license information.
5// SPDX-License-Identifier: Apache-2.0 WITH LLVM-exception
6//
7//===----------------------------------------------------------------------===//
8//
9// This file contains the X86 implementation of the TargetInstrInfo class.
10//
11//===----------------------------------------------------------------------===//
12
13#include "X86InstrInfo.h"
14#include "X86.h"
15#include "X86InstrBuilder.h"
16#include "X86InstrFoldTables.h"
18#include "X86Subtarget.h"
19#include "X86TargetMachine.h"
20#include "llvm/ADT/STLExtras.h"
21#include "llvm/ADT/Sequence.h"
34#include "llvm/IR/Function.h"
35#include "llvm/IR/InstrTypes.h"
36#include "llvm/IR/Module.h"
37#include "llvm/MC/MCAsmInfo.h"
38#include "llvm/MC/MCExpr.h"
39#include "llvm/MC/MCInst.h"
41#include "llvm/Support/Debug.h"
46#include <optional>
47
48using namespace llvm;
49
50#define DEBUG_TYPE "x86-instr-info"
51
52#define GET_INSTRINFO_CTOR_DTOR
53#include "X86GenInstrInfo.inc"
54
56
57static cl::opt<bool>
58 NoFusing("disable-spill-fusing",
59 cl::desc("Disable fusing of spill code into instructions"),
61static cl::opt<bool>
62 PrintFailedFusing("print-failed-fuse-candidates",
63 cl::desc("Print instructions that the allocator wants to"
64 " fuse, but the X86 backend currently can't"),
66static cl::opt<bool>
67 ReMatPICStubLoad("remat-pic-stub-load",
68 cl::desc("Re-materialize load from stub in PIC mode"),
69 cl::init(false), cl::Hidden);
71 PartialRegUpdateClearance("partial-reg-update-clearance",
72 cl::desc("Clearance between two register writes "
73 "for inserting XOR to avoid partial "
74 "register update"),
75 cl::init(64), cl::Hidden);
77 "undef-reg-clearance",
78 cl::desc("How many idle instructions we would like before "
79 "certain undef register reads"),
80 cl::init(128), cl::Hidden);
81
83 "x86-max-nf-conversions-for-cmp-reuse",
84 cl::desc("Maximum number of NF conversions allowed to reuse EFLAGS from a "
85 "producer dominating a multi-predecessor block"),
87
88// Pin the vtable to this file.
89void X86InstrInfo::anchor() {}
90
92 : X86GenInstrInfo(STI, RI,
93 (STI.isTarget64BitLP64() ? X86::ADJCALLSTACKDOWN64
94 : X86::ADJCALLSTACKDOWN32),
95 (STI.isTarget64BitLP64() ? X86::ADJCALLSTACKUP64
96 : X86::ADJCALLSTACKUP32),
97 X86::CATCHRET, (STI.is64Bit() ? X86::RET64 : X86::RET32)),
98 Subtarget(STI), RI(STI.getTargetTriple()) {}
99
101 unsigned OpNum) const {
102 auto *RC = TargetInstrInfo::getRegClass(MCID, OpNum);
103 // If the target does not have egpr, then r16-r31 will be resereved for all
104 // instructions.
105 if (!RC || !Subtarget.hasEGPR())
106 return RC;
107
109 return RC;
110
111 const X86RegisterInfo *RI = Subtarget.getRegisterInfo();
112 return RI->constrainRegClassToNonRex2(RC);
113}
114
117 if (Subtarget.isTarget64BitLP64())
118 return &X86::GR64RegClass;
119 // If the target is 64bit but we have been told to use 32bit addresses, we can
120 // still use 64-bit register as long as we know the high bits are zeros.
121 // Reflect that in the returned register class.
122 return Subtarget.is64Bit() ? &X86::LOW32_ADDR_ACCESSRegClass
123 : &X86::GR32RegClass;
124}
125
127 Register &SrcReg, Register &DstReg,
128 unsigned &SubIdx) const {
129 switch (MI.getOpcode()) {
130 default:
131 break;
132 case X86::MOVSX16rr8:
133 case X86::MOVZX16rr8:
134 case X86::MOVSX32rr8:
135 case X86::MOVZX32rr8:
136 case X86::MOVSX64rr8:
137 if (!Subtarget.is64Bit())
138 // It's not always legal to reference the low 8-bit of the larger
139 // register in 32-bit mode.
140 return false;
141 [[fallthrough]];
142 case X86::MOVSX32rr16:
143 case X86::MOVZX32rr16:
144 case X86::MOVSX64rr16:
145 case X86::MOVSX64rr32: {
146 if (MI.getOperand(0).getSubReg() || MI.getOperand(1).getSubReg())
147 // Be conservative.
148 return false;
149 SrcReg = MI.getOperand(1).getReg();
150 DstReg = MI.getOperand(0).getReg();
151 switch (MI.getOpcode()) {
152 default:
153 llvm_unreachable("Unreachable!");
154 case X86::MOVSX16rr8:
155 case X86::MOVZX16rr8:
156 case X86::MOVSX32rr8:
157 case X86::MOVZX32rr8:
158 case X86::MOVSX64rr8:
159 SubIdx = X86::sub_8bit;
160 break;
161 case X86::MOVSX32rr16:
162 case X86::MOVZX32rr16:
163 case X86::MOVSX64rr16:
164 SubIdx = X86::sub_16bit;
165 break;
166 case X86::MOVSX64rr32:
167 SubIdx = X86::sub_32bit;
168 break;
169 }
170 return true;
171 }
172 }
173 return false;
174}
175
177 if (MI.mayLoad() || MI.mayStore())
178 return false;
179
180 // Some target-independent operations that trivially lower to data-invariant
181 // instructions.
182 if (MI.isCopyLike() || MI.isInsertSubreg())
183 return true;
184
185 unsigned Opcode = MI.getOpcode();
186 using namespace X86;
187 // On x86 it is believed that imul is constant time w.r.t. the loaded data.
188 // However, they set flags and are perhaps the most surprisingly constant
189 // time operations so we call them out here separately.
190 if (isIMUL(Opcode))
191 return true;
192 // Bit scanning and counting instructions that are somewhat surprisingly
193 // constant time as they scan across bits and do other fairly complex
194 // operations like popcnt, but are believed to be constant time on x86.
195 // However, these set flags.
196 if (isBSF(Opcode) || isBSR(Opcode) || isLZCNT(Opcode) || isPOPCNT(Opcode) ||
197 isTZCNT(Opcode))
198 return true;
199 // Bit manipulation instructions are effectively combinations of basic
200 // arithmetic ops, and should still execute in constant time. These also
201 // set flags.
202 if (isBLCFILL(Opcode) || isBLCI(Opcode) || isBLCIC(Opcode) ||
203 isBLCMSK(Opcode) || isBLCS(Opcode) || isBLSFILL(Opcode) ||
204 isBLSI(Opcode) || isBLSIC(Opcode) || isBLSMSK(Opcode) || isBLSR(Opcode) ||
205 isTZMSK(Opcode))
206 return true;
207 // Bit extracting and clearing instructions should execute in constant time,
208 // and set flags.
209 if (isBEXTR(Opcode) || isBZHI(Opcode))
210 return true;
211 // Shift and rotate.
212 if (isROL(Opcode) || isROR(Opcode) || isSAR(Opcode) || isSHL(Opcode) ||
213 isSHR(Opcode) || isSHLD(Opcode) || isSHRD(Opcode))
214 return true;
215 // Basic arithmetic is constant time on the input but does set flags.
216 if (isADC(Opcode) || isADD(Opcode) || isAND(Opcode) || isOR(Opcode) ||
217 isSBB(Opcode) || isSUB(Opcode) || isXOR(Opcode))
218 return true;
219 // Arithmetic with just 32-bit and 64-bit variants and no immediates.
220 if (isANDN(Opcode))
221 return true;
222 // Unary arithmetic operations.
223 if (isDEC(Opcode) || isINC(Opcode) || isNEG(Opcode))
224 return true;
225 // Unlike other arithmetic, NOT doesn't set EFLAGS.
226 if (isNOT(Opcode))
227 return true;
228 // Various move instructions used to zero or sign extend things. Note that we
229 // intentionally don't support the _NOREX variants as we can't handle that
230 // register constraint anyways.
231 if (isMOVSX(Opcode) || isMOVZX(Opcode) || isMOVSXD(Opcode) || isMOV(Opcode))
232 return true;
233 // Arithmetic instructions that are both constant time and don't set flags.
234 if (isRORX(Opcode) || isSARX(Opcode) || isSHLX(Opcode) || isSHRX(Opcode))
235 return true;
236 // LEA doesn't actually access memory, and its arithmetic is constant time.
237 if (isLEA(Opcode))
238 return true;
239 // By default, assume that the instruction is not data invariant.
240 return false;
241}
242
244 switch (MI.getOpcode()) {
245 default:
246 // By default, assume that the load will immediately leak.
247 return false;
248
249 // On x86 it is believed that imul is constant time w.r.t. the loaded data.
250 // However, they set flags and are perhaps the most surprisingly constant
251 // time operations so we call them out here separately.
252 case X86::IMUL16rm:
253 case X86::IMUL16rmi:
254 case X86::IMUL32rm:
255 case X86::IMUL32rmi:
256 case X86::IMUL64rm:
257 case X86::IMUL64rmi32:
258
259 // Bit scanning and counting instructions that are somewhat surprisingly
260 // constant time as they scan across bits and do other fairly complex
261 // operations like popcnt, but are believed to be constant time on x86.
262 // However, these set flags.
263 case X86::BSF16rm:
264 case X86::BSF32rm:
265 case X86::BSF64rm:
266 case X86::BSR16rm:
267 case X86::BSR32rm:
268 case X86::BSR64rm:
269 case X86::LZCNT16rm:
270 case X86::LZCNT32rm:
271 case X86::LZCNT64rm:
272 case X86::POPCNT16rm:
273 case X86::POPCNT32rm:
274 case X86::POPCNT64rm:
275 case X86::TZCNT16rm:
276 case X86::TZCNT32rm:
277 case X86::TZCNT64rm:
278
279 // Bit manipulation instructions are effectively combinations of basic
280 // arithmetic ops, and should still execute in constant time. These also
281 // set flags.
282 case X86::BLCFILL32rm:
283 case X86::BLCFILL64rm:
284 case X86::BLCI32rm:
285 case X86::BLCI64rm:
286 case X86::BLCIC32rm:
287 case X86::BLCIC64rm:
288 case X86::BLCMSK32rm:
289 case X86::BLCMSK64rm:
290 case X86::BLCS32rm:
291 case X86::BLCS64rm:
292 case X86::BLSFILL32rm:
293 case X86::BLSFILL64rm:
294 case X86::BLSI32rm:
295 case X86::BLSI64rm:
296 case X86::BLSIC32rm:
297 case X86::BLSIC64rm:
298 case X86::BLSMSK32rm:
299 case X86::BLSMSK64rm:
300 case X86::BLSR32rm:
301 case X86::BLSR64rm:
302 case X86::TZMSK32rm:
303 case X86::TZMSK64rm:
304
305 // Bit extracting and clearing instructions should execute in constant time,
306 // and set flags.
307 case X86::BEXTR32rm:
308 case X86::BEXTR64rm:
309 case X86::BEXTRI32mi:
310 case X86::BEXTRI64mi:
311 case X86::BZHI32rm:
312 case X86::BZHI64rm:
313
314 // Basic arithmetic is constant time on the input but does set flags.
315 case X86::ADC8rm:
316 case X86::ADC16rm:
317 case X86::ADC32rm:
318 case X86::ADC64rm:
319 case X86::ADD8rm:
320 case X86::ADD16rm:
321 case X86::ADD32rm:
322 case X86::ADD64rm:
323 case X86::AND8rm:
324 case X86::AND16rm:
325 case X86::AND32rm:
326 case X86::AND64rm:
327 case X86::ANDN32rm:
328 case X86::ANDN64rm:
329 case X86::OR8rm:
330 case X86::OR16rm:
331 case X86::OR32rm:
332 case X86::OR64rm:
333 case X86::SBB8rm:
334 case X86::SBB16rm:
335 case X86::SBB32rm:
336 case X86::SBB64rm:
337 case X86::SUB8rm:
338 case X86::SUB16rm:
339 case X86::SUB32rm:
340 case X86::SUB64rm:
341 case X86::XOR8rm:
342 case X86::XOR16rm:
343 case X86::XOR32rm:
344 case X86::XOR64rm:
345
346 // Integer multiply w/o affecting flags is still believed to be constant
347 // time on x86. Called out separately as this is among the most surprising
348 // instructions to exhibit that behavior.
349 case X86::MULX32rm:
350 case X86::MULX64rm:
351
352 // Arithmetic instructions that are both constant time and don't set flags.
353 case X86::RORX32mi:
354 case X86::RORX64mi:
355 case X86::SARX32rm:
356 case X86::SARX64rm:
357 case X86::SHLX32rm:
358 case X86::SHLX64rm:
359 case X86::SHRX32rm:
360 case X86::SHRX64rm:
361
362 // Conversions are believed to be constant time and don't set flags.
363 case X86::CVTTSD2SI64rm:
364 case X86::VCVTTSD2SI64rm:
365 case X86::VCVTTSD2SI64Zrm:
366 case X86::CVTTSD2SIrm:
367 case X86::VCVTTSD2SIrm:
368 case X86::VCVTTSD2SIZrm:
369 case X86::CVTTSS2SI64rm:
370 case X86::VCVTTSS2SI64rm:
371 case X86::VCVTTSS2SI64Zrm:
372 case X86::CVTTSS2SIrm:
373 case X86::VCVTTSS2SIrm:
374 case X86::VCVTTSS2SIZrm:
375 case X86::CVTSI2SDrm:
376 case X86::VCVTSI2SDrm:
377 case X86::VCVTSI2SDZrm:
378 case X86::CVTSI2SSrm:
379 case X86::VCVTSI2SSrm:
380 case X86::VCVTSI2SSZrm:
381 case X86::CVTSI642SDrm:
382 case X86::VCVTSI642SDrm:
383 case X86::VCVTSI642SDZrm:
384 case X86::CVTSI642SSrm:
385 case X86::VCVTSI642SSrm:
386 case X86::VCVTSI642SSZrm:
387 case X86::CVTSS2SDrm:
388 case X86::VCVTSS2SDrm:
389 case X86::VCVTSS2SDZrm:
390 case X86::CVTSD2SSrm:
391 case X86::VCVTSD2SSrm:
392 case X86::VCVTSD2SSZrm:
393 // AVX512 added unsigned integer conversions.
394 case X86::VCVTTSD2USI64Zrm:
395 case X86::VCVTTSD2USIZrm:
396 case X86::VCVTTSS2USI64Zrm:
397 case X86::VCVTTSS2USIZrm:
398 case X86::VCVTUSI2SDZrm:
399 case X86::VCVTUSI642SDZrm:
400 case X86::VCVTUSI2SSZrm:
401 case X86::VCVTUSI642SSZrm:
402
403 // Loads to register don't set flags.
404 case X86::MOV8rm:
405 case X86::MOV8rm_NOREX:
406 case X86::MOV16rm:
407 case X86::MOV32rm:
408 case X86::MOV64rm:
409 case X86::MOVSX16rm8:
410 case X86::MOVSX32rm16:
411 case X86::MOVSX32rm8:
412 case X86::MOVSX32rm8_NOREX:
413 case X86::MOVSX64rm16:
414 case X86::MOVSX64rm32:
415 case X86::MOVSX64rm8:
416 case X86::MOVZX16rm8:
417 case X86::MOVZX32rm16:
418 case X86::MOVZX32rm8:
419 case X86::MOVZX32rm8_NOREX:
420 case X86::MOVZX64rm16:
421 case X86::MOVZX64rm8:
422 return true;
423 }
424}
425
427 const MachineFunction *MF = MI.getParent()->getParent();
429
430 if (isFrameInstr(MI)) {
431 int SPAdj = alignTo(getFrameSize(MI), TFI->getStackAlign());
432 SPAdj -= getFrameAdjustment(MI);
433 if (!isFrameSetup(MI))
434 SPAdj = -SPAdj;
435 return SPAdj;
436 }
437
438 // To know whether a call adjusts the stack, we need information
439 // that is bound to the following ADJCALLSTACKUP pseudo.
440 // Look for the next ADJCALLSTACKUP that follows the call.
441 if (MI.isCall()) {
442 const MachineBasicBlock *MBB = MI.getParent();
444 for (auto E = MBB->end(); I != E; ++I) {
445 if (I->getOpcode() == getCallFrameDestroyOpcode() || I->isCall())
446 break;
447 }
448
449 // If we could not find a frame destroy opcode, then it has already
450 // been simplified, so we don't care.
451 if (I->getOpcode() != getCallFrameDestroyOpcode())
452 return 0;
453
454 return -(I->getOperand(1).getImm());
455 }
456
457 // Currently handle only PUSHes we can reasonably expect to see
458 // in call sequences
459 switch (MI.getOpcode()) {
460 default:
461 return 0;
462 case X86::PUSH32r:
463 case X86::PUSH32rmm:
464 case X86::PUSH32rmr:
465 case X86::PUSH32i:
466 return 4;
467 case X86::PUSH64r:
468 case X86::PUSH64rmm:
469 case X86::PUSH64rmr:
470 case X86::PUSH64i32:
471 return 8;
472 }
473}
474
475/// Return true and the FrameIndex if the specified
476/// operand and follow operands form a reference to the stack frame.
477bool X86InstrInfo::isFrameOperand(const MachineInstr &MI, unsigned int Op,
478 int &FrameIndex) const {
479 if (MI.getOperand(Op + X86::AddrBaseReg).isFI() &&
480 MI.getOperand(Op + X86::AddrScaleAmt).isImm() &&
481 MI.getOperand(Op + X86::AddrIndexReg).isReg() &&
482 MI.getOperand(Op + X86::AddrDisp).isImm() &&
483 MI.getOperand(Op + X86::AddrScaleAmt).getImm() == 1 &&
484 MI.getOperand(Op + X86::AddrIndexReg).getReg() == 0 &&
485 MI.getOperand(Op + X86::AddrDisp).getImm() == 0) {
486 FrameIndex = MI.getOperand(Op + X86::AddrBaseReg).getIndex();
487 return true;
488 }
489 return false;
490}
491
492static bool isFrameLoadOpcode(int Opcode, TypeSize &MemBytes) {
493 switch (Opcode) {
494 default:
495 return false;
496 case X86::MOV8rm:
497 case X86::KMOVBkm:
498 case X86::KMOVBkm_EVEX:
499 MemBytes = TypeSize::getFixed(1);
500 return true;
501 case X86::MOV16rm:
502 case X86::KMOVWkm:
503 case X86::KMOVWkm_EVEX:
504 case X86::VMOVSHZrm:
505 case X86::VMOVSHZrm_alt:
506 MemBytes = TypeSize::getFixed(2);
507 return true;
508 case X86::MOV32rm:
509 case X86::MOVSSrm:
510 case X86::MOVSSrm_alt:
511 case X86::VMOVSSrm:
512 case X86::VMOVSSrm_alt:
513 case X86::VMOVSSZrm:
514 case X86::VMOVSSZrm_alt:
515 case X86::KMOVDkm:
516 case X86::KMOVDkm_EVEX:
517 MemBytes = TypeSize::getFixed(4);
518 return true;
519 case X86::MOV64rm:
520 case X86::LD_Fp64m:
521 case X86::MOVSDrm:
522 case X86::MOVSDrm_alt:
523 case X86::VMOVSDrm:
524 case X86::VMOVSDrm_alt:
525 case X86::VMOVSDZrm:
526 case X86::VMOVSDZrm_alt:
527 case X86::MMX_MOVD64rm:
528 case X86::MMX_MOVQ64rm:
529 case X86::KMOVQkm:
530 case X86::KMOVQkm_EVEX:
531 MemBytes = TypeSize::getFixed(8);
532 return true;
533 case X86::MOVAPSrm:
534 case X86::MOVUPSrm:
535 case X86::MOVAPDrm:
536 case X86::MOVUPDrm:
537 case X86::MOVDQArm:
538 case X86::MOVDQUrm:
539 case X86::VMOVAPSrm:
540 case X86::VMOVUPSrm:
541 case X86::VMOVAPDrm:
542 case X86::VMOVUPDrm:
543 case X86::VMOVDQArm:
544 case X86::VMOVDQUrm:
545 case X86::VMOVAPSZ128rm:
546 case X86::VMOVUPSZ128rm:
547 case X86::VMOVAPSZ128rm_NOVLX:
548 case X86::VMOVUPSZ128rm_NOVLX:
549 case X86::VMOVAPDZ128rm:
550 case X86::VMOVUPDZ128rm:
551 case X86::VMOVDQU8Z128rm:
552 case X86::VMOVDQU16Z128rm:
553 case X86::VMOVDQA32Z128rm:
554 case X86::VMOVDQU32Z128rm:
555 case X86::VMOVDQA64Z128rm:
556 case X86::VMOVDQU64Z128rm:
557 MemBytes = TypeSize::getFixed(16);
558 return true;
559 case X86::VMOVAPSYrm:
560 case X86::VMOVUPSYrm:
561 case X86::VMOVAPDYrm:
562 case X86::VMOVUPDYrm:
563 case X86::VMOVDQAYrm:
564 case X86::VMOVDQUYrm:
565 case X86::VMOVAPSZ256rm:
566 case X86::VMOVUPSZ256rm:
567 case X86::VMOVAPSZ256rm_NOVLX:
568 case X86::VMOVUPSZ256rm_NOVLX:
569 case X86::VMOVAPDZ256rm:
570 case X86::VMOVUPDZ256rm:
571 case X86::VMOVDQU8Z256rm:
572 case X86::VMOVDQU16Z256rm:
573 case X86::VMOVDQA32Z256rm:
574 case X86::VMOVDQU32Z256rm:
575 case X86::VMOVDQA64Z256rm:
576 case X86::VMOVDQU64Z256rm:
577 MemBytes = TypeSize::getFixed(32);
578 return true;
579 case X86::VMOVAPSZrm:
580 case X86::VMOVUPSZrm:
581 case X86::VMOVAPDZrm:
582 case X86::VMOVUPDZrm:
583 case X86::VMOVDQU8Zrm:
584 case X86::VMOVDQU16Zrm:
585 case X86::VMOVDQA32Zrm:
586 case X86::VMOVDQU32Zrm:
587 case X86::VMOVDQA64Zrm:
588 case X86::VMOVDQU64Zrm:
589 MemBytes = TypeSize::getFixed(64);
590 return true;
591 }
592}
593
594static bool isFrameStoreOpcode(int Opcode, TypeSize &MemBytes) {
595 switch (Opcode) {
596 default:
597 return false;
598 case X86::MOV8mr:
599 case X86::KMOVBmk:
600 case X86::KMOVBmk_EVEX:
601 MemBytes = TypeSize::getFixed(1);
602 return true;
603 case X86::MOV16mr:
604 case X86::KMOVWmk:
605 case X86::KMOVWmk_EVEX:
606 case X86::VMOVSHZmr:
607 MemBytes = TypeSize::getFixed(2);
608 return true;
609 case X86::MOV32mr:
610 case X86::MOVSSmr:
611 case X86::VMOVSSmr:
612 case X86::VMOVSSZmr:
613 case X86::KMOVDmk:
614 case X86::KMOVDmk_EVEX:
615 MemBytes = TypeSize::getFixed(4);
616 return true;
617 case X86::MOV64mr:
618 case X86::ST_FpP64m:
619 case X86::MOVSDmr:
620 case X86::VMOVSDmr:
621 case X86::VMOVSDZmr:
622 case X86::MMX_MOVD64mr:
623 case X86::MMX_MOVQ64mr:
624 case X86::MMX_MOVNTQmr:
625 case X86::KMOVQmk:
626 case X86::KMOVQmk_EVEX:
627 MemBytes = TypeSize::getFixed(8);
628 return true;
629 case X86::MOVAPSmr:
630 case X86::MOVUPSmr:
631 case X86::MOVAPDmr:
632 case X86::MOVUPDmr:
633 case X86::MOVDQAmr:
634 case X86::MOVDQUmr:
635 case X86::VMOVAPSmr:
636 case X86::VMOVUPSmr:
637 case X86::VMOVAPDmr:
638 case X86::VMOVUPDmr:
639 case X86::VMOVDQAmr:
640 case X86::VMOVDQUmr:
641 case X86::VMOVUPSZ128mr:
642 case X86::VMOVAPSZ128mr:
643 case X86::VMOVUPSZ128mr_NOVLX:
644 case X86::VMOVAPSZ128mr_NOVLX:
645 case X86::VMOVUPDZ128mr:
646 case X86::VMOVAPDZ128mr:
647 case X86::VMOVDQA32Z128mr:
648 case X86::VMOVDQU32Z128mr:
649 case X86::VMOVDQA64Z128mr:
650 case X86::VMOVDQU64Z128mr:
651 case X86::VMOVDQU8Z128mr:
652 case X86::VMOVDQU16Z128mr:
653 MemBytes = TypeSize::getFixed(16);
654 return true;
655 case X86::VMOVUPSYmr:
656 case X86::VMOVAPSYmr:
657 case X86::VMOVUPDYmr:
658 case X86::VMOVAPDYmr:
659 case X86::VMOVDQUYmr:
660 case X86::VMOVDQAYmr:
661 case X86::VMOVUPSZ256mr:
662 case X86::VMOVAPSZ256mr:
663 case X86::VMOVUPSZ256mr_NOVLX:
664 case X86::VMOVAPSZ256mr_NOVLX:
665 case X86::VMOVUPDZ256mr:
666 case X86::VMOVAPDZ256mr:
667 case X86::VMOVDQU8Z256mr:
668 case X86::VMOVDQU16Z256mr:
669 case X86::VMOVDQA32Z256mr:
670 case X86::VMOVDQU32Z256mr:
671 case X86::VMOVDQA64Z256mr:
672 case X86::VMOVDQU64Z256mr:
673 MemBytes = TypeSize::getFixed(32);
674 return true;
675 case X86::VMOVUPSZmr:
676 case X86::VMOVAPSZmr:
677 case X86::VMOVUPDZmr:
678 case X86::VMOVAPDZmr:
679 case X86::VMOVDQU8Zmr:
680 case X86::VMOVDQU16Zmr:
681 case X86::VMOVDQA32Zmr:
682 case X86::VMOVDQU32Zmr:
683 case X86::VMOVDQA64Zmr:
684 case X86::VMOVDQU64Zmr:
685 MemBytes = TypeSize::getFixed(64);
686 return true;
687 }
688 return false;
689}
690
692 int &FrameIndex) const {
693 TypeSize Dummy = TypeSize::getZero();
694 return X86InstrInfo::isLoadFromStackSlot(MI, FrameIndex, Dummy);
695}
696
698 int &FrameIndex,
699 TypeSize &MemBytes) const {
700 if (isFrameLoadOpcode(MI.getOpcode(), MemBytes))
701 if (MI.getOperand(0).getSubReg() == 0 && isFrameOperand(MI, 1, FrameIndex))
702 return MI.getOperand(0).getReg();
703 return Register();
704}
705
707 int &FrameIndex) const {
708 TypeSize Dummy = TypeSize::getZero();
709 if (isFrameLoadOpcode(MI.getOpcode(), Dummy)) {
710 if (Register Reg = isLoadFromStackSlot(MI, FrameIndex))
711 return Reg;
712 // Check for post-frame index elimination operations
714 if (hasLoadFromStackSlot(MI, Accesses)) {
715 FrameIndex =
716 cast<FixedStackPseudoSourceValue>(Accesses.front()->getPseudoValue())
717 ->getFrameIndex();
718 return MI.getOperand(0).getReg();
719 }
720 }
721 return Register();
722}
723
725 int &FrameIndex) const {
726 TypeSize Dummy = TypeSize::getZero();
727 return X86InstrInfo::isStoreToStackSlot(MI, FrameIndex, Dummy);
728}
729
731 int &FrameIndex,
732 TypeSize &MemBytes) const {
733 if (isFrameStoreOpcode(MI.getOpcode(), MemBytes))
734 if (MI.getOperand(X86::AddrNumOperands).getSubReg() == 0 &&
735 isFrameOperand(MI, 0, FrameIndex))
736 return MI.getOperand(X86::AddrNumOperands).getReg();
737 return Register();
738}
739
741 int &FrameIndex) const {
742 TypeSize Dummy = TypeSize::getZero();
743 if (isFrameStoreOpcode(MI.getOpcode(), Dummy)) {
744 if (Register Reg = isStoreToStackSlot(MI, FrameIndex))
745 return Reg;
746 // Check for post-frame index elimination operations
748 if (hasStoreToStackSlot(MI, Accesses)) {
749 FrameIndex =
750 cast<FixedStackPseudoSourceValue>(Accesses.front()->getPseudoValue())
751 ->getFrameIndex();
752 return MI.getOperand(X86::AddrNumOperands).getReg();
753 }
754 }
755 return Register();
756}
757
758/// Return true if register is PIC base; i.e.g defined by X86::MOVPC32r.
759static bool regIsPICBase(Register BaseReg, const MachineRegisterInfo &MRI) {
760 // Don't waste compile time scanning use-def chains of physregs.
761 if (!BaseReg.isVirtual())
762 return false;
763 bool isPICBase = false;
764 for (const MachineInstr &DefMI : MRI.def_instructions(BaseReg)) {
765 if (DefMI.getOpcode() != X86::MOVPC32r)
766 return false;
767 assert(!isPICBase && "More than one PIC base?");
768 isPICBase = true;
769 }
770 return isPICBase;
771}
772
774 const MachineInstr &MI) const {
775 switch (MI.getOpcode()) {
776 default:
777 // This function should only be called for opcodes with the ReMaterializable
778 // flag set.
779 llvm_unreachable("Unknown rematerializable operation!");
780 break;
781 case X86::IMPLICIT_DEF:
782 // Defer to generic logic.
783 break;
784 case X86::LOAD_STACK_GUARD:
785 case X86::LD_Fp032:
786 case X86::LD_Fp064:
787 case X86::LD_Fp080:
788 case X86::LD_Fp132:
789 case X86::LD_Fp164:
790 case X86::LD_Fp180:
791 case X86::AVX1_SETALLONES:
792 case X86::AVX2_SETALLONES:
793 case X86::AVX512_128_SET0:
794 case X86::AVX512_128_SETALLONES:
795 case X86::AVX512_256_SETALLONES:
796 case X86::AVX512_512_SETALLONES:
797 case X86::AVX512_FsFLD0SD:
798 case X86::AVX512_FsFLD0SH:
799 case X86::AVX512_FsFLD0SS:
800 case X86::AVX512_FsFLD0F128:
801 case X86::FsFLD0SD:
802 case X86::FsFLD0SS:
803 case X86::FsFLD0SH:
804 case X86::FsFLD0F128:
805 case X86::KSET0B:
806 case X86::KSET0D:
807 case X86::KSET0Q:
808 case X86::KSET0W:
809 case X86::KSET1B:
810 case X86::KSET1D:
811 case X86::KSET1Q:
812 case X86::KSET1W:
813 case X86::MMX_SET0:
814 case X86::MOV32ImmSExti8:
815 case X86::MOV32r0:
816 case X86::MOV32r1:
817 case X86::MOV32r_1:
818 case X86::MOV32ri64:
819 case X86::MOV64ImmSExti8:
820 case X86::V_SET0:
821 case X86::V_SETALLONES:
822 case X86::MOV16ri:
823 case X86::MOV32ri:
824 case X86::MOV64ri:
825 case X86::MOV64ri32:
826 case X86::MOV8ri:
827 case X86::PTILEZEROV:
828 return true;
829
830 case X86::MOV8rm:
831 case X86::MOV8rm_NOREX:
832 case X86::MOV16rm:
833 case X86::MOV32rm:
834 case X86::MOV64rm:
835 case X86::MOVSSrm:
836 case X86::MOVSSrm_alt:
837 case X86::MOVSDrm:
838 case X86::MOVSDrm_alt:
839 case X86::MOVAPSrm:
840 case X86::MOVUPSrm:
841 case X86::MOVAPDrm:
842 case X86::MOVUPDrm:
843 case X86::MOVDQArm:
844 case X86::MOVDQUrm:
845 case X86::VMOVSSrm:
846 case X86::VMOVSSrm_alt:
847 case X86::VMOVSDrm:
848 case X86::VMOVSDrm_alt:
849 case X86::VMOVAPSrm:
850 case X86::VMOVUPSrm:
851 case X86::VMOVAPDrm:
852 case X86::VMOVUPDrm:
853 case X86::VMOVDQArm:
854 case X86::VMOVDQUrm:
855 case X86::VMOVAPSYrm:
856 case X86::VMOVUPSYrm:
857 case X86::VMOVAPDYrm:
858 case X86::VMOVUPDYrm:
859 case X86::VMOVDQAYrm:
860 case X86::VMOVDQUYrm:
861 case X86::MMX_MOVD64rm:
862 case X86::MMX_MOVQ64rm:
863 case X86::VBROADCASTSSrm:
864 case X86::VBROADCASTSSYrm:
865 case X86::VBROADCASTSDYrm:
866 // AVX-512
867 case X86::VPBROADCASTBZ128rm:
868 case X86::VPBROADCASTBZ256rm:
869 case X86::VPBROADCASTBZrm:
870 case X86::VBROADCASTF32X2Z256rm:
871 case X86::VBROADCASTF32X2Zrm:
872 case X86::VBROADCASTI32X2Z128rm:
873 case X86::VBROADCASTI32X2Z256rm:
874 case X86::VBROADCASTI32X2Zrm:
875 case X86::VPBROADCASTWZ128rm:
876 case X86::VPBROADCASTWZ256rm:
877 case X86::VPBROADCASTWZrm:
878 case X86::VPBROADCASTDZ128rm:
879 case X86::VPBROADCASTDZ256rm:
880 case X86::VPBROADCASTDZrm:
881 case X86::VBROADCASTSSZ128rm:
882 case X86::VBROADCASTSSZ256rm:
883 case X86::VBROADCASTSSZrm:
884 case X86::VPBROADCASTQZ128rm:
885 case X86::VPBROADCASTQZ256rm:
886 case X86::VPBROADCASTQZrm:
887 case X86::VBROADCASTSDZ256rm:
888 case X86::VBROADCASTSDZrm:
889 case X86::VMOVSSZrm:
890 case X86::VMOVSSZrm_alt:
891 case X86::VMOVSDZrm:
892 case X86::VMOVSDZrm_alt:
893 case X86::VMOVSHZrm:
894 case X86::VMOVSHZrm_alt:
895 case X86::VMOVAPDZ128rm:
896 case X86::VMOVAPDZ256rm:
897 case X86::VMOVAPDZrm:
898 case X86::VMOVAPSZ128rm:
899 case X86::VMOVAPSZ256rm:
900 case X86::VMOVAPSZ128rm_NOVLX:
901 case X86::VMOVAPSZ256rm_NOVLX:
902 case X86::VMOVAPSZrm:
903 case X86::VMOVDQA32Z128rm:
904 case X86::VMOVDQA32Z256rm:
905 case X86::VMOVDQA32Zrm:
906 case X86::VMOVDQA64Z128rm:
907 case X86::VMOVDQA64Z256rm:
908 case X86::VMOVDQA64Zrm:
909 case X86::VMOVDQU16Z128rm:
910 case X86::VMOVDQU16Z256rm:
911 case X86::VMOVDQU16Zrm:
912 case X86::VMOVDQU32Z128rm:
913 case X86::VMOVDQU32Z256rm:
914 case X86::VMOVDQU32Zrm:
915 case X86::VMOVDQU64Z128rm:
916 case X86::VMOVDQU64Z256rm:
917 case X86::VMOVDQU64Zrm:
918 case X86::VMOVDQU8Z128rm:
919 case X86::VMOVDQU8Z256rm:
920 case X86::VMOVDQU8Zrm:
921 case X86::VMOVUPDZ128rm:
922 case X86::VMOVUPDZ256rm:
923 case X86::VMOVUPDZrm:
924 case X86::VMOVUPSZ128rm:
925 case X86::VMOVUPSZ256rm:
926 case X86::VMOVUPSZ128rm_NOVLX:
927 case X86::VMOVUPSZ256rm_NOVLX:
928 case X86::VMOVUPSZrm: {
929 // Loads from constant pools are trivially rematerializable.
930 if (MI.getOperand(1 + X86::AddrBaseReg).isReg() &&
931 MI.getOperand(1 + X86::AddrScaleAmt).isImm() &&
932 MI.getOperand(1 + X86::AddrIndexReg).isReg() &&
933 MI.getOperand(1 + X86::AddrIndexReg).getReg() == 0 &&
934 MI.isDereferenceableInvariantLoad()) {
935 Register BaseReg = MI.getOperand(1 + X86::AddrBaseReg).getReg();
936 if (BaseReg == 0 || BaseReg == X86::RIP)
937 return true;
938 // Allow re-materialization of PIC load.
939 if (!(!ReMatPICStubLoad && MI.getOperand(1 + X86::AddrDisp).isGlobal())) {
940 const MachineFunction &MF = *MI.getParent()->getParent();
941 const MachineRegisterInfo &MRI = MF.getRegInfo();
942 if (regIsPICBase(BaseReg, MRI))
943 return true;
944 }
945 }
946 break;
947 }
948
949 case X86::LEA32r:
950 case X86::LEA64r: {
951 if (MI.getOperand(1 + X86::AddrScaleAmt).isImm() &&
952 MI.getOperand(1 + X86::AddrIndexReg).isReg() &&
953 MI.getOperand(1 + X86::AddrIndexReg).getReg() == 0 &&
954 !MI.getOperand(1 + X86::AddrDisp).isReg()) {
955 // lea fi#, lea GV, etc. are all rematerializable.
956 if (!MI.getOperand(1 + X86::AddrBaseReg).isReg())
957 return true;
958 Register BaseReg = MI.getOperand(1 + X86::AddrBaseReg).getReg();
959 if (BaseReg == 0)
960 return true;
961 // Allow re-materialization of lea PICBase + x.
962 const MachineFunction &MF = *MI.getParent()->getParent();
963 const MachineRegisterInfo &MRI = MF.getRegInfo();
964 if (regIsPICBase(BaseReg, MRI))
965 return true;
966 }
967 break;
968 }
969 }
971}
972
975 Register DestReg, unsigned SubIdx,
976 const MachineInstr &Orig,
977 LaneBitmask UsedLanes) const {
978 bool ClobbersEFLAGS = Orig.modifiesRegister(X86::EFLAGS, &TRI);
979 if (ClobbersEFLAGS && MBB.computeRegisterLiveness(&TRI, X86::EFLAGS, I) !=
981 // The instruction clobbers EFLAGS. Re-materialize as MOV32ri to avoid side
982 // effects.
983 int Value;
984 switch (Orig.getOpcode()) {
985 case X86::MOV32r0:
986 Value = 0;
987 break;
988 case X86::MOV32r1:
989 Value = 1;
990 break;
991 case X86::MOV32r_1:
992 Value = -1;
993 break;
994 default:
995 llvm_unreachable("Unexpected instruction!");
996 }
997
998 const DebugLoc &DL = Orig.getDebugLoc();
999 BuildMI(MBB, I, DL, get(X86::MOV32ri))
1000 .add(Orig.getOperand(0))
1001 .addImm(Value);
1002 } else {
1003 MachineInstr *MI = MBB.getParent()->CloneMachineInstr(&Orig);
1004 MBB.insert(I, MI);
1005 }
1006
1007 MachineInstr &NewMI = *std::prev(I);
1008 NewMI.substituteRegister(Orig.getOperand(0).getReg(), DestReg, SubIdx, TRI);
1009}
1010
1011/// True if MI has a condition code def, e.g. EFLAGS, that is not marked dead.
1013 for (const MachineOperand &MO : MI.operands()) {
1014 if (MO.isReg() && MO.isDef() && MO.getReg() == X86::EFLAGS &&
1015 !MO.isDead()) {
1016 return true;
1017 }
1018 }
1019 return false;
1020}
1021
1022/// Check whether the shift count for a machine operand is non-zero.
1023inline static unsigned getTruncatedShiftCount(const MachineInstr &MI,
1024 unsigned ShiftAmtOperandIdx) {
1025 // The shift count is six bits with the REX.W prefix and five bits without.
1026 unsigned ShiftCountMask = (MI.getDesc().TSFlags & X86II::REX_W) ? 63 : 31;
1027 unsigned Imm = MI.getOperand(ShiftAmtOperandIdx).getImm();
1028 return Imm & ShiftCountMask;
1029}
1030
1031/// Check whether the given shift count is appropriate
1032/// can be represented by a LEA instruction.
1033inline static bool isTruncatedShiftCountForLEA(unsigned ShAmt) {
1034 // Left shift instructions can be transformed into load-effective-address
1035 // instructions if we can encode them appropriately.
1036 // A LEA instruction utilizes a SIB byte to encode its scale factor.
1037 // The SIB.scale field is two bits wide which means that we can encode any
1038 // shift amount less than 4.
1039 return ShAmt < 4 && ShAmt > 0;
1040}
1041
1042static bool
1044 const MachineRegisterInfo *MRI, MachineInstr **AndInstr,
1045 const TargetRegisterInfo *TRI, const X86Subtarget &ST,
1046 bool &NoSignFlag, bool &ClearsOverflowFlag) {
1047 if (!(CmpValDefInstr.getOpcode() == X86::SUBREG_TO_REG &&
1048 CmpInstr.getOpcode() == X86::TEST64rr) &&
1049 !(CmpValDefInstr.getOpcode() == X86::COPY &&
1050 CmpInstr.getOpcode() == X86::TEST16rr))
1051 return false;
1052
1053 // CmpInstr is a TEST16rr/TEST64rr instruction, and
1054 // `X86InstrInfo::analyzeCompare` guarantees that it's analyzable only if two
1055 // registers are identical.
1056 assert((CmpInstr.getOperand(0).getReg() == CmpInstr.getOperand(1).getReg()) &&
1057 "CmpInstr is an analyzable TEST16rr/TEST64rr, and "
1058 "`X86InstrInfo::analyzeCompare` requires two reg operands are the"
1059 "same.");
1060
1061 // Caller (`X86InstrInfo::optimizeCompareInstr`) guarantees that
1062 // `CmpValDefInstr` defines the value that's used by `CmpInstr`; in this case
1063 // if `CmpValDefInstr` sets the EFLAGS, it is likely that `CmpInstr` is
1064 // redundant.
1065 assert(
1066 (MRI->getVRegDef(CmpInstr.getOperand(0).getReg()) == &CmpValDefInstr) &&
1067 "Caller guarantees that TEST64rr is a user of SUBREG_TO_REG or TEST16rr "
1068 "is a user of COPY sub16bit.");
1069 MachineInstr *VregDefInstr = nullptr;
1070 if (CmpInstr.getOpcode() == X86::TEST16rr) {
1071 if (!CmpValDefInstr.getOperand(1).getReg().isVirtual())
1072 return false;
1073 VregDefInstr = MRI->getVRegDef(CmpValDefInstr.getOperand(1).getReg());
1074 if (!VregDefInstr)
1075 return false;
1076 // We can only remove test when AND32ri or AND64ri32 whose imm can fit 16bit
1077 // size, others 32/64 bit ops would test higher bits which test16rr don't
1078 // want to.
1079 if (!((VregDefInstr->getOpcode() == X86::AND32ri ||
1080 VregDefInstr->getOpcode() == X86::AND64ri32) &&
1081 isUInt<16>(VregDefInstr->getOperand(2).getImm())))
1082 return false;
1083 }
1084
1085 if (CmpInstr.getOpcode() == X86::TEST64rr) {
1086 // As seen in X86 td files, CmpValDefInstr.getOperand(3) is typically
1087 // sub_32bit or sub_xmm.
1088 if (CmpValDefInstr.getOperand(2).getImm() != X86::sub_32bit)
1089 return false;
1090
1091 VregDefInstr = MRI->getVRegDef(CmpValDefInstr.getOperand(1).getReg());
1092 }
1093
1094 assert(VregDefInstr && "Must have a definition (SSA)");
1095
1096 // Requires `CmpValDefInstr` and `VregDefInstr` are from the same MBB
1097 // to simplify the subsequent analysis.
1098 //
1099 // FIXME: If `VregDefInstr->getParent()` is the only predecessor of
1100 // `CmpValDefInstr.getParent()`, this could be handled.
1101 if (VregDefInstr->getParent() != CmpValDefInstr.getParent())
1102 return false;
1103
1104 if (X86::isAND(VregDefInstr->getOpcode()) &&
1105 (!ST.hasNF() || VregDefInstr->modifiesRegister(X86::EFLAGS, TRI))) {
1106 // Get a sequence of instructions like
1107 // %reg = and* ... // Set EFLAGS
1108 // ... // EFLAGS not changed
1109 // %extended_reg = subreg_to_reg %reg, %subreg.sub_32bit
1110 // test64rr %extended_reg, %extended_reg, implicit-def $eflags
1111 // or
1112 // %reg = and32* ...
1113 // ... // EFLAGS not changed.
1114 // %src_reg = copy %reg.sub_16bit:gr32
1115 // test16rr %src_reg, %src_reg, implicit-def $eflags
1116 //
1117 // If subsequent readers use a subset of bits that don't change
1118 // after `and*` instructions, it's likely that the test64rr could
1119 // be optimized away.
1120 for (const MachineInstr &Instr :
1121 make_range(std::next(MachineBasicBlock::iterator(VregDefInstr)),
1122 MachineBasicBlock::iterator(CmpValDefInstr))) {
1123 // There are instructions between 'VregDefInstr' and
1124 // 'CmpValDefInstr' that modifies EFLAGS.
1125 if (Instr.modifiesRegister(X86::EFLAGS, TRI))
1126 return false;
1127 }
1128
1129 *AndInstr = VregDefInstr;
1130
1131 // AND instruction will essentially update SF and clear OF, so
1132 // NoSignFlag should be false in the sense that SF is modified by `AND`.
1133 //
1134 // However, the implementation artifically sets `NoSignFlag` to true
1135 // to poison the SF bit; that is to say, if SF is looked at later, the
1136 // optimization (to erase TEST64rr) will be disabled.
1137 //
1138 // The reason to poison SF bit is that SF bit value could be different
1139 // in the `AND` and `TEST` operation; signed bit is not known for `AND`,
1140 // and is known to be 0 as a result of `TEST64rr`.
1141 //
1142 // FIXME: As opposed to poisoning the SF bit directly, consider peeking into
1143 // the AND instruction and using the static information to guide peephole
1144 // optimization if possible. For example, it's possible to fold a
1145 // conditional move into a copy if the relevant EFLAG bits could be deduced
1146 // from an immediate operand of and operation.
1147 //
1148 NoSignFlag = true;
1149 // ClearsOverflowFlag is true for AND operation (no surprise).
1150 ClearsOverflowFlag = true;
1151 return true;
1152 }
1153 return false;
1154}
1155
1157 unsigned Opc, bool AllowSP, Register &NewSrc,
1158 unsigned &NewSrcSubReg, bool &isKill,
1159 MachineOperand &ImplicitOp,
1160 LiveIntervals *LIS) const {
1161 MachineFunction &MF = *MI.getParent()->getParent();
1162 const TargetRegisterClass *RC;
1163 if (AllowSP) {
1164 RC = Opc != X86::LEA32r ? &X86::GR64RegClass : &X86::GR32RegClass;
1165 } else {
1166 RC = Opc != X86::LEA32r ? &X86::GR64_NOSPRegClass : &X86::GR32_NOSPRegClass;
1167 }
1168 Register SrcReg = Src.getReg();
1169 unsigned SubReg = Src.getSubReg();
1170 isKill = MI.killsRegister(SrcReg, /*TRI=*/nullptr);
1171
1172 NewSrcSubReg = X86::NoSubRegister;
1173
1174 // For both LEA64 and LEA32 the register already has essentially the right
1175 // type (32-bit or 64-bit) we may just need to forbid SP.
1176 if (Opc != X86::LEA64_32r) {
1177 NewSrc = SrcReg;
1178 NewSrcSubReg = SubReg;
1179 assert(!Src.isUndef() && "Undef op doesn't need optimization");
1180
1181 if (NewSrc.isVirtual() && !MF.getRegInfo().constrainRegClass(NewSrc, RC))
1182 return false;
1183
1184 return true;
1185 }
1186
1187 // This is for an LEA64_32r and incoming registers are 32-bit. One way or
1188 // another we need to add 64-bit registers to the final MI.
1189 if (SrcReg.isPhysical()) {
1190 ImplicitOp = Src;
1191 ImplicitOp.setImplicit();
1192
1193 NewSrc = getX86SubSuperRegister(SrcReg, 64);
1194 assert(!SubReg && "no superregister for source");
1195 assert(NewSrc.isValid() && "Invalid Operand");
1196 assert(!Src.isUndef() && "Undef op doesn't need optimization");
1197 } else {
1198 // Virtual register of the wrong class, we have to create a temporary 64-bit
1199 // vreg to feed into the LEA.
1200 NewSrc = MF.getRegInfo().createVirtualRegister(RC);
1201 NewSrcSubReg = X86::NoSubRegister;
1202 MachineInstr *Copy =
1203 BuildMI(*MI.getParent(), MI, MI.getDebugLoc(), get(TargetOpcode::COPY))
1204 .addReg(NewSrc, RegState::Define | RegState::Undef, X86::sub_32bit)
1205 .addReg(SrcReg, getKillRegState(isKill), SubReg);
1206
1207 // Which is obviously going to be dead after we're done with it.
1208 isKill = true;
1209
1210 if (LIS) {
1211 SlotIndex CopyIdx = LIS->InsertMachineInstrInMaps(*Copy);
1212 SlotIndex Idx = LIS->getInstructionIndex(MI);
1213 LiveInterval &LI = LIS->getInterval(SrcReg);
1215 if (S->end.getBaseIndex() == Idx)
1216 S->end = CopyIdx.getRegSlot();
1217 }
1218 }
1219
1220 // We've set all the parameters without issue.
1221 return true;
1222}
1223
1224MachineInstr *X86InstrInfo::convertToThreeAddressWithLEA(unsigned MIOpc,
1226 LiveIntervals *LIS,
1227 bool Is8BitOp) const {
1228 // We handle 8-bit adds and various 16-bit opcodes in the switch below.
1229 MachineBasicBlock &MBB = *MI.getParent();
1230 MachineRegisterInfo &RegInfo = MBB.getParent()->getRegInfo();
1231 assert((Is8BitOp ||
1232 RegInfo.getTargetRegisterInfo()->getRegSizeInBits(
1233 *RegInfo.getRegClass(MI.getOperand(0).getReg())) == 16) &&
1234 "Unexpected type for LEA transform");
1235
1236 // TODO: For a 32-bit target, we need to adjust the LEA variables with
1237 // something like this:
1238 // Opcode = X86::LEA32r;
1239 // InRegLEA = RegInfo.createVirtualRegister(&X86::GR32_NOSPRegClass);
1240 // OutRegLEA =
1241 // Is8BitOp ? RegInfo.createVirtualRegister(&X86::GR32ABCD_RegClass)
1242 // : RegInfo.createVirtualRegister(&X86::GR32RegClass);
1243 if (!Subtarget.is64Bit())
1244 return nullptr;
1245
1246 unsigned Opcode = X86::LEA64_32r;
1247 Register InRegLEA = RegInfo.createVirtualRegister(&X86::GR64_NOSPRegClass);
1248 Register OutRegLEA = RegInfo.createVirtualRegister(&X86::GR32RegClass);
1249 Register InRegLEA2;
1250
1251 // Build and insert into an implicit UNDEF value. This is OK because
1252 // we will be shifting and then extracting the lower 8/16-bits.
1253 // This has the potential to cause partial register stall. e.g.
1254 // movw (%rbp,%rcx,2), %dx
1255 // leal -65(%rdx), %esi
1256 // But testing has shown this *does* help performance in 64-bit mode (at
1257 // least on modern x86 machines).
1258 MachineBasicBlock::iterator MBBI = MI.getIterator();
1259 Register Dest = MI.getOperand(0).getReg();
1260 Register Src = MI.getOperand(1).getReg();
1261 unsigned SrcSubReg = MI.getOperand(1).getSubReg();
1262 Register Src2;
1263 unsigned Src2SubReg;
1264 bool IsDead = MI.getOperand(0).isDead();
1265 bool IsKill = MI.getOperand(1).isKill();
1266 unsigned SubReg = Is8BitOp ? X86::sub_8bit : X86::sub_16bit;
1267 assert(!MI.getOperand(1).isUndef() && "Undef op doesn't need optimization");
1268 MachineInstr *ImpDef =
1269 BuildMI(MBB, MBBI, MI.getDebugLoc(), get(X86::IMPLICIT_DEF), InRegLEA);
1270 MachineInstr *InsMI =
1271 BuildMI(MBB, MBBI, MI.getDebugLoc(), get(TargetOpcode::COPY))
1272 .addReg(InRegLEA, RegState::Define, SubReg)
1273 .addReg(Src, getKillRegState(IsKill), SrcSubReg);
1274 MachineInstr *ImpDef2 = nullptr;
1275 MachineInstr *InsMI2 = nullptr;
1276
1278 BuildMI(MBB, MBBI, MI.getDebugLoc(), get(Opcode), OutRegLEA);
1279#define CASE_NF(OP) \
1280 case X86::OP: \
1281 case X86::OP##_NF:
1282 switch (MIOpc) {
1283 default:
1284 llvm_unreachable("Unreachable!");
1285 CASE_NF(SHL8ri)
1286 CASE_NF(SHL16ri) {
1287 unsigned ShAmt = MI.getOperand(2).getImm();
1288 MIB.addReg(0)
1289 .addImm(1LL << ShAmt)
1290 .addReg(InRegLEA, RegState::Kill)
1291 .addImm(0)
1292 .addReg(0);
1293 break;
1294 }
1295 CASE_NF(INC8r)
1296 CASE_NF(INC16r)
1297 addRegOffset(MIB, InRegLEA, true, 1);
1298 break;
1299 CASE_NF(DEC8r)
1300 CASE_NF(DEC16r)
1301 addRegOffset(MIB, InRegLEA, true, -1);
1302 break;
1303 CASE_NF(ADD8ri)
1304 CASE_NF(ADD16ri)
1305 case X86::ADD8ri_DB:
1306 case X86::ADD16ri_DB:
1307 addRegOffset(MIB, InRegLEA, true, MI.getOperand(2).getImm());
1308 break;
1309 CASE_NF(ADD8rr)
1310 CASE_NF(ADD16rr)
1311 case X86::ADD8rr_DB:
1312 case X86::ADD16rr_DB: {
1313 Src2 = MI.getOperand(2).getReg();
1314 Src2SubReg = MI.getOperand(2).getSubReg();
1315 bool IsKill2 = MI.getOperand(2).isKill();
1316 assert(!MI.getOperand(2).isUndef() && "Undef op doesn't need optimization");
1317 if (Src == Src2) {
1318 // ADD8rr/ADD16rr killed %reg1028, %reg1028
1319 // just a single insert_subreg.
1320 addRegReg(MIB, InRegLEA, true, X86::NoSubRegister, InRegLEA, false,
1321 X86::NoSubRegister);
1322 } else {
1323 if (Subtarget.is64Bit())
1324 InRegLEA2 = RegInfo.createVirtualRegister(&X86::GR64_NOSPRegClass);
1325 else
1326 InRegLEA2 = RegInfo.createVirtualRegister(&X86::GR32_NOSPRegClass);
1327 // Build and insert into an implicit UNDEF value. This is OK because
1328 // we will be shifting and then extracting the lower 8/16-bits.
1329 ImpDef2 = BuildMI(MBB, &*MIB, MI.getDebugLoc(), get(X86::IMPLICIT_DEF),
1330 InRegLEA2);
1331 InsMI2 = BuildMI(MBB, &*MIB, MI.getDebugLoc(), get(TargetOpcode::COPY))
1332 .addReg(InRegLEA2, RegState::Define, SubReg)
1333 .addReg(Src2, getKillRegState(IsKill2), Src2SubReg);
1334 addRegReg(MIB, InRegLEA, true, X86::NoSubRegister, InRegLEA2, true,
1335 X86::NoSubRegister);
1336 }
1337 break;
1338 }
1339 }
1340
1341 MachineInstr *NewMI = MIB;
1342 MachineInstr *ExtMI =
1343 BuildMI(MBB, MBBI, MI.getDebugLoc(), get(TargetOpcode::COPY))
1345 .addReg(OutRegLEA, RegState::Kill, SubReg);
1346
1347 if (LIS) {
1348 LIS->InsertMachineInstrInMaps(*ImpDef);
1349 SlotIndex InsIdx = LIS->InsertMachineInstrInMaps(*InsMI);
1350 if (ImpDef2)
1351 LIS->InsertMachineInstrInMaps(*ImpDef2);
1352 SlotIndex Ins2Idx;
1353 if (InsMI2)
1354 Ins2Idx = LIS->InsertMachineInstrInMaps(*InsMI2);
1355 SlotIndex NewIdx = LIS->ReplaceMachineInstrInMaps(MI, *NewMI);
1356 SlotIndex ExtIdx = LIS->InsertMachineInstrInMaps(*ExtMI);
1357
1358 // Drop the dead EFLAGS def MI had; the replacement does not define EFLAGS.
1359 LIS->removePhysRegDefAt(X86::EFLAGS, NewIdx.getRegSlot());
1360
1361 LIS->getInterval(InRegLEA);
1362 LIS->getInterval(OutRegLEA);
1363 if (InRegLEA2)
1364 LIS->getInterval(InRegLEA2);
1365
1366 // Move the use of Src up to InsMI.
1367 LiveInterval &SrcLI = LIS->getInterval(Src);
1368 LiveRange::Segment *SrcSeg = SrcLI.getSegmentContaining(NewIdx);
1369 if (SrcSeg->end == NewIdx.getRegSlot())
1370 SrcSeg->end = InsIdx.getRegSlot();
1371
1372 if (InsMI2) {
1373 // Move the use of Src2 up to InsMI2.
1374 LiveInterval &Src2LI = LIS->getInterval(Src2);
1375 LiveRange::Segment *Src2Seg = Src2LI.getSegmentContaining(NewIdx);
1376 if (Src2Seg->end == NewIdx.getRegSlot())
1377 Src2Seg->end = Ins2Idx.getRegSlot();
1378 }
1379
1380 // Move the definition of Dest down to ExtMI.
1381 LiveInterval &DestLI = LIS->getInterval(Dest);
1382 LiveRange::Segment *DestSeg =
1383 DestLI.getSegmentContaining(NewIdx.getRegSlot());
1384 assert(DestSeg->start == NewIdx.getRegSlot() &&
1385 DestSeg->valno->def == NewIdx.getRegSlot());
1386 DestSeg->start = ExtIdx.getRegSlot();
1387 DestSeg->valno->def = ExtIdx.getRegSlot();
1388 }
1389
1390 return ExtMI;
1391}
1392
1393/// This method must be implemented by targets that
1394/// set the M_CONVERTIBLE_TO_3_ADDR flag. When this flag is set, the target
1395/// may be able to convert a two-address instruction into a true
1396/// three-address instruction on demand. This allows the X86 target (for
1397/// example) to convert ADD and SHL instructions into LEA instructions if they
1398/// would require register copies due to two-addressness.
1399///
1400/// This method returns a null pointer if the transformation cannot be
1401/// performed, otherwise it returns the new instruction.
1402///
1404 LiveIntervals *LIS) const {
1405 // The following opcodes also sets the condition code register(s). Only
1406 // convert them to equivalent lea if the condition code register def's
1407 // are dead!
1409 return nullptr;
1410
1411 MachineFunction &MF = *MI.getParent()->getParent();
1412 // All instructions input are two-addr instructions. Get the known operands.
1413 const MachineOperand &Dest = MI.getOperand(0);
1414 const MachineOperand &Src = MI.getOperand(1);
1415
1416 // Ideally, operations with undef should be folded before we get here, but we
1417 // can't guarantee it. Bail out because optimizing undefs is a waste of time.
1418 // Without this, we have to forward undef state to new register operands to
1419 // avoid machine verifier errors.
1420 if (Src.isUndef())
1421 return nullptr;
1422 if (MI.getNumOperands() > 2)
1423 if (MI.getOperand(2).isReg() && MI.getOperand(2).isUndef())
1424 return nullptr;
1425
1426 MachineInstr *NewMI = nullptr;
1427 Register SrcReg, SrcReg2;
1428 unsigned SrcSubReg, SrcSubReg2;
1429 bool Is64Bit = Subtarget.is64Bit();
1430
1431 bool Is8BitOp = false;
1432 unsigned MIOpc = MI.getOpcode();
1433 switch (MIOpc) {
1434 default:
1435 llvm_unreachable("Unreachable!");
1436 CASE_NF(SHL64ri) {
1437 assert(MI.getNumOperands() >= 3 && "Unknown shift instruction!");
1438 unsigned ShAmt = getTruncatedShiftCount(MI, 2);
1439 if (!isTruncatedShiftCountForLEA(ShAmt))
1440 return nullptr;
1441
1442 // LEA can't handle RSP.
1443 if (Src.getReg().isVirtual() && !MF.getRegInfo().constrainRegClass(
1444 Src.getReg(), &X86::GR64_NOSPRegClass))
1445 return nullptr;
1446
1447 NewMI = BuildMI(MF, MI.getDebugLoc(), get(X86::LEA64r))
1448 .add(Dest)
1449 .addReg(0)
1450 .addImm(1LL << ShAmt)
1451 .add(Src)
1452 .addImm(0)
1453 .addReg(0);
1454 break;
1455 }
1456 CASE_NF(SHL32ri) {
1457 assert(MI.getNumOperands() >= 3 && "Unknown shift instruction!");
1458 unsigned ShAmt = getTruncatedShiftCount(MI, 2);
1459 if (!isTruncatedShiftCountForLEA(ShAmt))
1460 return nullptr;
1461
1462 unsigned Opc = Is64Bit ? X86::LEA64_32r : X86::LEA32r;
1463
1464 // LEA can't handle ESP.
1465 bool isKill;
1466 MachineOperand ImplicitOp = MachineOperand::CreateReg(0, false);
1467 if (!classifyLEAReg(MI, Src, Opc, /*AllowSP=*/false, SrcReg, SrcSubReg,
1468 isKill, ImplicitOp, LIS))
1469 return nullptr;
1470
1472 BuildMI(MF, MI.getDebugLoc(), get(Opc))
1473 .add(Dest)
1474 .addReg(0)
1475 .addImm(1LL << ShAmt)
1476 .addReg(SrcReg, getKillRegState(isKill), SrcSubReg)
1477 .addImm(0)
1478 .addReg(0);
1479 if (ImplicitOp.getReg() != 0)
1480 MIB.add(ImplicitOp);
1481 NewMI = MIB;
1482
1483 break;
1484 }
1485 CASE_NF(SHL8ri)
1486 Is8BitOp = true;
1487 [[fallthrough]];
1488 CASE_NF(SHL16ri) {
1489 assert(MI.getNumOperands() >= 3 && "Unknown shift instruction!");
1490 unsigned ShAmt = getTruncatedShiftCount(MI, 2);
1491 if (!isTruncatedShiftCountForLEA(ShAmt))
1492 return nullptr;
1493 return convertToThreeAddressWithLEA(MIOpc, MI, LIS, Is8BitOp);
1494 }
1495 CASE_NF(INC64r)
1496 CASE_NF(INC32r) {
1497 assert(MI.getNumOperands() >= 2 && "Unknown inc instruction!");
1498 unsigned Opc = (MIOpc == X86::INC64r || MIOpc == X86::INC64r_NF)
1499 ? X86::LEA64r
1500 : (Is64Bit ? X86::LEA64_32r : X86::LEA32r);
1501 bool isKill;
1502 MachineOperand ImplicitOp = MachineOperand::CreateReg(0, false);
1503 if (!classifyLEAReg(MI, Src, Opc, /*AllowSP=*/false, SrcReg, SrcSubReg,
1504 isKill, ImplicitOp, LIS))
1505 return nullptr;
1506
1507 MachineInstrBuilder MIB = BuildMI(MF, MI.getDebugLoc(), get(Opc))
1508 .add(Dest)
1509 .addReg(SrcReg, getKillRegState(isKill));
1510 if (ImplicitOp.getReg() != 0)
1511 MIB.add(ImplicitOp);
1512
1513 NewMI = addOffset(MIB, 1);
1514
1515 break;
1516 }
1517 CASE_NF(DEC64r)
1518 CASE_NF(DEC32r) {
1519 assert(MI.getNumOperands() >= 2 && "Unknown dec instruction!");
1520 unsigned Opc = (MIOpc == X86::DEC64r || MIOpc == X86::DEC64r_NF)
1521 ? X86::LEA64r
1522 : (Is64Bit ? X86::LEA64_32r : X86::LEA32r);
1523
1524 bool isKill;
1525 MachineOperand ImplicitOp = MachineOperand::CreateReg(0, false);
1526 if (!classifyLEAReg(MI, Src, Opc, /*AllowSP=*/false, SrcReg, SrcSubReg,
1527 isKill, ImplicitOp, LIS))
1528 return nullptr;
1529
1530 MachineInstrBuilder MIB = BuildMI(MF, MI.getDebugLoc(), get(Opc))
1531 .add(Dest)
1532 .addReg(SrcReg, getKillRegState(isKill));
1533 if (ImplicitOp.getReg() != 0)
1534 MIB.add(ImplicitOp);
1535
1536 NewMI = addOffset(MIB, -1);
1537
1538 break;
1539 }
1540 CASE_NF(DEC8r)
1541 CASE_NF(INC8r)
1542 Is8BitOp = true;
1543 [[fallthrough]];
1544 CASE_NF(DEC16r)
1545 CASE_NF(INC16r)
1546 return convertToThreeAddressWithLEA(MIOpc, MI, LIS, Is8BitOp);
1547 CASE_NF(ADD64rr)
1548 CASE_NF(ADD32rr)
1549 case X86::ADD64rr_DB:
1550 case X86::ADD32rr_DB: {
1551 assert(MI.getNumOperands() >= 3 && "Unknown add instruction!");
1552 unsigned Opc;
1553 if (MIOpc == X86::ADD64rr || MIOpc == X86::ADD64rr_NF ||
1554 MIOpc == X86::ADD64rr_DB)
1555 Opc = X86::LEA64r;
1556 else
1557 Opc = Is64Bit ? X86::LEA64_32r : X86::LEA32r;
1558
1559 const MachineOperand &Src2 = MI.getOperand(2);
1560 bool isKill2;
1561 MachineOperand ImplicitOp2 = MachineOperand::CreateReg(0, false);
1562 if (!classifyLEAReg(MI, Src2, Opc, /*AllowSP=*/false, SrcReg2, SrcSubReg2,
1563 isKill2, ImplicitOp2, LIS))
1564 return nullptr;
1565
1566 bool isKill;
1567 MachineOperand ImplicitOp = MachineOperand::CreateReg(0, false);
1568 if (Src.getReg() == Src2.getReg()) {
1569 // Don't call classify LEAReg a second time on the same register, in case
1570 // the first call inserted a COPY from Src2 and marked it as killed.
1571 isKill = isKill2;
1572 SrcReg = SrcReg2;
1573 SrcSubReg = SrcSubReg2;
1574 } else {
1575 if (!classifyLEAReg(MI, Src, Opc, /*AllowSP=*/true, SrcReg, SrcSubReg,
1576 isKill, ImplicitOp, LIS))
1577 return nullptr;
1578 }
1579
1580 MachineInstrBuilder MIB = BuildMI(MF, MI.getDebugLoc(), get(Opc)).add(Dest);
1581 if (ImplicitOp.getReg() != 0)
1582 MIB.add(ImplicitOp);
1583 if (ImplicitOp2.getReg() != 0)
1584 MIB.add(ImplicitOp2);
1585
1586 NewMI =
1587 addRegReg(MIB, SrcReg, isKill, SrcSubReg, SrcReg2, isKill2, SrcSubReg2);
1588
1589 break;
1590 }
1591 CASE_NF(ADD8rr)
1592 case X86::ADD8rr_DB:
1593 Is8BitOp = true;
1594 [[fallthrough]];
1595 CASE_NF(ADD16rr)
1596 case X86::ADD16rr_DB:
1597 return convertToThreeAddressWithLEA(MIOpc, MI, LIS, Is8BitOp);
1598 CASE_NF(ADD64ri32)
1599 case X86::ADD64ri32_DB:
1600 assert(MI.getNumOperands() >= 3 && "Unknown add instruction!");
1601 NewMI = addOffset(
1602 BuildMI(MF, MI.getDebugLoc(), get(X86::LEA64r)).add(Dest).add(Src),
1603 MI.getOperand(2));
1604 break;
1605 CASE_NF(ADD32ri)
1606 case X86::ADD32ri_DB: {
1607 assert(MI.getNumOperands() >= 3 && "Unknown add instruction!");
1608 unsigned Opc = Is64Bit ? X86::LEA64_32r : X86::LEA32r;
1609
1610 bool isKill;
1611 MachineOperand ImplicitOp = MachineOperand::CreateReg(0, false);
1612 if (!classifyLEAReg(MI, Src, Opc, /*AllowSP=*/true, SrcReg, SrcSubReg,
1613 isKill, ImplicitOp, LIS))
1614 return nullptr;
1615
1617 BuildMI(MF, MI.getDebugLoc(), get(Opc))
1618 .add(Dest)
1619 .addReg(SrcReg, getKillRegState(isKill), SrcSubReg);
1620 if (ImplicitOp.getReg() != 0)
1621 MIB.add(ImplicitOp);
1622
1623 NewMI = addOffset(MIB, MI.getOperand(2));
1624
1625 break;
1626 }
1627 CASE_NF(ADD8ri)
1628 case X86::ADD8ri_DB:
1629 Is8BitOp = true;
1630 [[fallthrough]];
1631 CASE_NF(ADD16ri)
1632 case X86::ADD16ri_DB:
1633 return convertToThreeAddressWithLEA(MIOpc, MI, LIS, Is8BitOp);
1634 CASE_NF(SUB8ri)
1635 CASE_NF(SUB16ri)
1636 /// FIXME: Support these similar to ADD8ri/ADD16ri*.
1637 return nullptr;
1638 CASE_NF(SUB32ri) {
1639 if (!MI.getOperand(2).isImm())
1640 return nullptr;
1641 int64_t Imm = MI.getOperand(2).getImm();
1642 if (!isInt<32>(-Imm))
1643 return nullptr;
1644
1645 assert(MI.getNumOperands() >= 3 && "Unknown add instruction!");
1646 unsigned Opc = Is64Bit ? X86::LEA64_32r : X86::LEA32r;
1647
1648 bool isKill;
1649 MachineOperand ImplicitOp = MachineOperand::CreateReg(0, false);
1650 if (!classifyLEAReg(MI, Src, Opc, /*AllowSP=*/true, SrcReg, SrcSubReg,
1651 isKill, ImplicitOp, LIS))
1652 return nullptr;
1653
1655 BuildMI(MF, MI.getDebugLoc(), get(Opc))
1656 .add(Dest)
1657 .addReg(SrcReg, getKillRegState(isKill), SrcSubReg);
1658 if (ImplicitOp.getReg() != 0)
1659 MIB.add(ImplicitOp);
1660
1661 NewMI = addOffset(MIB, -Imm);
1662
1663 break;
1664 }
1665
1666 CASE_NF(SUB64ri32) {
1667 if (!MI.getOperand(2).isImm())
1668 return nullptr;
1669 int64_t Imm = MI.getOperand(2).getImm();
1670 if (!isInt<32>(-Imm))
1671 return nullptr;
1672
1673 assert(MI.getNumOperands() >= 3 && "Unknown sub instruction!");
1674
1676 BuildMI(MF, MI.getDebugLoc(), get(X86::LEA64r)).add(Dest).add(Src);
1677 NewMI = addOffset(MIB, -Imm);
1678 break;
1679 }
1680
1681 case X86::VMOVDQU8Z128rmk:
1682 case X86::VMOVDQU8Z256rmk:
1683 case X86::VMOVDQU8Zrmk:
1684 case X86::VMOVDQU16Z128rmk:
1685 case X86::VMOVDQU16Z256rmk:
1686 case X86::VMOVDQU16Zrmk:
1687 case X86::VMOVDQU32Z128rmk:
1688 case X86::VMOVDQA32Z128rmk:
1689 case X86::VMOVDQU32Z256rmk:
1690 case X86::VMOVDQA32Z256rmk:
1691 case X86::VMOVDQU32Zrmk:
1692 case X86::VMOVDQA32Zrmk:
1693 case X86::VMOVDQU64Z128rmk:
1694 case X86::VMOVDQA64Z128rmk:
1695 case X86::VMOVDQU64Z256rmk:
1696 case X86::VMOVDQA64Z256rmk:
1697 case X86::VMOVDQU64Zrmk:
1698 case X86::VMOVDQA64Zrmk:
1699 case X86::VMOVUPDZ128rmk:
1700 case X86::VMOVAPDZ128rmk:
1701 case X86::VMOVUPDZ256rmk:
1702 case X86::VMOVAPDZ256rmk:
1703 case X86::VMOVUPDZrmk:
1704 case X86::VMOVAPDZrmk:
1705 case X86::VMOVUPSZ128rmk:
1706 case X86::VMOVAPSZ128rmk:
1707 case X86::VMOVUPSZ256rmk:
1708 case X86::VMOVAPSZ256rmk:
1709 case X86::VMOVUPSZrmk:
1710 case X86::VMOVAPSZrmk:
1711 case X86::VBROADCASTSDZ256rmk:
1712 case X86::VBROADCASTSDZrmk:
1713 case X86::VBROADCASTSSZ128rmk:
1714 case X86::VBROADCASTSSZ256rmk:
1715 case X86::VBROADCASTSSZrmk:
1716 case X86::VPBROADCASTDZ128rmk:
1717 case X86::VPBROADCASTDZ256rmk:
1718 case X86::VPBROADCASTDZrmk:
1719 case X86::VPBROADCASTQZ128rmk:
1720 case X86::VPBROADCASTQZ256rmk:
1721 case X86::VPBROADCASTQZrmk: {
1722 unsigned Opc;
1723 switch (MIOpc) {
1724 default:
1725 llvm_unreachable("Unreachable!");
1726 case X86::VMOVDQU8Z128rmk:
1727 Opc = X86::VPBLENDMBZ128rmk;
1728 break;
1729 case X86::VMOVDQU8Z256rmk:
1730 Opc = X86::VPBLENDMBZ256rmk;
1731 break;
1732 case X86::VMOVDQU8Zrmk:
1733 Opc = X86::VPBLENDMBZrmk;
1734 break;
1735 case X86::VMOVDQU16Z128rmk:
1736 Opc = X86::VPBLENDMWZ128rmk;
1737 break;
1738 case X86::VMOVDQU16Z256rmk:
1739 Opc = X86::VPBLENDMWZ256rmk;
1740 break;
1741 case X86::VMOVDQU16Zrmk:
1742 Opc = X86::VPBLENDMWZrmk;
1743 break;
1744 case X86::VMOVDQU32Z128rmk:
1745 Opc = X86::VPBLENDMDZ128rmk;
1746 break;
1747 case X86::VMOVDQU32Z256rmk:
1748 Opc = X86::VPBLENDMDZ256rmk;
1749 break;
1750 case X86::VMOVDQU32Zrmk:
1751 Opc = X86::VPBLENDMDZrmk;
1752 break;
1753 case X86::VMOVDQU64Z128rmk:
1754 Opc = X86::VPBLENDMQZ128rmk;
1755 break;
1756 case X86::VMOVDQU64Z256rmk:
1757 Opc = X86::VPBLENDMQZ256rmk;
1758 break;
1759 case X86::VMOVDQU64Zrmk:
1760 Opc = X86::VPBLENDMQZrmk;
1761 break;
1762 case X86::VMOVUPDZ128rmk:
1763 Opc = X86::VBLENDMPDZ128rmk;
1764 break;
1765 case X86::VMOVUPDZ256rmk:
1766 Opc = X86::VBLENDMPDZ256rmk;
1767 break;
1768 case X86::VMOVUPDZrmk:
1769 Opc = X86::VBLENDMPDZrmk;
1770 break;
1771 case X86::VMOVUPSZ128rmk:
1772 Opc = X86::VBLENDMPSZ128rmk;
1773 break;
1774 case X86::VMOVUPSZ256rmk:
1775 Opc = X86::VBLENDMPSZ256rmk;
1776 break;
1777 case X86::VMOVUPSZrmk:
1778 Opc = X86::VBLENDMPSZrmk;
1779 break;
1780 case X86::VMOVDQA32Z128rmk:
1781 Opc = X86::VPBLENDMDZ128rmk;
1782 break;
1783 case X86::VMOVDQA32Z256rmk:
1784 Opc = X86::VPBLENDMDZ256rmk;
1785 break;
1786 case X86::VMOVDQA32Zrmk:
1787 Opc = X86::VPBLENDMDZrmk;
1788 break;
1789 case X86::VMOVDQA64Z128rmk:
1790 Opc = X86::VPBLENDMQZ128rmk;
1791 break;
1792 case X86::VMOVDQA64Z256rmk:
1793 Opc = X86::VPBLENDMQZ256rmk;
1794 break;
1795 case X86::VMOVDQA64Zrmk:
1796 Opc = X86::VPBLENDMQZrmk;
1797 break;
1798 case X86::VMOVAPDZ128rmk:
1799 Opc = X86::VBLENDMPDZ128rmk;
1800 break;
1801 case X86::VMOVAPDZ256rmk:
1802 Opc = X86::VBLENDMPDZ256rmk;
1803 break;
1804 case X86::VMOVAPDZrmk:
1805 Opc = X86::VBLENDMPDZrmk;
1806 break;
1807 case X86::VMOVAPSZ128rmk:
1808 Opc = X86::VBLENDMPSZ128rmk;
1809 break;
1810 case X86::VMOVAPSZ256rmk:
1811 Opc = X86::VBLENDMPSZ256rmk;
1812 break;
1813 case X86::VMOVAPSZrmk:
1814 Opc = X86::VBLENDMPSZrmk;
1815 break;
1816 case X86::VBROADCASTSDZ256rmk:
1817 Opc = X86::VBLENDMPDZ256rmbk;
1818 break;
1819 case X86::VBROADCASTSDZrmk:
1820 Opc = X86::VBLENDMPDZrmbk;
1821 break;
1822 case X86::VBROADCASTSSZ128rmk:
1823 Opc = X86::VBLENDMPSZ128rmbk;
1824 break;
1825 case X86::VBROADCASTSSZ256rmk:
1826 Opc = X86::VBLENDMPSZ256rmbk;
1827 break;
1828 case X86::VBROADCASTSSZrmk:
1829 Opc = X86::VBLENDMPSZrmbk;
1830 break;
1831 case X86::VPBROADCASTDZ128rmk:
1832 Opc = X86::VPBLENDMDZ128rmbk;
1833 break;
1834 case X86::VPBROADCASTDZ256rmk:
1835 Opc = X86::VPBLENDMDZ256rmbk;
1836 break;
1837 case X86::VPBROADCASTDZrmk:
1838 Opc = X86::VPBLENDMDZrmbk;
1839 break;
1840 case X86::VPBROADCASTQZ128rmk:
1841 Opc = X86::VPBLENDMQZ128rmbk;
1842 break;
1843 case X86::VPBROADCASTQZ256rmk:
1844 Opc = X86::VPBLENDMQZ256rmbk;
1845 break;
1846 case X86::VPBROADCASTQZrmk:
1847 Opc = X86::VPBLENDMQZrmbk;
1848 break;
1849 }
1850
1851 NewMI = BuildMI(MF, MI.getDebugLoc(), get(Opc))
1852 .add(Dest)
1853 .add(MI.getOperand(2))
1854 .add(Src)
1855 .add(MI.getOperand(3))
1856 .add(MI.getOperand(4))
1857 .add(MI.getOperand(5))
1858 .add(MI.getOperand(6))
1859 .add(MI.getOperand(7));
1860 break;
1861 }
1862
1863 case X86::VMOVDQU8Z128rrk:
1864 case X86::VMOVDQU8Z256rrk:
1865 case X86::VMOVDQU8Zrrk:
1866 case X86::VMOVDQU16Z128rrk:
1867 case X86::VMOVDQU16Z256rrk:
1868 case X86::VMOVDQU16Zrrk:
1869 case X86::VMOVDQU32Z128rrk:
1870 case X86::VMOVDQA32Z128rrk:
1871 case X86::VMOVDQU32Z256rrk:
1872 case X86::VMOVDQA32Z256rrk:
1873 case X86::VMOVDQU32Zrrk:
1874 case X86::VMOVDQA32Zrrk:
1875 case X86::VMOVDQU64Z128rrk:
1876 case X86::VMOVDQA64Z128rrk:
1877 case X86::VMOVDQU64Z256rrk:
1878 case X86::VMOVDQA64Z256rrk:
1879 case X86::VMOVDQU64Zrrk:
1880 case X86::VMOVDQA64Zrrk:
1881 case X86::VMOVUPDZ128rrk:
1882 case X86::VMOVAPDZ128rrk:
1883 case X86::VMOVUPDZ256rrk:
1884 case X86::VMOVAPDZ256rrk:
1885 case X86::VMOVUPDZrrk:
1886 case X86::VMOVAPDZrrk:
1887 case X86::VMOVUPSZ128rrk:
1888 case X86::VMOVAPSZ128rrk:
1889 case X86::VMOVUPSZ256rrk:
1890 case X86::VMOVAPSZ256rrk:
1891 case X86::VMOVUPSZrrk:
1892 case X86::VMOVAPSZrrk: {
1893 unsigned Opc;
1894 switch (MIOpc) {
1895 default:
1896 llvm_unreachable("Unreachable!");
1897 case X86::VMOVDQU8Z128rrk:
1898 Opc = X86::VPBLENDMBZ128rrk;
1899 break;
1900 case X86::VMOVDQU8Z256rrk:
1901 Opc = X86::VPBLENDMBZ256rrk;
1902 break;
1903 case X86::VMOVDQU8Zrrk:
1904 Opc = X86::VPBLENDMBZrrk;
1905 break;
1906 case X86::VMOVDQU16Z128rrk:
1907 Opc = X86::VPBLENDMWZ128rrk;
1908 break;
1909 case X86::VMOVDQU16Z256rrk:
1910 Opc = X86::VPBLENDMWZ256rrk;
1911 break;
1912 case X86::VMOVDQU16Zrrk:
1913 Opc = X86::VPBLENDMWZrrk;
1914 break;
1915 case X86::VMOVDQU32Z128rrk:
1916 Opc = X86::VPBLENDMDZ128rrk;
1917 break;
1918 case X86::VMOVDQU32Z256rrk:
1919 Opc = X86::VPBLENDMDZ256rrk;
1920 break;
1921 case X86::VMOVDQU32Zrrk:
1922 Opc = X86::VPBLENDMDZrrk;
1923 break;
1924 case X86::VMOVDQU64Z128rrk:
1925 Opc = X86::VPBLENDMQZ128rrk;
1926 break;
1927 case X86::VMOVDQU64Z256rrk:
1928 Opc = X86::VPBLENDMQZ256rrk;
1929 break;
1930 case X86::VMOVDQU64Zrrk:
1931 Opc = X86::VPBLENDMQZrrk;
1932 break;
1933 case X86::VMOVUPDZ128rrk:
1934 Opc = X86::VBLENDMPDZ128rrk;
1935 break;
1936 case X86::VMOVUPDZ256rrk:
1937 Opc = X86::VBLENDMPDZ256rrk;
1938 break;
1939 case X86::VMOVUPDZrrk:
1940 Opc = X86::VBLENDMPDZrrk;
1941 break;
1942 case X86::VMOVUPSZ128rrk:
1943 Opc = X86::VBLENDMPSZ128rrk;
1944 break;
1945 case X86::VMOVUPSZ256rrk:
1946 Opc = X86::VBLENDMPSZ256rrk;
1947 break;
1948 case X86::VMOVUPSZrrk:
1949 Opc = X86::VBLENDMPSZrrk;
1950 break;
1951 case X86::VMOVDQA32Z128rrk:
1952 Opc = X86::VPBLENDMDZ128rrk;
1953 break;
1954 case X86::VMOVDQA32Z256rrk:
1955 Opc = X86::VPBLENDMDZ256rrk;
1956 break;
1957 case X86::VMOVDQA32Zrrk:
1958 Opc = X86::VPBLENDMDZrrk;
1959 break;
1960 case X86::VMOVDQA64Z128rrk:
1961 Opc = X86::VPBLENDMQZ128rrk;
1962 break;
1963 case X86::VMOVDQA64Z256rrk:
1964 Opc = X86::VPBLENDMQZ256rrk;
1965 break;
1966 case X86::VMOVDQA64Zrrk:
1967 Opc = X86::VPBLENDMQZrrk;
1968 break;
1969 case X86::VMOVAPDZ128rrk:
1970 Opc = X86::VBLENDMPDZ128rrk;
1971 break;
1972 case X86::VMOVAPDZ256rrk:
1973 Opc = X86::VBLENDMPDZ256rrk;
1974 break;
1975 case X86::VMOVAPDZrrk:
1976 Opc = X86::VBLENDMPDZrrk;
1977 break;
1978 case X86::VMOVAPSZ128rrk:
1979 Opc = X86::VBLENDMPSZ128rrk;
1980 break;
1981 case X86::VMOVAPSZ256rrk:
1982 Opc = X86::VBLENDMPSZ256rrk;
1983 break;
1984 case X86::VMOVAPSZrrk:
1985 Opc = X86::VBLENDMPSZrrk;
1986 break;
1987 }
1988
1989 NewMI = BuildMI(MF, MI.getDebugLoc(), get(Opc))
1990 .add(Dest)
1991 .add(MI.getOperand(2))
1992 .add(Src)
1993 .add(MI.getOperand(3));
1994 break;
1995 }
1996 }
1997#undef CASE_NF
1998
1999 if (!NewMI)
2000 return nullptr;
2001
2002 MachineBasicBlock &MBB = *MI.getParent();
2003 MBB.insert(MI.getIterator(), NewMI); // Insert the new inst
2004
2005 if (LIS) {
2006 // The replacement does not define EFLAGS; drop the dead EFLAGS def MI had.
2007 SlotIndex Idx = LIS->getInstructionIndex(MI);
2008 LIS->ReplaceMachineInstrInMaps(MI, *NewMI);
2009
2010 LIS->removePhysRegDefAt(X86::EFLAGS, Idx.getRegSlot());
2011 if (SrcReg)
2012 LIS->getInterval(SrcReg);
2013 if (SrcReg2)
2014 LIS->getInterval(SrcReg2);
2015 }
2016
2017 return NewMI;
2018}
2019
2020/// This determines which of three possible cases of a three source commute
2021/// the source indexes correspond to taking into account any mask operands.
2022/// All prevents commuting a passthru operand. Returns -1 if the commute isn't
2023/// possible.
2024/// Case 0 - Possible to commute the first and second operands.
2025/// Case 1 - Possible to commute the first and third operands.
2026/// Case 2 - Possible to commute the second and third operands.
2027static unsigned getThreeSrcCommuteCase(uint64_t TSFlags, unsigned SrcOpIdx1,
2028 unsigned SrcOpIdx2) {
2029 // Put the lowest index to SrcOpIdx1 to simplify the checks below.
2030 if (SrcOpIdx1 > SrcOpIdx2)
2031 std::swap(SrcOpIdx1, SrcOpIdx2);
2032
2033 unsigned Op1 = 1, Op2 = 2, Op3 = 3;
2034 if (X86II::isKMasked(TSFlags)) {
2035 Op2++;
2036 Op3++;
2037 }
2038
2039 if (SrcOpIdx1 == Op1 && SrcOpIdx2 == Op2)
2040 return 0;
2041 if (SrcOpIdx1 == Op1 && SrcOpIdx2 == Op3)
2042 return 1;
2043 if (SrcOpIdx1 == Op2 && SrcOpIdx2 == Op3)
2044 return 2;
2045 llvm_unreachable("Unknown three src commute case.");
2046}
2047
2049 const MachineInstr &MI, unsigned SrcOpIdx1, unsigned SrcOpIdx2,
2050 const X86InstrFMA3Group &FMA3Group) const {
2051
2052 unsigned Opc = MI.getOpcode();
2053
2054 // TODO: Commuting the 1st operand of FMA*_Int requires some additional
2055 // analysis. The commute optimization is legal only if all users of FMA*_Int
2056 // use only the lowest element of the FMA*_Int instruction. Such analysis are
2057 // not implemented yet. So, just return 0 in that case.
2058 // When such analysis are available this place will be the right place for
2059 // calling it.
2060 assert(!(FMA3Group.isIntrinsic() && (SrcOpIdx1 == 1 || SrcOpIdx2 == 1)) &&
2061 "Intrinsic instructions can't commute operand 1");
2062
2063 // Determine which case this commute is or if it can't be done.
2064 unsigned Case =
2065 getThreeSrcCommuteCase(MI.getDesc().TSFlags, SrcOpIdx1, SrcOpIdx2);
2066 assert(Case < 3 && "Unexpected case number!");
2067
2068 // Define the FMA forms mapping array that helps to map input FMA form
2069 // to output FMA form to preserve the operation semantics after
2070 // commuting the operands.
2071 const unsigned Form132Index = 0;
2072 const unsigned Form213Index = 1;
2073 const unsigned Form231Index = 2;
2074 static const unsigned FormMapping[][3] = {
2075 // 0: SrcOpIdx1 == 1 && SrcOpIdx2 == 2;
2076 // FMA132 A, C, b; ==> FMA231 C, A, b;
2077 // FMA213 B, A, c; ==> FMA213 A, B, c;
2078 // FMA231 C, A, b; ==> FMA132 A, C, b;
2079 {Form231Index, Form213Index, Form132Index},
2080 // 1: SrcOpIdx1 == 1 && SrcOpIdx2 == 3;
2081 // FMA132 A, c, B; ==> FMA132 B, c, A;
2082 // FMA213 B, a, C; ==> FMA231 C, a, B;
2083 // FMA231 C, a, B; ==> FMA213 B, a, C;
2084 {Form132Index, Form231Index, Form213Index},
2085 // 2: SrcOpIdx1 == 2 && SrcOpIdx2 == 3;
2086 // FMA132 a, C, B; ==> FMA213 a, B, C;
2087 // FMA213 b, A, C; ==> FMA132 b, C, A;
2088 // FMA231 c, A, B; ==> FMA231 c, B, A;
2089 {Form213Index, Form132Index, Form231Index}};
2090
2091 unsigned FMAForms[3];
2092 FMAForms[0] = FMA3Group.get132Opcode();
2093 FMAForms[1] = FMA3Group.get213Opcode();
2094 FMAForms[2] = FMA3Group.get231Opcode();
2095
2096 // Everything is ready, just adjust the FMA opcode and return it.
2097 for (unsigned FormIndex = 0; FormIndex < 3; FormIndex++)
2098 if (Opc == FMAForms[FormIndex])
2099 return FMAForms[FormMapping[Case][FormIndex]];
2100
2101 llvm_unreachable("Illegal FMA3 format");
2102}
2103
2104static void commuteVPTERNLOG(MachineInstr &MI, unsigned SrcOpIdx1,
2105 unsigned SrcOpIdx2) {
2106 // Determine which case this commute is or if it can't be done.
2107 unsigned Case =
2108 getThreeSrcCommuteCase(MI.getDesc().TSFlags, SrcOpIdx1, SrcOpIdx2);
2109 assert(Case < 3 && "Unexpected case value!");
2110
2111 // For each case we need to swap two pairs of bits in the final immediate.
2112 static const uint8_t SwapMasks[3][4] = {
2113 {0x04, 0x10, 0x08, 0x20}, // Swap bits 2/4 and 3/5.
2114 {0x02, 0x10, 0x08, 0x40}, // Swap bits 1/4 and 3/6.
2115 {0x02, 0x04, 0x20, 0x40}, // Swap bits 1/2 and 5/6.
2116 };
2117
2118 uint8_t Imm = MI.getOperand(MI.getNumOperands() - 1).getImm();
2119 // Clear out the bits we are swapping.
2120 uint8_t NewImm = Imm & ~(SwapMasks[Case][0] | SwapMasks[Case][1] |
2121 SwapMasks[Case][2] | SwapMasks[Case][3]);
2122 // If the immediate had a bit of the pair set, then set the opposite bit.
2123 if (Imm & SwapMasks[Case][0])
2124 NewImm |= SwapMasks[Case][1];
2125 if (Imm & SwapMasks[Case][1])
2126 NewImm |= SwapMasks[Case][0];
2127 if (Imm & SwapMasks[Case][2])
2128 NewImm |= SwapMasks[Case][3];
2129 if (Imm & SwapMasks[Case][3])
2130 NewImm |= SwapMasks[Case][2];
2131 MI.getOperand(MI.getNumOperands() - 1).setImm(NewImm);
2132}
2133
2134// Returns true if this is a VPERMI2 or VPERMT2 instruction that can be
2135// commuted.
2136static bool isCommutableVPERMV3Instruction(unsigned Opcode) {
2137#define VPERM_CASES(Suffix) \
2138 case X86::VPERMI2##Suffix##Z128rr: \
2139 case X86::VPERMT2##Suffix##Z128rr: \
2140 case X86::VPERMI2##Suffix##Z256rr: \
2141 case X86::VPERMT2##Suffix##Z256rr: \
2142 case X86::VPERMI2##Suffix##Zrr: \
2143 case X86::VPERMT2##Suffix##Zrr: \
2144 case X86::VPERMI2##Suffix##Z128rm: \
2145 case X86::VPERMT2##Suffix##Z128rm: \
2146 case X86::VPERMI2##Suffix##Z256rm: \
2147 case X86::VPERMT2##Suffix##Z256rm: \
2148 case X86::VPERMI2##Suffix##Zrm: \
2149 case X86::VPERMT2##Suffix##Zrm: \
2150 case X86::VPERMI2##Suffix##Z128rrkz: \
2151 case X86::VPERMT2##Suffix##Z128rrkz: \
2152 case X86::VPERMI2##Suffix##Z256rrkz: \
2153 case X86::VPERMT2##Suffix##Z256rrkz: \
2154 case X86::VPERMI2##Suffix##Zrrkz: \
2155 case X86::VPERMT2##Suffix##Zrrkz: \
2156 case X86::VPERMI2##Suffix##Z128rmkz: \
2157 case X86::VPERMT2##Suffix##Z128rmkz: \
2158 case X86::VPERMI2##Suffix##Z256rmkz: \
2159 case X86::VPERMT2##Suffix##Z256rmkz: \
2160 case X86::VPERMI2##Suffix##Zrmkz: \
2161 case X86::VPERMT2##Suffix##Zrmkz:
2162
2163#define VPERM_CASES_BROADCAST(Suffix) \
2164 VPERM_CASES(Suffix) \
2165 case X86::VPERMI2##Suffix##Z128rmb: \
2166 case X86::VPERMT2##Suffix##Z128rmb: \
2167 case X86::VPERMI2##Suffix##Z256rmb: \
2168 case X86::VPERMT2##Suffix##Z256rmb: \
2169 case X86::VPERMI2##Suffix##Zrmb: \
2170 case X86::VPERMT2##Suffix##Zrmb: \
2171 case X86::VPERMI2##Suffix##Z128rmbkz: \
2172 case X86::VPERMT2##Suffix##Z128rmbkz: \
2173 case X86::VPERMI2##Suffix##Z256rmbkz: \
2174 case X86::VPERMT2##Suffix##Z256rmbkz: \
2175 case X86::VPERMI2##Suffix##Zrmbkz: \
2176 case X86::VPERMT2##Suffix##Zrmbkz:
2177
2178 switch (Opcode) {
2179 default:
2180 return false;
2181 VPERM_CASES(B)
2186 VPERM_CASES(W)
2187 return true;
2188 }
2189#undef VPERM_CASES_BROADCAST
2190#undef VPERM_CASES
2191}
2192
2193// Returns commuted opcode for VPERMI2 and VPERMT2 instructions by switching
2194// from the I opcode to the T opcode and vice versa.
2195static unsigned getCommutedVPERMV3Opcode(unsigned Opcode) {
2196#define VPERM_CASES(Orig, New) \
2197 case X86::Orig##Z128rr: \
2198 return X86::New##Z128rr; \
2199 case X86::Orig##Z128rrkz: \
2200 return X86::New##Z128rrkz; \
2201 case X86::Orig##Z128rm: \
2202 return X86::New##Z128rm; \
2203 case X86::Orig##Z128rmkz: \
2204 return X86::New##Z128rmkz; \
2205 case X86::Orig##Z256rr: \
2206 return X86::New##Z256rr; \
2207 case X86::Orig##Z256rrkz: \
2208 return X86::New##Z256rrkz; \
2209 case X86::Orig##Z256rm: \
2210 return X86::New##Z256rm; \
2211 case X86::Orig##Z256rmkz: \
2212 return X86::New##Z256rmkz; \
2213 case X86::Orig##Zrr: \
2214 return X86::New##Zrr; \
2215 case X86::Orig##Zrrkz: \
2216 return X86::New##Zrrkz; \
2217 case X86::Orig##Zrm: \
2218 return X86::New##Zrm; \
2219 case X86::Orig##Zrmkz: \
2220 return X86::New##Zrmkz;
2221
2222#define VPERM_CASES_BROADCAST(Orig, New) \
2223 VPERM_CASES(Orig, New) \
2224 case X86::Orig##Z128rmb: \
2225 return X86::New##Z128rmb; \
2226 case X86::Orig##Z128rmbkz: \
2227 return X86::New##Z128rmbkz; \
2228 case X86::Orig##Z256rmb: \
2229 return X86::New##Z256rmb; \
2230 case X86::Orig##Z256rmbkz: \
2231 return X86::New##Z256rmbkz; \
2232 case X86::Orig##Zrmb: \
2233 return X86::New##Zrmb; \
2234 case X86::Orig##Zrmbkz: \
2235 return X86::New##Zrmbkz;
2236
2237 switch (Opcode) {
2238 VPERM_CASES(VPERMI2B, VPERMT2B)
2239 VPERM_CASES_BROADCAST(VPERMI2D, VPERMT2D)
2240 VPERM_CASES_BROADCAST(VPERMI2PD, VPERMT2PD)
2241 VPERM_CASES_BROADCAST(VPERMI2PS, VPERMT2PS)
2242 VPERM_CASES_BROADCAST(VPERMI2Q, VPERMT2Q)
2243 VPERM_CASES(VPERMI2W, VPERMT2W)
2244 VPERM_CASES(VPERMT2B, VPERMI2B)
2245 VPERM_CASES_BROADCAST(VPERMT2D, VPERMI2D)
2246 VPERM_CASES_BROADCAST(VPERMT2PD, VPERMI2PD)
2247 VPERM_CASES_BROADCAST(VPERMT2PS, VPERMI2PS)
2248 VPERM_CASES_BROADCAST(VPERMT2Q, VPERMI2Q)
2249 VPERM_CASES(VPERMT2W, VPERMI2W)
2250 }
2251
2252 llvm_unreachable("Unreachable!");
2253#undef VPERM_CASES_BROADCAST
2254#undef VPERM_CASES
2255}
2256
2258 unsigned OpIdx1,
2259 unsigned OpIdx2) const {
2260 auto CloneIfNew = [&](MachineInstr &MI) {
2261 return std::exchange(NewMI, false)
2262 ? MI.getParent()->getParent()->CloneMachineInstr(&MI)
2263 : &MI;
2264 };
2265 MachineInstr *WorkingMI = nullptr;
2266 unsigned Opc = MI.getOpcode();
2267
2268#define CASE_ND(OP) \
2269 case X86::OP: \
2270 case X86::OP##_ND:
2271
2272 switch (Opc) {
2273 // SHLD B, C, I <-> SHRD C, B, (BitWidth - I)
2274 CASE_ND(SHRD16rri8)
2275 CASE_ND(SHLD16rri8)
2276 CASE_ND(SHRD32rri8)
2277 CASE_ND(SHLD32rri8)
2278 CASE_ND(SHRD64rri8)
2279 CASE_ND(SHLD64rri8) {
2280 unsigned Size;
2281 switch (Opc) {
2282 default:
2283 llvm_unreachable("Unreachable!");
2284#define FROM_TO_SIZE(A, B, S) \
2285 case X86::A: \
2286 Opc = X86::B; \
2287 Size = S; \
2288 break; \
2289 case X86::A##_ND: \
2290 Opc = X86::B##_ND; \
2291 Size = S; \
2292 break; \
2293 case X86::B: \
2294 Opc = X86::A; \
2295 Size = S; \
2296 break; \
2297 case X86::B##_ND: \
2298 Opc = X86::A##_ND; \
2299 Size = S; \
2300 break;
2301
2302 FROM_TO_SIZE(SHRD16rri8, SHLD16rri8, 16)
2303 FROM_TO_SIZE(SHRD32rri8, SHLD32rri8, 32)
2304 FROM_TO_SIZE(SHRD64rri8, SHLD64rri8, 64)
2305#undef FROM_TO_SIZE
2306 }
2307 WorkingMI = CloneIfNew(MI);
2308 WorkingMI->setDesc(get(Opc));
2309 WorkingMI->getOperand(3).setImm(Size - MI.getOperand(3).getImm());
2310 break;
2311 }
2312 case X86::PFSUBrr:
2313 case X86::PFSUBRrr:
2314 // PFSUB x, y: x = x - y
2315 // PFSUBR x, y: x = y - x
2316 WorkingMI = CloneIfNew(MI);
2317 WorkingMI->setDesc(
2318 get(X86::PFSUBRrr == Opc ? X86::PFSUBrr : X86::PFSUBRrr));
2319 break;
2320 case X86::BLENDPDrri:
2321 case X86::BLENDPSrri:
2322 case X86::PBLENDWrri:
2323 case X86::VBLENDPDrri:
2324 case X86::VBLENDPSrri:
2325 case X86::VBLENDPDYrri:
2326 case X86::VBLENDPSYrri:
2327 case X86::VPBLENDDrri:
2328 case X86::VPBLENDWrri:
2329 case X86::VPBLENDDYrri:
2330 case X86::VPBLENDWYrri: {
2331 int8_t Mask;
2332 switch (Opc) {
2333 default:
2334 llvm_unreachable("Unreachable!");
2335 case X86::BLENDPDrri:
2336 Mask = (int8_t)0x03;
2337 break;
2338 case X86::BLENDPSrri:
2339 Mask = (int8_t)0x0F;
2340 break;
2341 case X86::PBLENDWrri:
2342 Mask = (int8_t)0xFF;
2343 break;
2344 case X86::VBLENDPDrri:
2345 Mask = (int8_t)0x03;
2346 break;
2347 case X86::VBLENDPSrri:
2348 Mask = (int8_t)0x0F;
2349 break;
2350 case X86::VBLENDPDYrri:
2351 Mask = (int8_t)0x0F;
2352 break;
2353 case X86::VBLENDPSYrri:
2354 Mask = (int8_t)0xFF;
2355 break;
2356 case X86::VPBLENDDrri:
2357 Mask = (int8_t)0x0F;
2358 break;
2359 case X86::VPBLENDWrri:
2360 Mask = (int8_t)0xFF;
2361 break;
2362 case X86::VPBLENDDYrri:
2363 Mask = (int8_t)0xFF;
2364 break;
2365 case X86::VPBLENDWYrri:
2366 Mask = (int8_t)0xFF;
2367 break;
2368 }
2369 // Only the least significant bits of Imm are used.
2370 // Using int8_t to ensure it will be sign extended to the int64_t that
2371 // setImm takes in order to match isel behavior.
2372 int8_t Imm = MI.getOperand(3).getImm() & Mask;
2373 WorkingMI = CloneIfNew(MI);
2374 WorkingMI->getOperand(3).setImm(Mask ^ Imm);
2375 break;
2376 }
2377 case X86::INSERTPSrri:
2378 case X86::VINSERTPSrri:
2379 case X86::VINSERTPSZrri: {
2380 unsigned Imm = MI.getOperand(MI.getNumOperands() - 1).getImm();
2381 unsigned ZMask = Imm & 15;
2382 unsigned DstIdx = (Imm >> 4) & 3;
2383 unsigned SrcIdx = (Imm >> 6) & 3;
2384
2385 // We can commute insertps if we zero 2 of the elements, the insertion is
2386 // "inline" and we don't override the insertion with a zero.
2387 if (DstIdx == SrcIdx && (ZMask & (1 << DstIdx)) == 0 &&
2388 llvm::popcount(ZMask) == 2) {
2389 unsigned AltIdx = llvm::countr_zero((ZMask | (1 << DstIdx)) ^ 15);
2390 assert(AltIdx < 4 && "Illegal insertion index");
2391 unsigned AltImm = (AltIdx << 6) | (AltIdx << 4) | ZMask;
2392 WorkingMI = CloneIfNew(MI);
2393 WorkingMI->getOperand(MI.getNumOperands() - 1).setImm(AltImm);
2394 break;
2395 }
2396 return nullptr;
2397 }
2398 case X86::MOVSDrr:
2399 case X86::MOVSSrr:
2400 case X86::VMOVSDrr:
2401 case X86::VMOVSSrr: {
2402 // On SSE41 or later we can commute a MOVSS/MOVSD to a BLENDPS/BLENDPD.
2403 if (Subtarget.hasSSE41()) {
2404 unsigned Mask;
2405 switch (Opc) {
2406 default:
2407 llvm_unreachable("Unreachable!");
2408 case X86::MOVSDrr:
2409 Opc = X86::BLENDPDrri;
2410 Mask = 0x02;
2411 break;
2412 case X86::MOVSSrr:
2413 Opc = X86::BLENDPSrri;
2414 Mask = 0x0E;
2415 break;
2416 case X86::VMOVSDrr:
2417 Opc = X86::VBLENDPDrri;
2418 Mask = 0x02;
2419 break;
2420 case X86::VMOVSSrr:
2421 Opc = X86::VBLENDPSrri;
2422 Mask = 0x0E;
2423 break;
2424 }
2425
2426 WorkingMI = CloneIfNew(MI);
2427 WorkingMI->setDesc(get(Opc));
2428 WorkingMI->addOperand(MachineOperand::CreateImm(Mask));
2429 break;
2430 }
2431
2432 assert(Opc == X86::MOVSDrr && "Only MOVSD can commute to SHUFPD");
2433 WorkingMI = CloneIfNew(MI);
2434 WorkingMI->setDesc(get(X86::SHUFPDrri));
2435 WorkingMI->addOperand(MachineOperand::CreateImm(0x02));
2436 break;
2437 }
2438 case X86::SHUFPDrri: {
2439 // Commute to MOVSD.
2440 assert(MI.getOperand(3).getImm() == 0x02 && "Unexpected immediate!");
2441 WorkingMI = CloneIfNew(MI);
2442 WorkingMI->setDesc(get(X86::MOVSDrr));
2443 WorkingMI->removeOperand(3);
2444 break;
2445 }
2446 case X86::PCLMULQDQrri:
2447 case X86::VPCLMULQDQrri:
2448 case X86::VPCLMULQDQYrri:
2449 case X86::VPCLMULQDQZrri:
2450 case X86::VPCLMULQDQZ128rri:
2451 case X86::VPCLMULQDQZ256rri: {
2452 // SRC1 64bits = Imm[0] ? SRC1[127:64] : SRC1[63:0]
2453 // SRC2 64bits = Imm[4] ? SRC2[127:64] : SRC2[63:0]
2454 unsigned Imm = MI.getOperand(3).getImm();
2455 unsigned Src1Hi = Imm & 0x01;
2456 unsigned Src2Hi = Imm & 0x10;
2457 WorkingMI = CloneIfNew(MI);
2458 WorkingMI->getOperand(3).setImm((Src1Hi << 4) | (Src2Hi >> 4));
2459 break;
2460 }
2461 case X86::VPCMPBZ128rri:
2462 case X86::VPCMPUBZ128rri:
2463 case X86::VPCMPBZ256rri:
2464 case X86::VPCMPUBZ256rri:
2465 case X86::VPCMPBZrri:
2466 case X86::VPCMPUBZrri:
2467 case X86::VPCMPDZ128rri:
2468 case X86::VPCMPUDZ128rri:
2469 case X86::VPCMPDZ256rri:
2470 case X86::VPCMPUDZ256rri:
2471 case X86::VPCMPDZrri:
2472 case X86::VPCMPUDZrri:
2473 case X86::VPCMPQZ128rri:
2474 case X86::VPCMPUQZ128rri:
2475 case X86::VPCMPQZ256rri:
2476 case X86::VPCMPUQZ256rri:
2477 case X86::VPCMPQZrri:
2478 case X86::VPCMPUQZrri:
2479 case X86::VPCMPWZ128rri:
2480 case X86::VPCMPUWZ128rri:
2481 case X86::VPCMPWZ256rri:
2482 case X86::VPCMPUWZ256rri:
2483 case X86::VPCMPWZrri:
2484 case X86::VPCMPUWZrri:
2485 case X86::VPCMPBZ128rrik:
2486 case X86::VPCMPUBZ128rrik:
2487 case X86::VPCMPBZ256rrik:
2488 case X86::VPCMPUBZ256rrik:
2489 case X86::VPCMPBZrrik:
2490 case X86::VPCMPUBZrrik:
2491 case X86::VPCMPDZ128rrik:
2492 case X86::VPCMPUDZ128rrik:
2493 case X86::VPCMPDZ256rrik:
2494 case X86::VPCMPUDZ256rrik:
2495 case X86::VPCMPDZrrik:
2496 case X86::VPCMPUDZrrik:
2497 case X86::VPCMPQZ128rrik:
2498 case X86::VPCMPUQZ128rrik:
2499 case X86::VPCMPQZ256rrik:
2500 case X86::VPCMPUQZ256rrik:
2501 case X86::VPCMPQZrrik:
2502 case X86::VPCMPUQZrrik:
2503 case X86::VPCMPWZ128rrik:
2504 case X86::VPCMPUWZ128rrik:
2505 case X86::VPCMPWZ256rrik:
2506 case X86::VPCMPUWZ256rrik:
2507 case X86::VPCMPWZrrik:
2508 case X86::VPCMPUWZrrik:
2509 WorkingMI = CloneIfNew(MI);
2510 // Flip comparison mode immediate (if necessary).
2511 WorkingMI->getOperand(MI.getNumOperands() - 1)
2513 MI.getOperand(MI.getNumOperands() - 1).getImm() & 0x7));
2514 break;
2515 case X86::VPCOMBri:
2516 case X86::VPCOMUBri:
2517 case X86::VPCOMDri:
2518 case X86::VPCOMUDri:
2519 case X86::VPCOMQri:
2520 case X86::VPCOMUQri:
2521 case X86::VPCOMWri:
2522 case X86::VPCOMUWri:
2523 WorkingMI = CloneIfNew(MI);
2524 // Flip comparison mode immediate (if necessary).
2525 WorkingMI->getOperand(3).setImm(
2526 X86::getSwappedVPCOMImm(MI.getOperand(3).getImm() & 0x7));
2527 break;
2528 case X86::VCMPSDZrri:
2529 case X86::VCMPSSZrri:
2530 case X86::VCMPPDZrri:
2531 case X86::VCMPPSZrri:
2532 case X86::VCMPSHZrri:
2533 case X86::VCMPPHZrri:
2534 case X86::VCMPPHZ128rri:
2535 case X86::VCMPPHZ256rri:
2536 case X86::VCMPPDZ128rri:
2537 case X86::VCMPPSZ128rri:
2538 case X86::VCMPPDZ256rri:
2539 case X86::VCMPPSZ256rri:
2540 case X86::VCMPPDZrrik:
2541 case X86::VCMPPSZrrik:
2542 case X86::VCMPPHZrrik:
2543 case X86::VCMPPDZ128rrik:
2544 case X86::VCMPPSZ128rrik:
2545 case X86::VCMPPHZ128rrik:
2546 case X86::VCMPPDZ256rrik:
2547 case X86::VCMPPSZ256rrik:
2548 case X86::VCMPPHZ256rrik:
2549 WorkingMI = CloneIfNew(MI);
2550 WorkingMI->getOperand(MI.getNumExplicitOperands() - 1)
2552 MI.getOperand(MI.getNumExplicitOperands() - 1).getImm() & 0x1f));
2553 break;
2554 case X86::VPERM2F128rri:
2555 case X86::VPERM2I128rri:
2556 // Flip permute source immediate.
2557 // Imm & 0x02: lo = if set, select Op1.lo/hi else Op0.lo/hi.
2558 // Imm & 0x20: hi = if set, select Op1.lo/hi else Op0.lo/hi.
2559 WorkingMI = CloneIfNew(MI);
2560 WorkingMI->getOperand(3).setImm((MI.getOperand(3).getImm() & 0xFF) ^ 0x22);
2561 break;
2562 case X86::MOVHLPSrr:
2563 case X86::UNPCKHPDrr:
2564 case X86::VMOVHLPSrr:
2565 case X86::VUNPCKHPDrr:
2566 case X86::VMOVHLPSZrr:
2567 case X86::VUNPCKHPDZ128rr:
2568 assert(Subtarget.hasSSE2() && "Commuting MOVHLP/UNPCKHPD requires SSE2!");
2569
2570 switch (Opc) {
2571 default:
2572 llvm_unreachable("Unreachable!");
2573 case X86::MOVHLPSrr:
2574 Opc = X86::UNPCKHPDrr;
2575 break;
2576 case X86::UNPCKHPDrr:
2577 Opc = X86::MOVHLPSrr;
2578 break;
2579 case X86::VMOVHLPSrr:
2580 Opc = X86::VUNPCKHPDrr;
2581 break;
2582 case X86::VUNPCKHPDrr:
2583 Opc = X86::VMOVHLPSrr;
2584 break;
2585 case X86::VMOVHLPSZrr:
2586 Opc = X86::VUNPCKHPDZ128rr;
2587 break;
2588 case X86::VUNPCKHPDZ128rr:
2589 Opc = X86::VMOVHLPSZrr;
2590 break;
2591 }
2592 WorkingMI = CloneIfNew(MI);
2593 WorkingMI->setDesc(get(Opc));
2594 break;
2595 CASE_ND(CMOV16rr)
2596 CASE_ND(CMOV32rr)
2597 CASE_ND(CMOV64rr) {
2598 WorkingMI = CloneIfNew(MI);
2599 unsigned OpNo = MI.getDesc().getNumOperands() - 1;
2600 X86::CondCode CC = static_cast<X86::CondCode>(MI.getOperand(OpNo).getImm());
2602 break;
2603 }
2604 case X86::VPTERNLOGDZrri:
2605 case X86::VPTERNLOGDZrmi:
2606 case X86::VPTERNLOGDZ128rri:
2607 case X86::VPTERNLOGDZ128rmi:
2608 case X86::VPTERNLOGDZ256rri:
2609 case X86::VPTERNLOGDZ256rmi:
2610 case X86::VPTERNLOGQZrri:
2611 case X86::VPTERNLOGQZrmi:
2612 case X86::VPTERNLOGQZ128rri:
2613 case X86::VPTERNLOGQZ128rmi:
2614 case X86::VPTERNLOGQZ256rri:
2615 case X86::VPTERNLOGQZ256rmi:
2616 case X86::VPTERNLOGDZrrik:
2617 case X86::VPTERNLOGDZ128rrik:
2618 case X86::VPTERNLOGDZ256rrik:
2619 case X86::VPTERNLOGQZrrik:
2620 case X86::VPTERNLOGQZ128rrik:
2621 case X86::VPTERNLOGQZ256rrik:
2622 case X86::VPTERNLOGDZrrikz:
2623 case X86::VPTERNLOGDZrmikz:
2624 case X86::VPTERNLOGDZ128rrikz:
2625 case X86::VPTERNLOGDZ128rmikz:
2626 case X86::VPTERNLOGDZ256rrikz:
2627 case X86::VPTERNLOGDZ256rmikz:
2628 case X86::VPTERNLOGQZrrikz:
2629 case X86::VPTERNLOGQZrmikz:
2630 case X86::VPTERNLOGQZ128rrikz:
2631 case X86::VPTERNLOGQZ128rmikz:
2632 case X86::VPTERNLOGQZ256rrikz:
2633 case X86::VPTERNLOGQZ256rmikz:
2634 case X86::VPTERNLOGDZ128rmbi:
2635 case X86::VPTERNLOGDZ256rmbi:
2636 case X86::VPTERNLOGDZrmbi:
2637 case X86::VPTERNLOGQZ128rmbi:
2638 case X86::VPTERNLOGQZ256rmbi:
2639 case X86::VPTERNLOGQZrmbi:
2640 case X86::VPTERNLOGDZ128rmbikz:
2641 case X86::VPTERNLOGDZ256rmbikz:
2642 case X86::VPTERNLOGDZrmbikz:
2643 case X86::VPTERNLOGQZ128rmbikz:
2644 case X86::VPTERNLOGQZ256rmbikz:
2645 case X86::VPTERNLOGQZrmbikz: {
2646 WorkingMI = CloneIfNew(MI);
2647 commuteVPTERNLOG(*WorkingMI, OpIdx1, OpIdx2);
2648 break;
2649 }
2650 default:
2652 WorkingMI = CloneIfNew(MI);
2654 break;
2655 }
2656
2657 if (auto *FMA3Group = getFMA3Group(Opc, MI.getDesc().TSFlags)) {
2658 WorkingMI = CloneIfNew(MI);
2659 WorkingMI->setDesc(
2660 get(getFMA3OpcodeToCommuteOperands(MI, OpIdx1, OpIdx2, *FMA3Group)));
2661 break;
2662 }
2663 }
2664 return TargetInstrInfo::commuteInstructionImpl(MI, NewMI, OpIdx1, OpIdx2);
2665}
2666
2667bool X86InstrInfo::findThreeSrcCommutedOpIndices(const MachineInstr &MI,
2668 unsigned &SrcOpIdx1,
2669 unsigned &SrcOpIdx2,
2670 bool IsIntrinsic) const {
2671 uint64_t TSFlags = MI.getDesc().TSFlags;
2672
2673 unsigned FirstCommutableVecOp = 1;
2674 unsigned LastCommutableVecOp = 3;
2675 unsigned KMaskOp = -1U;
2676 if (X86II::isKMasked(TSFlags)) {
2677 // For k-zero-masked operations it is Ok to commute the first vector
2678 // operand. Unless this is an intrinsic instruction.
2679 // For regular k-masked operations a conservative choice is done as the
2680 // elements of the first vector operand, for which the corresponding bit
2681 // in the k-mask operand is set to 0, are copied to the result of the
2682 // instruction.
2683 // TODO/FIXME: The commute still may be legal if it is known that the
2684 // k-mask operand is set to either all ones or all zeroes.
2685 // It is also Ok to commute the 1st operand if all users of MI use only
2686 // the elements enabled by the k-mask operand. For example,
2687 // v4 = VFMADD213PSZrk v1, k, v2, v3; // v1[i] = k[i] ? v2[i]*v1[i]+v3[i]
2688 // : v1[i];
2689 // VMOVAPSZmrk <mem_addr>, k, v4; // this is the ONLY user of v4 ->
2690 // // Ok, to commute v1 in FMADD213PSZrk.
2691
2692 // The k-mask operand has index = 2 for masked and zero-masked operations.
2693 KMaskOp = 2;
2694
2695 // The operand with index = 1 is used as a source for those elements for
2696 // which the corresponding bit in the k-mask is set to 0.
2697 if (X86II::isKMergeMasked(TSFlags) || IsIntrinsic)
2698 FirstCommutableVecOp = 3;
2699
2700 LastCommutableVecOp++;
2701 } else if (IsIntrinsic) {
2702 // Commuting the first operand of an intrinsic instruction isn't possible
2703 // unless we can prove that only the lowest element of the result is used.
2704 FirstCommutableVecOp = 2;
2705 }
2706
2707 if (isMem(MI, LastCommutableVecOp))
2708 LastCommutableVecOp--;
2709
2710 // Only the first RegOpsNum operands are commutable.
2711 // Also, the value 'CommuteAnyOperandIndex' is valid here as it means
2712 // that the operand is not specified/fixed.
2713 if (SrcOpIdx1 != CommuteAnyOperandIndex &&
2714 (SrcOpIdx1 < FirstCommutableVecOp || SrcOpIdx1 > LastCommutableVecOp ||
2715 SrcOpIdx1 == KMaskOp))
2716 return false;
2717 if (SrcOpIdx2 != CommuteAnyOperandIndex &&
2718 (SrcOpIdx2 < FirstCommutableVecOp || SrcOpIdx2 > LastCommutableVecOp ||
2719 SrcOpIdx2 == KMaskOp))
2720 return false;
2721
2722 // Look for two different register operands assumed to be commutable
2723 // regardless of the FMA opcode. The FMA opcode is adjusted later.
2724 if (SrcOpIdx1 == CommuteAnyOperandIndex ||
2725 SrcOpIdx2 == CommuteAnyOperandIndex) {
2726 unsigned CommutableOpIdx2 = SrcOpIdx2;
2727
2728 // At least one of operands to be commuted is not specified and
2729 // this method is free to choose appropriate commutable operands.
2730 if (SrcOpIdx1 == SrcOpIdx2)
2731 // Both of operands are not fixed. By default set one of commutable
2732 // operands to the last register operand of the instruction.
2733 CommutableOpIdx2 = LastCommutableVecOp;
2734 else if (SrcOpIdx2 == CommuteAnyOperandIndex)
2735 // Only one of operands is not fixed.
2736 CommutableOpIdx2 = SrcOpIdx1;
2737
2738 // CommutableOpIdx2 is well defined now. Let's choose another commutable
2739 // operand and assign its index to CommutableOpIdx1.
2740 Register Op2Reg = MI.getOperand(CommutableOpIdx2).getReg();
2741
2742 unsigned CommutableOpIdx1;
2743 for (CommutableOpIdx1 = LastCommutableVecOp;
2744 CommutableOpIdx1 >= FirstCommutableVecOp; CommutableOpIdx1--) {
2745 // Just ignore and skip the k-mask operand.
2746 if (CommutableOpIdx1 == KMaskOp)
2747 continue;
2748
2749 // The commuted operands must have different registers.
2750 // Otherwise, the commute transformation does not change anything and
2751 // is useless then.
2752 if (Op2Reg != MI.getOperand(CommutableOpIdx1).getReg())
2753 break;
2754 }
2755
2756 // No appropriate commutable operands were found.
2757 if (CommutableOpIdx1 < FirstCommutableVecOp)
2758 return false;
2759
2760 // Assign the found pair of commutable indices to SrcOpIdx1 and SrcOpidx2
2761 // to return those values.
2762 if (!fixCommutedOpIndices(SrcOpIdx1, SrcOpIdx2, CommutableOpIdx1,
2763 CommutableOpIdx2))
2764 return false;
2765 }
2766
2767 return true;
2768}
2769
2771 unsigned &SrcOpIdx1,
2772 unsigned &SrcOpIdx2) const {
2773 const MCInstrDesc &Desc = MI.getDesc();
2774 if (!Desc.isCommutable())
2775 return false;
2776
2777 switch (MI.getOpcode()) {
2778 case X86::CMPSDrri:
2779 case X86::CMPSSrri:
2780 case X86::CMPPDrri:
2781 case X86::CMPPSrri:
2782 case X86::VCMPSDrri:
2783 case X86::VCMPSSrri:
2784 case X86::VCMPPDrri:
2785 case X86::VCMPPSrri:
2786 case X86::VCMPPDYrri:
2787 case X86::VCMPPSYrri:
2788 case X86::VCMPSDZrri:
2789 case X86::VCMPSSZrri:
2790 case X86::VCMPPDZrri:
2791 case X86::VCMPPSZrri:
2792 case X86::VCMPSHZrri:
2793 case X86::VCMPPHZrri:
2794 case X86::VCMPPHZ128rri:
2795 case X86::VCMPPHZ256rri:
2796 case X86::VCMPPDZ128rri:
2797 case X86::VCMPPSZ128rri:
2798 case X86::VCMPPDZ256rri:
2799 case X86::VCMPPSZ256rri:
2800 case X86::VCMPPDZrrik:
2801 case X86::VCMPPSZrrik:
2802 case X86::VCMPPHZrrik:
2803 case X86::VCMPPDZ128rrik:
2804 case X86::VCMPPSZ128rrik:
2805 case X86::VCMPPHZ128rrik:
2806 case X86::VCMPPDZ256rrik:
2807 case X86::VCMPPSZ256rrik:
2808 case X86::VCMPPHZ256rrik: {
2809 unsigned OpOffset = X86II::isKMasked(Desc.TSFlags) ? 1 : 0;
2810
2811 // Float comparison can be safely commuted for
2812 // Ordered/Unordered/Equal/NotEqual tests
2813 unsigned Imm = MI.getOperand(3 + OpOffset).getImm() & 0x7;
2814 switch (Imm) {
2815 default:
2816 // EVEX versions can be commuted.
2817 if ((Desc.TSFlags & X86II::EncodingMask) == X86II::EVEX)
2818 break;
2819 return false;
2820 case 0x00: // EQUAL
2821 case 0x03: // UNORDERED
2822 case 0x04: // NOT EQUAL
2823 case 0x07: // ORDERED
2824 break;
2825 }
2826
2827 // The indices of the commutable operands are 1 and 2 (or 2 and 3
2828 // when masked).
2829 // Assign them to the returned operand indices here.
2830 return fixCommutedOpIndices(SrcOpIdx1, SrcOpIdx2, 1 + OpOffset,
2831 2 + OpOffset);
2832 }
2833 case X86::MOVSSrr:
2834 // X86::MOVSDrr is always commutable. MOVSS is only commutable if we can
2835 // form sse4.1 blend. We assume VMOVSSrr/VMOVSDrr is always commutable since
2836 // AVX implies sse4.1.
2837 if (Subtarget.hasSSE41())
2838 return TargetInstrInfo::findCommutedOpIndices(MI, SrcOpIdx1, SrcOpIdx2);
2839 return false;
2840 case X86::SHUFPDrri:
2841 // We can commute this to MOVSD.
2842 if (MI.getOperand(3).getImm() == 0x02)
2843 return TargetInstrInfo::findCommutedOpIndices(MI, SrcOpIdx1, SrcOpIdx2);
2844 return false;
2845 case X86::MOVHLPSrr:
2846 case X86::UNPCKHPDrr:
2847 case X86::VMOVHLPSrr:
2848 case X86::VUNPCKHPDrr:
2849 case X86::VMOVHLPSZrr:
2850 case X86::VUNPCKHPDZ128rr:
2851 if (Subtarget.hasSSE2())
2852 return TargetInstrInfo::findCommutedOpIndices(MI, SrcOpIdx1, SrcOpIdx2);
2853 return false;
2854 case X86::VPTERNLOGDZrri:
2855 case X86::VPTERNLOGDZrmi:
2856 case X86::VPTERNLOGDZ128rri:
2857 case X86::VPTERNLOGDZ128rmi:
2858 case X86::VPTERNLOGDZ256rri:
2859 case X86::VPTERNLOGDZ256rmi:
2860 case X86::VPTERNLOGQZrri:
2861 case X86::VPTERNLOGQZrmi:
2862 case X86::VPTERNLOGQZ128rri:
2863 case X86::VPTERNLOGQZ128rmi:
2864 case X86::VPTERNLOGQZ256rri:
2865 case X86::VPTERNLOGQZ256rmi:
2866 case X86::VPTERNLOGDZrrik:
2867 case X86::VPTERNLOGDZ128rrik:
2868 case X86::VPTERNLOGDZ256rrik:
2869 case X86::VPTERNLOGQZrrik:
2870 case X86::VPTERNLOGQZ128rrik:
2871 case X86::VPTERNLOGQZ256rrik:
2872 case X86::VPTERNLOGDZrrikz:
2873 case X86::VPTERNLOGDZrmikz:
2874 case X86::VPTERNLOGDZ128rrikz:
2875 case X86::VPTERNLOGDZ128rmikz:
2876 case X86::VPTERNLOGDZ256rrikz:
2877 case X86::VPTERNLOGDZ256rmikz:
2878 case X86::VPTERNLOGQZrrikz:
2879 case X86::VPTERNLOGQZrmikz:
2880 case X86::VPTERNLOGQZ128rrikz:
2881 case X86::VPTERNLOGQZ128rmikz:
2882 case X86::VPTERNLOGQZ256rrikz:
2883 case X86::VPTERNLOGQZ256rmikz:
2884 case X86::VPTERNLOGDZ128rmbi:
2885 case X86::VPTERNLOGDZ256rmbi:
2886 case X86::VPTERNLOGDZrmbi:
2887 case X86::VPTERNLOGQZ128rmbi:
2888 case X86::VPTERNLOGQZ256rmbi:
2889 case X86::VPTERNLOGQZrmbi:
2890 case X86::VPTERNLOGDZ128rmbikz:
2891 case X86::VPTERNLOGDZ256rmbikz:
2892 case X86::VPTERNLOGDZrmbikz:
2893 case X86::VPTERNLOGQZ128rmbikz:
2894 case X86::VPTERNLOGQZ256rmbikz:
2895 case X86::VPTERNLOGQZrmbikz:
2896 return findThreeSrcCommutedOpIndices(MI, SrcOpIdx1, SrcOpIdx2);
2897 case X86::VPDPWSSDYrr:
2898 case X86::VPDPWSSDrr:
2899 case X86::VPDPWSSDSYrr:
2900 case X86::VPDPWSSDSrr:
2901 case X86::VPDPWUUDrr:
2902 case X86::VPDPWUUDYrr:
2903 case X86::VPDPWUUDSrr:
2904 case X86::VPDPWUUDSYrr:
2905 case X86::VPDPBSSDSrr:
2906 case X86::VPDPBSSDSYrr:
2907 case X86::VPDPBSSDrr:
2908 case X86::VPDPBSSDYrr:
2909 case X86::VPDPBUUDSrr:
2910 case X86::VPDPBUUDSYrr:
2911 case X86::VPDPBUUDrr:
2912 case X86::VPDPBUUDYrr:
2913 case X86::VPDPBSSDSZ128rr:
2914 case X86::VPDPBSSDSZ128rrk:
2915 case X86::VPDPBSSDSZ128rrkz:
2916 case X86::VPDPBSSDSZ256rr:
2917 case X86::VPDPBSSDSZ256rrk:
2918 case X86::VPDPBSSDSZ256rrkz:
2919 case X86::VPDPBSSDSZrr:
2920 case X86::VPDPBSSDSZrrk:
2921 case X86::VPDPBSSDSZrrkz:
2922 case X86::VPDPBSSDZ128rr:
2923 case X86::VPDPBSSDZ128rrk:
2924 case X86::VPDPBSSDZ128rrkz:
2925 case X86::VPDPBSSDZ256rr:
2926 case X86::VPDPBSSDZ256rrk:
2927 case X86::VPDPBSSDZ256rrkz:
2928 case X86::VPDPBSSDZrr:
2929 case X86::VPDPBSSDZrrk:
2930 case X86::VPDPBSSDZrrkz:
2931 case X86::VPDPBUUDSZ128rr:
2932 case X86::VPDPBUUDSZ128rrk:
2933 case X86::VPDPBUUDSZ128rrkz:
2934 case X86::VPDPBUUDSZ256rr:
2935 case X86::VPDPBUUDSZ256rrk:
2936 case X86::VPDPBUUDSZ256rrkz:
2937 case X86::VPDPBUUDSZrr:
2938 case X86::VPDPBUUDSZrrk:
2939 case X86::VPDPBUUDSZrrkz:
2940 case X86::VPDPBUUDZ128rr:
2941 case X86::VPDPBUUDZ128rrk:
2942 case X86::VPDPBUUDZ128rrkz:
2943 case X86::VPDPBUUDZ256rr:
2944 case X86::VPDPBUUDZ256rrk:
2945 case X86::VPDPBUUDZ256rrkz:
2946 case X86::VPDPBUUDZrr:
2947 case X86::VPDPBUUDZrrk:
2948 case X86::VPDPBUUDZrrkz:
2949 case X86::VPDPWSSDZ128rr:
2950 case X86::VPDPWSSDZ128rrk:
2951 case X86::VPDPWSSDZ128rrkz:
2952 case X86::VPDPWSSDZ256rr:
2953 case X86::VPDPWSSDZ256rrk:
2954 case X86::VPDPWSSDZ256rrkz:
2955 case X86::VPDPWSSDZrr:
2956 case X86::VPDPWSSDZrrk:
2957 case X86::VPDPWSSDZrrkz:
2958 case X86::VPDPWSSDSZ128rr:
2959 case X86::VPDPWSSDSZ128rrk:
2960 case X86::VPDPWSSDSZ128rrkz:
2961 case X86::VPDPWSSDSZ256rr:
2962 case X86::VPDPWSSDSZ256rrk:
2963 case X86::VPDPWSSDSZ256rrkz:
2964 case X86::VPDPWSSDSZrr:
2965 case X86::VPDPWSSDSZrrk:
2966 case X86::VPDPWSSDSZrrkz:
2967 case X86::VPDPWUUDZ128rr:
2968 case X86::VPDPWUUDZ128rrk:
2969 case X86::VPDPWUUDZ128rrkz:
2970 case X86::VPDPWUUDZ256rr:
2971 case X86::VPDPWUUDZ256rrk:
2972 case X86::VPDPWUUDZ256rrkz:
2973 case X86::VPDPWUUDZrr:
2974 case X86::VPDPWUUDZrrk:
2975 case X86::VPDPWUUDZrrkz:
2976 case X86::VPDPWUUDSZ128rr:
2977 case X86::VPDPWUUDSZ128rrk:
2978 case X86::VPDPWUUDSZ128rrkz:
2979 case X86::VPDPWUUDSZ256rr:
2980 case X86::VPDPWUUDSZ256rrk:
2981 case X86::VPDPWUUDSZ256rrkz:
2982 case X86::VPDPWUUDSZrr:
2983 case X86::VPDPWUUDSZrrk:
2984 case X86::VPDPWUUDSZrrkz:
2985 case X86::VPMADD52HUQrr:
2986 case X86::VPMADD52HUQYrr:
2987 case X86::VPMADD52HUQZ128r:
2988 case X86::VPMADD52HUQZ128rk:
2989 case X86::VPMADD52HUQZ128rkz:
2990 case X86::VPMADD52HUQZ256r:
2991 case X86::VPMADD52HUQZ256rk:
2992 case X86::VPMADD52HUQZ256rkz:
2993 case X86::VPMADD52HUQZr:
2994 case X86::VPMADD52HUQZrk:
2995 case X86::VPMADD52HUQZrkz:
2996 case X86::VPMADD52LUQrr:
2997 case X86::VPMADD52LUQYrr:
2998 case X86::VPMADD52LUQZ128r:
2999 case X86::VPMADD52LUQZ128rk:
3000 case X86::VPMADD52LUQZ128rkz:
3001 case X86::VPMADD52LUQZ256r:
3002 case X86::VPMADD52LUQZ256rk:
3003 case X86::VPMADD52LUQZ256rkz:
3004 case X86::VPMADD52LUQZr:
3005 case X86::VPMADD52LUQZrk:
3006 case X86::VPMADD52LUQZrkz:
3007 case X86::VFMADDCPHZr:
3008 case X86::VFMADDCPHZrk:
3009 case X86::VFMADDCPHZrkz:
3010 case X86::VFMADDCPHZ128r:
3011 case X86::VFMADDCPHZ128rk:
3012 case X86::VFMADDCPHZ128rkz:
3013 case X86::VFMADDCPHZ256r:
3014 case X86::VFMADDCPHZ256rk:
3015 case X86::VFMADDCPHZ256rkz:
3016 case X86::VFMADDCSHZr:
3017 case X86::VFMADDCSHZrk:
3018 case X86::VFMADDCSHZrkz: {
3019 unsigned CommutableOpIdx1 = 2;
3020 unsigned CommutableOpIdx2 = 3;
3021 if (X86II::isKMasked(Desc.TSFlags)) {
3022 // Skip the mask register.
3023 ++CommutableOpIdx1;
3024 ++CommutableOpIdx2;
3025 }
3026 if (!fixCommutedOpIndices(SrcOpIdx1, SrcOpIdx2, CommutableOpIdx1,
3027 CommutableOpIdx2))
3028 return false;
3029 if (!MI.getOperand(SrcOpIdx1).isReg() || !MI.getOperand(SrcOpIdx2).isReg())
3030 // No idea.
3031 return false;
3032 return true;
3033 }
3034
3035 default:
3036 const X86InstrFMA3Group *FMA3Group =
3037 getFMA3Group(MI.getOpcode(), MI.getDesc().TSFlags);
3038 if (FMA3Group)
3039 return findThreeSrcCommutedOpIndices(MI, SrcOpIdx1, SrcOpIdx2,
3040 FMA3Group->isIntrinsic());
3041
3042 // Handled masked instructions since we need to skip over the mask input
3043 // and the preserved input.
3044 if (X86II::isKMasked(Desc.TSFlags)) {
3045 // First assume that the first input is the mask operand and skip past it.
3046 unsigned CommutableOpIdx1 = Desc.getNumDefs() + 1;
3047 unsigned CommutableOpIdx2 = Desc.getNumDefs() + 2;
3048 // Check if the first input is tied. If there isn't one then we only
3049 // need to skip the mask operand which we did above.
3050 if ((MI.getDesc().getOperandConstraint(Desc.getNumDefs(),
3051 MCOI::TIED_TO) != -1)) {
3052 // If this is zero masking instruction with a tied operand, we need to
3053 // move the first index back to the first input since this must
3054 // be a 3 input instruction and we want the first two non-mask inputs.
3055 // Otherwise this is a 2 input instruction with a preserved input and
3056 // mask, so we need to move the indices to skip one more input.
3057 if (X86II::isKMergeMasked(Desc.TSFlags)) {
3058 ++CommutableOpIdx1;
3059 ++CommutableOpIdx2;
3060 } else {
3061 --CommutableOpIdx1;
3062 }
3063 }
3064
3065 if (!fixCommutedOpIndices(SrcOpIdx1, SrcOpIdx2, CommutableOpIdx1,
3066 CommutableOpIdx2))
3067 return false;
3068
3069 if (!MI.getOperand(SrcOpIdx1).isReg() ||
3070 !MI.getOperand(SrcOpIdx2).isReg())
3071 // No idea.
3072 return false;
3073 return true;
3074 }
3075
3076 return TargetInstrInfo::findCommutedOpIndices(MI, SrcOpIdx1, SrcOpIdx2);
3077 }
3078 return false;
3079}
3080
3082 unsigned Opcode = MI->getOpcode();
3083 if (Opcode != X86::LEA32r && Opcode != X86::LEA64r &&
3084 Opcode != X86::LEA64_32r)
3085 return false;
3086
3087 const MachineOperand &Scale = MI->getOperand(1 + X86::AddrScaleAmt);
3088 const MachineOperand &Disp = MI->getOperand(1 + X86::AddrDisp);
3089 const MachineOperand &Segment = MI->getOperand(1 + X86::AddrSegmentReg);
3090
3091 if (Segment.getReg() != 0 || !Disp.isImm() || Disp.getImm() != 0 ||
3092 Scale.getImm() > 1)
3093 return false;
3094
3095 return true;
3096}
3097
3099 // Currently we're interested in following sequence only.
3100 // r3 = lea r1, r2
3101 // r5 = add r3, r4
3102 // Both r3 and r4 are killed in add, we hope the add instruction has the
3103 // operand order
3104 // r5 = add r4, r3
3105 // So later in X86FixupLEAs the lea instruction can be rewritten as add.
3106 unsigned Opcode = MI.getOpcode();
3107 if (Opcode != X86::ADD32rr && Opcode != X86::ADD64rr)
3108 return false;
3109
3110 const MachineRegisterInfo &MRI = MI.getParent()->getParent()->getRegInfo();
3111 Register Reg1 = MI.getOperand(1).getReg();
3112 Register Reg2 = MI.getOperand(2).getReg();
3113
3114 // Check if Reg1 comes from LEA in the same MBB.
3115 if (MachineInstr *Inst = MRI.getUniqueVRegDef(Reg1)) {
3116 if (isConvertibleLEA(Inst) && Inst->getParent() == MI.getParent()) {
3117 Commute = true;
3118 return true;
3119 }
3120 }
3121
3122 // Check if Reg2 comes from LEA in the same MBB.
3123 if (MachineInstr *Inst = MRI.getUniqueVRegDef(Reg2)) {
3124 if (isConvertibleLEA(Inst) && Inst->getParent() == MI.getParent()) {
3125 Commute = false;
3126 return true;
3127 }
3128 }
3129
3130 return false;
3131}
3132
3134 unsigned Opcode = MCID.getOpcode();
3135 if (!(X86::isJCC(Opcode) || X86::isSETCC(Opcode) || X86::isSETZUCC(Opcode) ||
3136 X86::isCMOVCC(Opcode) || X86::isCFCMOVCC(Opcode) ||
3137 X86::isCCMPCC(Opcode) || X86::isCTESTCC(Opcode)))
3138 return -1;
3139 // Assume that condition code is always the last use operand.
3140 unsigned NumUses = MCID.getNumOperands() - MCID.getNumDefs();
3141 return NumUses - 1;
3142}
3143
3145 const MCInstrDesc &MCID = MI.getDesc();
3146 int CondNo = getCondSrcNoFromDesc(MCID);
3147 if (CondNo < 0)
3148 return X86::COND_INVALID;
3149 CondNo += MCID.getNumDefs();
3150 return static_cast<X86::CondCode>(MI.getOperand(CondNo).getImm());
3151}
3152
3154 return X86::isJCC(MI.getOpcode()) ? X86::getCondFromMI(MI)
3156}
3157
3159 return X86::isSETCC(MI.getOpcode()) || X86::isSETZUCC(MI.getOpcode())
3162}
3163
3165 return X86::isCMOVCC(MI.getOpcode()) ? X86::getCondFromMI(MI)
3167}
3168
3170 return X86::isCFCMOVCC(MI.getOpcode()) ? X86::getCondFromMI(MI)
3172}
3173
3175 return X86::isCCMPCC(MI.getOpcode()) || X86::isCTESTCC(MI.getOpcode())
3178}
3179
3181 // CCMP/CTEST has two conditional operands:
3182 // - SCC: source conditonal code (same as CMOV)
3183 // - DCF: destination conditional flags, which has 4 valid bits
3184 //
3185 // +----+----+----+----+
3186 // | OF | SF | ZF | CF |
3187 // +----+----+----+----+
3188 //
3189 // If SCC(source conditional code) evaluates to false, CCMP/CTEST will updates
3190 // the conditional flags by as follows:
3191 //
3192 // OF = DCF.OF
3193 // SF = DCF.SF
3194 // ZF = DCF.ZF
3195 // CF = DCF.CF
3196 // PF = DCF.CF
3197 // AF = 0 (Auxiliary Carry Flag)
3198 //
3199 // Otherwise, the CMP or TEST is executed and it updates the
3200 // CSPAZO flags normally.
3201 //
3202 // NOTE:
3203 // If SCC = P, then SCC evaluates to true regardless of the CSPAZO value.
3204 // If SCC = NP, then SCC evaluates to false regardless of the CSPAZO value.
3205
3206 enum { CF = 1, ZF = 2, SF = 4, OF = 8, PF = CF };
3207
3208 switch (CC) {
3209 default:
3210 llvm_unreachable("Illegal condition code!");
3211 case X86::COND_NO:
3212 case X86::COND_NE:
3213 case X86::COND_GE:
3214 case X86::COND_G:
3215 case X86::COND_AE:
3216 case X86::COND_A:
3217 case X86::COND_NS:
3218 case X86::COND_NP:
3219 return 0;
3220 case X86::COND_O:
3221 return OF;
3222 case X86::COND_B:
3223 case X86::COND_BE:
3224 return CF;
3225 break;
3226 case X86::COND_E:
3227 case X86::COND_LE:
3228 return ZF;
3229 case X86::COND_S:
3230 case X86::COND_L:
3231 return SF;
3232 case X86::COND_P:
3233 return PF;
3234 }
3235}
3236
3237#define GET_X86_NF_TRANSFORM_TABLE
3238#define GET_X86_ND2NONND_TABLE
3239#include "X86GenInstrMapping.inc"
3240
3242 unsigned Opc) {
3243 const auto I = llvm::lower_bound(Table, Opc);
3244 return (I == Table.end() || I->OldOpc != Opc) ? 0U : I->NewOpc;
3245}
3246unsigned X86::getNFVariant(unsigned Opc) {
3247#if defined(EXPENSIVE_CHECKS) && !defined(NDEBUG)
3248 // Make sure the tables are sorted.
3249 static std::atomic<bool> NFTableChecked(false);
3250 if (!NFTableChecked.load(std::memory_order_relaxed)) {
3251 assert(llvm::is_sorted(X86NFTransformTable) &&
3252 "X86NFTransformTable is not sorted!");
3253 NFTableChecked.store(true, std::memory_order_relaxed);
3254 }
3255#endif
3256 return getNewOpcFromTable(X86NFTransformTable, Opc);
3257}
3258
3260 const TargetRegisterInfo *TRI) {
3261 if (!MI.registerDefIsDead(X86::EFLAGS, TRI))
3262 return 0;
3263 // For the instructions are ADDrm/ADDmr with relocation, we'll skip the
3264 // optimization for replacing non-NF with NF. This is to keep backward
3265 // compatiblity with old version of linkers without APX relocation type
3266 // support on Linux OS.
3268 return 0;
3269 return X86::getNFVariant(MI.getOpcode());
3270}
3271
3272unsigned X86::getNonNDVariant(unsigned Opc) {
3273#if defined(EXPENSIVE_CHECKS) && !defined(NDEBUG)
3274 // Make sure the tables are sorted.
3275 static std::atomic<bool> NDTableChecked(false);
3276 if (!NDTableChecked.load(std::memory_order_relaxed)) {
3277 assert(llvm::is_sorted(X86ND2NonNDTable) &&
3278 "X86ND2NonNDTableis not sorted!");
3279 NDTableChecked.store(true, std::memory_order_relaxed);
3280 }
3281#endif
3282 return getNewOpcFromTable(X86ND2NonNDTable, Opc);
3283}
3284
3285/// Return the inverse of the specified condition,
3286/// e.g. turning COND_E to COND_NE.
3288 switch (CC) {
3289 default:
3290 llvm_unreachable("Illegal condition code!");
3291 case X86::COND_E:
3292 return X86::COND_NE;
3293 case X86::COND_NE:
3294 return X86::COND_E;
3295 case X86::COND_L:
3296 return X86::COND_GE;
3297 case X86::COND_LE:
3298 return X86::COND_G;
3299 case X86::COND_G:
3300 return X86::COND_LE;
3301 case X86::COND_GE:
3302 return X86::COND_L;
3303 case X86::COND_B:
3304 return X86::COND_AE;
3305 case X86::COND_BE:
3306 return X86::COND_A;
3307 case X86::COND_A:
3308 return X86::COND_BE;
3309 case X86::COND_AE:
3310 return X86::COND_B;
3311 case X86::COND_S:
3312 return X86::COND_NS;
3313 case X86::COND_NS:
3314 return X86::COND_S;
3315 case X86::COND_P:
3316 return X86::COND_NP;
3317 case X86::COND_NP:
3318 return X86::COND_P;
3319 case X86::COND_O:
3320 return X86::COND_NO;
3321 case X86::COND_NO:
3322 return X86::COND_O;
3323 case X86::COND_NE_OR_P:
3324 return X86::COND_E_AND_NP;
3325 case X86::COND_E_AND_NP:
3326 return X86::COND_NE_OR_P;
3327 }
3328}
3329
3330/// Assuming the flags are set by MI(a,b), return the condition code if we
3331/// modify the instructions such that flags are set by MI(b,a).
3333 switch (CC) {
3334 default:
3335 return X86::COND_INVALID;
3336 case X86::COND_E:
3337 return X86::COND_E;
3338 case X86::COND_NE:
3339 return X86::COND_NE;
3340 case X86::COND_L:
3341 return X86::COND_G;
3342 case X86::COND_LE:
3343 return X86::COND_GE;
3344 case X86::COND_G:
3345 return X86::COND_L;
3346 case X86::COND_GE:
3347 return X86::COND_LE;
3348 case X86::COND_B:
3349 return X86::COND_A;
3350 case X86::COND_BE:
3351 return X86::COND_AE;
3352 case X86::COND_A:
3353 return X86::COND_B;
3354 case X86::COND_AE:
3355 return X86::COND_BE;
3356 }
3357}
3358
3359std::pair<X86::CondCode, bool>
3362 bool NeedSwap = false;
3363 switch (Predicate) {
3364 default:
3365 break;
3366 // Floating-point Predicates
3367 case CmpInst::FCMP_UEQ:
3368 CC = X86::COND_E;
3369 break;
3370 case CmpInst::FCMP_OLT:
3371 NeedSwap = true;
3372 [[fallthrough]];
3373 case CmpInst::FCMP_OGT:
3374 CC = X86::COND_A;
3375 break;
3376 case CmpInst::FCMP_OLE:
3377 NeedSwap = true;
3378 [[fallthrough]];
3379 case CmpInst::FCMP_OGE:
3380 CC = X86::COND_AE;
3381 break;
3382 case CmpInst::FCMP_UGT:
3383 NeedSwap = true;
3384 [[fallthrough]];
3385 case CmpInst::FCMP_ULT:
3386 CC = X86::COND_B;
3387 break;
3388 case CmpInst::FCMP_UGE:
3389 NeedSwap = true;
3390 [[fallthrough]];
3391 case CmpInst::FCMP_ULE:
3392 CC = X86::COND_BE;
3393 break;
3394 case CmpInst::FCMP_ONE:
3395 CC = X86::COND_NE;
3396 break;
3397 case CmpInst::FCMP_UNO:
3398 CC = X86::COND_P;
3399 break;
3400 case CmpInst::FCMP_ORD:
3401 CC = X86::COND_NP;
3402 break;
3403 case CmpInst::FCMP_OEQ:
3404 [[fallthrough]];
3405 case CmpInst::FCMP_UNE:
3406 CC = X86::COND_INVALID;
3407 break;
3408
3409 // Integer Predicates
3410 case CmpInst::ICMP_EQ:
3411 CC = X86::COND_E;
3412 break;
3413 case CmpInst::ICMP_NE:
3414 CC = X86::COND_NE;
3415 break;
3416 case CmpInst::ICMP_UGT:
3417 CC = X86::COND_A;
3418 break;
3419 case CmpInst::ICMP_UGE:
3420 CC = X86::COND_AE;
3421 break;
3422 case CmpInst::ICMP_ULT:
3423 CC = X86::COND_B;
3424 break;
3425 case CmpInst::ICMP_ULE:
3426 CC = X86::COND_BE;
3427 break;
3428 case CmpInst::ICMP_SGT:
3429 CC = X86::COND_G;
3430 break;
3431 case CmpInst::ICMP_SGE:
3432 CC = X86::COND_GE;
3433 break;
3434 case CmpInst::ICMP_SLT:
3435 CC = X86::COND_L;
3436 break;
3437 case CmpInst::ICMP_SLE:
3438 CC = X86::COND_LE;
3439 break;
3440 }
3441
3442 return std::make_pair(CC, NeedSwap);
3443}
3444
3445/// Return a cmov opcode for the given register size in bytes, and operand type.
3446unsigned X86::getCMovOpcode(unsigned RegBytes, bool HasMemoryOperand,
3447 bool HasNDD) {
3448 switch (RegBytes) {
3449 default:
3450 llvm_unreachable("Illegal register size!");
3451#define GET_ND_IF_ENABLED(OPC) (HasNDD ? OPC##_ND : OPC)
3452 case 2:
3453 return HasMemoryOperand ? GET_ND_IF_ENABLED(X86::CMOV16rm)
3454 : GET_ND_IF_ENABLED(X86::CMOV16rr);
3455 case 4:
3456 return HasMemoryOperand ? GET_ND_IF_ENABLED(X86::CMOV32rm)
3457 : GET_ND_IF_ENABLED(X86::CMOV32rr);
3458 case 8:
3459 return HasMemoryOperand ? GET_ND_IF_ENABLED(X86::CMOV64rm)
3460 : GET_ND_IF_ENABLED(X86::CMOV64rr);
3461 }
3462}
3463
3464unsigned X86::getMOVriOpcode(bool Use64BitReg, int64_t Imm) {
3465 if (!Use64BitReg)
3466 return X86::MOV32ri;
3467
3468 if (isUInt<32>(Imm))
3469 return X86::MOV32ri64;
3470 if (isInt<32>(Imm))
3471 return X86::MOV64ri32;
3472 return X86::MOV64ri;
3473}
3474
3475/// Get the VPCMP immediate for the given condition.
3477 switch (CC) {
3478 default:
3479 llvm_unreachable("Unexpected SETCC condition");
3480 case ISD::SETNE:
3481 return 4;
3482 case ISD::SETEQ:
3483 return 0;
3484 case ISD::SETULT:
3485 case ISD::SETLT:
3486 return 1;
3487 case ISD::SETUGT:
3488 case ISD::SETGT:
3489 return 6;
3490 case ISD::SETUGE:
3491 case ISD::SETGE:
3492 return 5;
3493 case ISD::SETULE:
3494 case ISD::SETLE:
3495 return 2;
3496 }
3497}
3498
3499/// Get the VPCMP immediate if the operands are swapped.
3500unsigned X86::getSwappedVPCMPImm(unsigned Imm) {
3501 switch (Imm) {
3502 default:
3503 llvm_unreachable("Unreachable!");
3504 case 0x01:
3505 Imm = 0x06;
3506 break; // LT -> NLE
3507 case 0x02:
3508 Imm = 0x05;
3509 break; // LE -> NLT
3510 case 0x05:
3511 Imm = 0x02;
3512 break; // NLT -> LE
3513 case 0x06:
3514 Imm = 0x01;
3515 break; // NLE -> LT
3516 case 0x00: // EQ
3517 case 0x03: // FALSE
3518 case 0x04: // NE
3519 case 0x07: // TRUE
3520 break;
3521 }
3522
3523 return Imm;
3524}
3525
3526/// Get the VPCOM immediate if the operands are swapped.
3527unsigned X86::getSwappedVPCOMImm(unsigned Imm) {
3528 switch (Imm) {
3529 default:
3530 llvm_unreachable("Unreachable!");
3531 case 0x00:
3532 Imm = 0x02;
3533 break; // LT -> GT
3534 case 0x01:
3535 Imm = 0x03;
3536 break; // LE -> GE
3537 case 0x02:
3538 Imm = 0x00;
3539 break; // GT -> LT
3540 case 0x03:
3541 Imm = 0x01;
3542 break; // GE -> LE
3543 case 0x04: // EQ
3544 case 0x05: // NE
3545 case 0x06: // FALSE
3546 case 0x07: // TRUE
3547 break;
3548 }
3549
3550 return Imm;
3551}
3552
3553/// Get the VCMP immediate if the operands are swapped.
3554unsigned X86::getSwappedVCMPImm(unsigned Imm) {
3555 // Only need the lower 2 bits to distinquish.
3556 switch (Imm & 0x3) {
3557 default:
3558 llvm_unreachable("Unreachable!");
3559 case 0x00:
3560 case 0x03:
3561 // EQ/NE/TRUE/FALSE/ORD/UNORD don't change immediate when commuted.
3562 break;
3563 case 0x01:
3564 case 0x02:
3565 // Need to toggle bits 3:0. Bit 4 stays the same.
3566 Imm ^= 0xf;
3567 break;
3568 }
3569
3570 return Imm;
3571}
3572
3574 if (Info.RegClass == X86::VR128RegClassID ||
3575 Info.RegClass == X86::VR128XRegClassID)
3576 return 128;
3577 if (Info.RegClass == X86::VR256RegClassID ||
3578 Info.RegClass == X86::VR256XRegClassID)
3579 return 256;
3580 if (Info.RegClass == X86::VR512RegClassID)
3581 return 512;
3582 llvm_unreachable("Unknown register class!");
3583}
3584
3585/// Return true if the Reg is X87 register.
3586static bool isX87Reg(Register Reg) {
3587 return (Reg == X86::FPCW || Reg == X86::FPSW ||
3588 (Reg >= X86::ST0 && Reg <= X86::ST7));
3589}
3590
3591/// check if the instruction is X87 instruction
3593 // Call and inlineasm defs X87 register, so we special case it here because
3594 // otherwise calls are incorrectly flagged as x87 instructions
3595 // as a result.
3596 if (MI.isCall() || MI.isInlineAsm())
3597 return false;
3598 for (const MachineOperand &MO : MI.operands()) {
3599 if (!MO.isReg())
3600 continue;
3601 if (isX87Reg(MO.getReg()))
3602 return true;
3603 }
3604 return false;
3605}
3606
3608 auto IsMemOp = [](const MCOperandInfo &OpInfo) {
3609 return OpInfo.OperandType == MCOI::OPERAND_MEMORY;
3610 };
3611
3612 const MCInstrDesc &Desc = MI.getDesc();
3613
3614 // Directly invoke the MC-layer routine for real (i.e., non-pseudo)
3615 // instructions (fast case).
3616 if (!X86II::isPseudo(Desc.TSFlags)) {
3617 int MemRefIdx = X86II::getMemoryOperandIdx(Desc);
3618 if (MemRefIdx >= 0)
3619 return MemRefIdx;
3620#ifdef EXPENSIVE_CHECKS
3621 assert(none_of(Desc.operands(), IsMemOp) &&
3622 "Got false negative from X86II::getMemoryOperandIdx()!");
3623#endif
3624 return -1;
3625 }
3626
3627 // Otherwise, handle pseudo instructions by examining the type of their
3628 // operands (slow case). An instruction cannot have a memory reference if it
3629 // has fewer than AddrNumOperands (= 5) explicit operands.
3630 unsigned NumOps = Desc.getNumOperands();
3632#ifdef EXPENSIVE_CHECKS
3633 assert(none_of(Desc.operands(), IsMemOp) &&
3634 "Expected no operands to have OPERAND_MEMORY type!");
3635#endif
3636 return -1;
3637 }
3638
3639 // The first operand with type OPERAND_MEMORY indicates the start of a memory
3640 // reference. We expect the following AddrNumOperand-1 operands to also have
3641 // OPERAND_MEMORY type.
3642 for (unsigned I = 0, E = NumOps - X86::AddrNumOperands; I != E; ++I) {
3643 if (IsMemOp(Desc.operands()[I])) {
3644#ifdef EXPENSIVE_CHECKS
3645 assert(std::all_of(Desc.operands().begin() + I,
3646 Desc.operands().begin() + I + X86::AddrNumOperands,
3647 IsMemOp) &&
3648 "Expected all five operands in the memory reference to have "
3649 "OPERAND_MEMORY type!");
3650#endif
3651 return I;
3652 }
3653 }
3654
3655 return -1;
3656}
3657
3659 unsigned OpNo) {
3660 assert(MI.getNumOperands() >= (OpNo + X86::AddrNumOperands) &&
3661 "Unexpected number of operands!");
3662
3663 const MachineOperand &Index = MI.getOperand(OpNo + X86::AddrIndexReg);
3664 if (!Index.isReg() || Index.getReg() != X86::NoRegister)
3665 return nullptr;
3666
3667 const MachineOperand &Disp = MI.getOperand(OpNo + X86::AddrDisp);
3668 if (!Disp.isCPI() || Disp.getOffset() != 0)
3669 return nullptr;
3670
3672 MI.getParent()->getParent()->getConstantPool()->getConstants();
3673 const MachineConstantPoolEntry &ConstantEntry = Constants[Disp.getIndex()];
3674
3675 // Bail if this is a machine constant pool entry, we won't be able to dig out
3676 // anything useful.
3677 if (ConstantEntry.isMachineConstantPoolEntry())
3678 return nullptr;
3679
3680 return ConstantEntry.Val.ConstVal;
3681}
3682
3684 switch (MI.getOpcode()) {
3685 case X86::TCRETURNdi:
3686 case X86::TCRETURNri:
3687 case X86::TCRETURNmi:
3688 case X86::TCRETURNdi64:
3689 case X86::TCRETURNri64:
3690 case X86::TCRETURNri64_ImpCall:
3691 case X86::TCRETURNmi64:
3692 return true;
3693 default:
3694 return false;
3695 }
3696}
3697
3700 const MachineInstr &TailCall) const {
3701
3702 const MachineFunction *MF = TailCall.getMF();
3703
3704 if (MF->getTarget().getCodeModel() == CodeModel::Kernel) {
3705 // Kernel patches thunk calls in runtime, these should never be conditional.
3706 const MachineOperand &Target = TailCall.getOperand(0);
3707 if (Target.isSymbol()) {
3708 StringRef Symbol(Target.getSymbolName());
3709 // this is currently only relevant to r11/kernel indirect thunk.
3710 if (Symbol == "__x86_indirect_thunk_r11")
3711 return false;
3712 }
3713 }
3714
3715 if (TailCall.getOpcode() != X86::TCRETURNdi &&
3716 TailCall.getOpcode() != X86::TCRETURNdi64) {
3717 // Only direct calls can be done with a conditional branch.
3718 return false;
3719 }
3720
3721 if (Subtarget.isTargetWin64() && MF->hasWinCFI()) {
3722 // Conditional tail calls confuse the Win64 unwinder.
3723 return false;
3724 }
3725
3726 assert(BranchCond.size() == 1);
3727 if (BranchCond[0].getImm() > X86::LAST_VALID_COND) {
3728 // Can't make a conditional tail call with this condition.
3729 return false;
3730 }
3731
3733 if (X86FI->getTCReturnAddrDelta() != 0 ||
3734 TailCall.getOperand(1).getImm() != 0) {
3735 // A conditional tail call cannot do any stack adjustment.
3736 return false;
3737 }
3738
3739 return true;
3740}
3741
3744 const MachineInstr &TailCall) const {
3745 assert(canMakeTailCallConditional(BranchCond, TailCall));
3746
3748 while (I != MBB.begin()) {
3749 --I;
3750 if (I->isDebugInstr())
3751 continue;
3752 if (!I->isBranch())
3753 assert(0 && "Can't find the branch to replace!");
3754
3756 assert(BranchCond.size() == 1);
3757 if (CC != BranchCond[0].getImm())
3758 continue;
3759
3760 break;
3761 }
3762
3763 unsigned Opc = TailCall.getOpcode() == X86::TCRETURNdi ? X86::TCRETURNdicc
3764 : X86::TCRETURNdi64cc;
3765
3766 auto MIB = BuildMI(MBB, I, MBB.findDebugLoc(I), get(Opc));
3767 MIB->addOperand(TailCall.getOperand(0)); // Destination.
3768 MIB.addImm(0); // Stack offset (not used).
3769 MIB->addOperand(BranchCond[0]); // Condition.
3770 MIB.copyImplicitOps(TailCall); // Regmask and (imp-used) parameters.
3771
3772 // Add implicit uses and defs of all live regs potentially clobbered by the
3773 // call. This way they still appear live across the call.
3775 LiveRegs.addLiveOuts(MBB);
3777 LiveRegs.stepForward(*MIB, Clobbers);
3778 for (const auto &C : Clobbers) {
3779 MIB.addReg(C.first, RegState::Implicit);
3781 }
3782
3783 I->eraseFromParent();
3784}
3785
3786// Given a MBB and its TBB, find the FBB which was a fallthrough MBB (it may
3787// not be a fallthrough MBB now due to layout changes). Return nullptr if the
3788// fallthrough MBB cannot be identified.
3791 // Look for non-EHPad successors other than TBB. If we find exactly one, it
3792 // is the fallthrough MBB. If we find zero, then TBB is both the target MBB
3793 // and fallthrough MBB. If we find more than one, we cannot identify the
3794 // fallthrough MBB and should return nullptr.
3795 MachineBasicBlock *FallthroughBB = nullptr;
3796 for (MachineBasicBlock *Succ : MBB->successors()) {
3797 if (Succ->isEHPad() || (Succ == TBB && FallthroughBB))
3798 continue;
3799 // Return a nullptr if we found more than one fallthrough successor.
3800 if (FallthroughBB && FallthroughBB != TBB)
3801 return nullptr;
3802 FallthroughBB = Succ;
3803 }
3804 return FallthroughBB;
3805}
3806
3807bool X86InstrInfo::analyzeBranchImpl(
3810 SmallVectorImpl<MachineInstr *> &CondBranches, bool AllowModify) const {
3811
3812 // Start from the bottom of the block and work up, examining the
3813 // terminator instructions.
3815 MachineBasicBlock::iterator UnCondBrIter = MBB.end();
3816 while (I != MBB.begin()) {
3817 --I;
3818 if (I->isDebugInstr())
3819 continue;
3820
3821 // Working from the bottom, when we see a non-terminator instruction, we're
3822 // done.
3823 if (!isUnpredicatedTerminator(*I))
3824 break;
3825
3826 // A terminator that isn't a branch can't easily be handled by this
3827 // analysis.
3828 if (!I->isBranch())
3829 return true;
3830
3831 // Handle unconditional branches.
3832 if (I->getOpcode() == X86::JMP_1) {
3833 UnCondBrIter = I;
3834
3835 if (!AllowModify) {
3836 TBB = I->getOperand(0).getMBB();
3837 continue;
3838 }
3839
3840 // If the block has any instructions after a JMP, delete them.
3841 MBB.erase(std::next(I), MBB.end());
3842
3843 Cond.clear();
3844 FBB = nullptr;
3845
3846 // Delete the JMP if it's equivalent to a fall-through.
3847 if (MBB.isLayoutSuccessor(I->getOperand(0).getMBB())) {
3848 TBB = nullptr;
3849 I->eraseFromParent();
3850 I = MBB.end();
3851 UnCondBrIter = MBB.end();
3852 continue;
3853 }
3854
3855 // TBB is used to indicate the unconditional destination.
3856 TBB = I->getOperand(0).getMBB();
3857 continue;
3858 }
3859
3860 // Handle conditional branches.
3861 X86::CondCode BranchCode = X86::getCondFromBranch(*I);
3862 if (BranchCode == X86::COND_INVALID)
3863 return true; // Can't handle indirect branch.
3864
3865 // In practice we should never have an undef eflags operand, if we do
3866 // abort here as we are not prepared to preserve the flag.
3867 if (I->findRegisterUseOperand(X86::EFLAGS, /*TRI=*/nullptr)->isUndef())
3868 return true;
3869
3870 // Working from the bottom, handle the first conditional branch.
3871 if (Cond.empty()) {
3872 FBB = TBB;
3873 TBB = I->getOperand(0).getMBB();
3875 CondBranches.push_back(&*I);
3876 continue;
3877 }
3878
3879 // Handle subsequent conditional branches. Only handle the case where all
3880 // conditional branches branch to the same destination and their condition
3881 // opcodes fit one of the special multi-branch idioms.
3882 assert(Cond.size() == 1);
3883 assert(TBB);
3884
3885 // If the conditions are the same, we can leave them alone.
3886 X86::CondCode OldBranchCode = (X86::CondCode)Cond[0].getImm();
3887 auto NewTBB = I->getOperand(0).getMBB();
3888 if (OldBranchCode == BranchCode && TBB == NewTBB)
3889 continue;
3890
3891 // If they differ, see if they fit one of the known patterns. Theoretically,
3892 // we could handle more patterns here, but we shouldn't expect to see them
3893 // if instruction selection has done a reasonable job.
3894 if (TBB == NewTBB &&
3895 ((OldBranchCode == X86::COND_P && BranchCode == X86::COND_NE) ||
3896 (OldBranchCode == X86::COND_NE && BranchCode == X86::COND_P))) {
3897 BranchCode = X86::COND_NE_OR_P;
3898 } else if ((OldBranchCode == X86::COND_NP && BranchCode == X86::COND_NE) ||
3899 (OldBranchCode == X86::COND_E && BranchCode == X86::COND_P)) {
3900 if (NewTBB != (FBB ? FBB : getFallThroughMBB(&MBB, TBB)))
3901 return true;
3902
3903 // X86::COND_E_AND_NP usually has two different branch destinations.
3904 //
3905 // JP B1
3906 // JE B2
3907 // JMP B1
3908 // B1:
3909 // B2:
3910 //
3911 // Here this condition branches to B2 only if NP && E. It has another
3912 // equivalent form:
3913 //
3914 // JNE B1
3915 // JNP B2
3916 // JMP B1
3917 // B1:
3918 // B2:
3919 //
3920 // Similarly it branches to B2 only if E && NP. That is why this condition
3921 // is named with COND_E_AND_NP.
3922 BranchCode = X86::COND_E_AND_NP;
3923 } else
3924 return true;
3925
3926 // Update the MachineOperand.
3927 Cond[0].setImm(BranchCode);
3928 CondBranches.push_back(&*I);
3929 }
3930
3931 return false;
3932}
3933
3936 MachineBasicBlock *&FBB,
3938 bool AllowModify) const {
3939 SmallVector<MachineInstr *, 4> CondBranches;
3940 return analyzeBranchImpl(MBB, TBB, FBB, Cond, CondBranches, AllowModify);
3941}
3942
3944 int MemRefBegin = X86II::getMemoryOperandIdx(MI.getDesc());
3945 assert(MemRefBegin >= 0 && "Expected a memory operand");
3946
3947 const MachineOperand &MO = MI.getOperand(MemRefBegin + X86::AddrDisp);
3948 if (!MO.isJTI())
3949 return -1;
3950
3951 return MO.getIndex();
3952}
3953
3955 Register Reg) {
3956 if (!Reg.isVirtual())
3957 return -1;
3959 if (MI == nullptr)
3960 return -1;
3961 unsigned Opcode = MI->getOpcode();
3962 if (Opcode != X86::LEA64r && Opcode != X86::LEA32r)
3963 return -1;
3965}
3966
3968 unsigned Opcode = MI.getOpcode();
3969 // Switch-jump pattern for non-PIC code looks like:
3970 // JMP64m $noreg, 8, %X, %jump-table.X, $noreg
3971 if (Opcode == X86::JMP64m || Opcode == X86::JMP32m) {
3973 }
3974 // The pattern for PIC code looks like:
3975 // %0 = LEA64r $rip, 1, $noreg, %jump-table.X
3976 // %1 = MOVSX64rm32 %0, 4, XX, 0, $noreg
3977 // %2 = ADD64rr %1, %0
3978 // JMP64r %2
3979 if (Opcode == X86::JMP64r || Opcode == X86::JMP32r) {
3980 Register Reg = MI.getOperand(0).getReg();
3981 if (!Reg.isVirtual())
3982 return -1;
3983 const MachineFunction &MF = *MI.getParent()->getParent();
3984 const MachineRegisterInfo &MRI = MF.getRegInfo();
3985 MachineInstr *Add = MRI.getUniqueVRegDef(Reg);
3986 if (Add == nullptr)
3987 return -1;
3988 if (Add->getOpcode() != X86::ADD64rr && Add->getOpcode() != X86::ADD32rr)
3989 return -1;
3990 int JTI1 = getJumpTableIndexFromReg(MRI, Add->getOperand(1).getReg());
3991 if (JTI1 >= 0)
3992 return JTI1;
3993 int JTI2 = getJumpTableIndexFromReg(MRI, Add->getOperand(2).getReg());
3994 if (JTI2 >= 0)
3995 return JTI2;
3996 }
3997 return -1;
3998}
3999
4001 MachineBranchPredicate &MBP,
4002 bool AllowModify) const {
4003 using namespace std::placeholders;
4004
4006 SmallVector<MachineInstr *, 4> CondBranches;
4007 if (analyzeBranchImpl(MBB, MBP.TrueDest, MBP.FalseDest, Cond, CondBranches,
4008 AllowModify))
4009 return true;
4010
4011 if (Cond.size() != 1)
4012 return true;
4013
4014 assert(MBP.TrueDest && "expected!");
4015
4016 if (!MBP.FalseDest)
4017 MBP.FalseDest = MBB.getNextNode();
4018
4020
4021 MachineInstr *ConditionDef = nullptr;
4022 bool SingleUseCondition = true;
4023
4025 if (MI.modifiesRegister(X86::EFLAGS, TRI)) {
4026 ConditionDef = &MI;
4027 break;
4028 }
4029
4030 if (MI.readsRegister(X86::EFLAGS, TRI))
4031 SingleUseCondition = false;
4032 }
4033
4034 if (!ConditionDef)
4035 return true;
4036
4037 if (SingleUseCondition) {
4038 for (auto *Succ : MBB.successors())
4039 if (Succ->isLiveIn(X86::EFLAGS))
4040 SingleUseCondition = false;
4041 }
4042
4043 MBP.ConditionDef = ConditionDef;
4044 MBP.SingleUseCondition = SingleUseCondition;
4045
4046 // Currently we only recognize the simple pattern:
4047 //
4048 // test %reg, %reg
4049 // je %label
4050 //
4051 const unsigned TestOpcode =
4052 Subtarget.is64Bit() ? X86::TEST64rr : X86::TEST32rr;
4053
4054 if (ConditionDef->getOpcode() == TestOpcode &&
4055 ConditionDef->getNumOperands() == 3 &&
4056 ConditionDef->getOperand(0).isIdenticalTo(ConditionDef->getOperand(1)) &&
4057 (Cond[0].getImm() == X86::COND_NE || Cond[0].getImm() == X86::COND_E)) {
4058 MBP.LHS = ConditionDef->getOperand(0);
4059 MBP.RHS = MachineOperand::CreateImm(0);
4060 MBP.Predicate = Cond[0].getImm() == X86::COND_NE
4061 ? MachineBranchPredicate::PRED_NE
4062 : MachineBranchPredicate::PRED_EQ;
4063 return false;
4064 }
4065
4066 return true;
4067}
4068
4070 int *BytesRemoved) const {
4071 assert(!BytesRemoved && "code size not handled");
4072
4074 unsigned Count = 0;
4075
4076 while (I != MBB.begin()) {
4077 --I;
4078 if (I->isDebugInstr())
4079 continue;
4080 if (I->getOpcode() != X86::JMP_1 &&
4082 break;
4083 // Remove the branch.
4084 I->eraseFromParent();
4085 I = MBB.end();
4086 ++Count;
4087 }
4088
4089 return Count;
4090}
4091
4094 MachineBasicBlock *FBB,
4096 const DebugLoc &DL, int *BytesAdded) const {
4097 // Shouldn't be a fall through.
4098 assert(TBB && "insertBranch must not be told to insert a fallthrough");
4099 assert((Cond.size() == 1 || Cond.size() == 0) &&
4100 "X86 branch conditions have one component!");
4101 assert(!BytesAdded && "code size not handled");
4102
4103 if (Cond.empty()) {
4104 // Unconditional branch?
4105 assert(!FBB && "Unconditional branch with multiple successors!");
4106 BuildMI(&MBB, DL, get(X86::JMP_1)).addMBB(TBB);
4107 return 1;
4108 }
4109
4110 // If FBB is null, it is implied to be a fall-through block.
4111 bool FallThru = FBB == nullptr;
4112
4113 // Conditional branch.
4114 unsigned Count = 0;
4116 switch (CC) {
4117 case X86::COND_NE_OR_P:
4118 // Synthesize NE_OR_P with two branches.
4119 BuildMI(&MBB, DL, get(X86::JCC_1)).addMBB(TBB).addImm(X86::COND_NE);
4120 ++Count;
4121 BuildMI(&MBB, DL, get(X86::JCC_1)).addMBB(TBB).addImm(X86::COND_P);
4122 ++Count;
4123 break;
4124 case X86::COND_E_AND_NP:
4125 // Use the next block of MBB as FBB if it is null.
4126 if (FBB == nullptr) {
4127 FBB = getFallThroughMBB(&MBB, TBB);
4128 assert(FBB && "MBB cannot be the last block in function when the false "
4129 "body is a fall-through.");
4130 }
4131 // Synthesize COND_E_AND_NP with two branches.
4132 BuildMI(&MBB, DL, get(X86::JCC_1)).addMBB(FBB).addImm(X86::COND_NE);
4133 ++Count;
4134 BuildMI(&MBB, DL, get(X86::JCC_1)).addMBB(TBB).addImm(X86::COND_NP);
4135 ++Count;
4136 break;
4137 default: {
4138 BuildMI(&MBB, DL, get(X86::JCC_1)).addMBB(TBB).addImm(CC);
4139 ++Count;
4140 }
4141 }
4142 if (!FallThru) {
4143 // Two-way Conditional branch. Insert the second branch.
4144 BuildMI(&MBB, DL, get(X86::JMP_1)).addMBB(FBB);
4145 ++Count;
4146 }
4147 return Count;
4148}
4149
4152 Register DstReg, Register TrueReg,
4153 Register FalseReg, int &CondCycles,
4154 int &TrueCycles, int &FalseCycles) const {
4155 // Not all subtargets have cmov instructions.
4156 if (!Subtarget.canUseCMOV())
4157 return false;
4158 if (Cond.size() != 1)
4159 return false;
4160 // We cannot do the composite conditions, at least not in SSA form.
4162 return false;
4163
4164 // Check register classes.
4165 const MachineRegisterInfo &MRI = MBB.getParent()->getRegInfo();
4166 const TargetRegisterClass *RC =
4167 RI.getCommonSubClass(MRI.getRegClass(TrueReg), MRI.getRegClass(FalseReg));
4168 if (!RC)
4169 return false;
4170
4171 // We have cmov instructions for 16, 32, and 64 bit general purpose registers.
4172 if (X86::GR16RegClass.hasSubClassEq(RC) ||
4173 X86::GR32RegClass.hasSubClassEq(RC) ||
4174 X86::GR64RegClass.hasSubClassEq(RC)) {
4175 // This latency applies to Pentium M, Merom, Wolfdale, Nehalem, and Sandy
4176 // Bridge. Probably Ivy Bridge as well.
4177 CondCycles = 2;
4178 TrueCycles = 2;
4179 FalseCycles = 2;
4180 return true;
4181 }
4182
4183 // Can't do vectors.
4184 return false;
4185}
4186
4189 const DebugLoc &DL, Register DstReg,
4191 Register FalseReg) const {
4192 MachineRegisterInfo &MRI = MBB.getParent()->getRegInfo();
4194 const TargetRegisterClass &RC = *MRI.getRegClass(DstReg);
4195 assert(Cond.size() == 1 && "Invalid Cond array");
4196 unsigned Opc =
4197 X86::getCMovOpcode(TRI.getRegSizeInBits(RC) / 8,
4198 false /*HasMemoryOperand*/, Subtarget.hasNDD());
4199 BuildMI(MBB, I, DL, get(Opc), DstReg)
4200 .addReg(FalseReg)
4201 .addReg(TrueReg)
4202 .addImm(Cond[0].getImm());
4203}
4204
4205/// Test if the given register is a physical h register.
4206static bool isHReg(Register Reg) {
4207 return X86::GR8_ABCD_HRegClass.contains(Reg);
4208}
4209
4210// Try and copy between VR128/VR64 and GR64 registers.
4211static unsigned CopyToFromAsymmetricReg(Register DestReg, Register SrcReg,
4212 const X86Subtarget &Subtarget) {
4213 bool HasAVX = Subtarget.hasAVX();
4214 bool HasAVX512 = Subtarget.hasAVX512();
4215 bool HasEGPR = Subtarget.hasEGPR();
4216
4217 // SrcReg(MaskReg) -> DestReg(GR64)
4218 // SrcReg(MaskReg) -> DestReg(GR32)
4219
4220 // All KMASK RegClasses hold the same k registers, can be tested against
4221 // anyone.
4222 if (X86::VK16RegClass.contains(SrcReg)) {
4223 if (X86::GR64RegClass.contains(DestReg)) {
4224 assert(Subtarget.hasBWI());
4225 return HasEGPR ? X86::KMOVQrk_EVEX : X86::KMOVQrk;
4226 }
4227 if (X86::GR32RegClass.contains(DestReg))
4228 return Subtarget.hasBWI() ? (HasEGPR ? X86::KMOVDrk_EVEX : X86::KMOVDrk)
4229 : (HasEGPR ? X86::KMOVWrk_EVEX : X86::KMOVWrk);
4230 }
4231
4232 // SrcReg(GR64) -> DestReg(MaskReg)
4233 // SrcReg(GR32) -> DestReg(MaskReg)
4234
4235 // All KMASK RegClasses hold the same k registers, can be tested against
4236 // anyone.
4237 if (X86::VK16RegClass.contains(DestReg)) {
4238 if (X86::GR64RegClass.contains(SrcReg)) {
4239 assert(Subtarget.hasBWI());
4240 return HasEGPR ? X86::KMOVQkr_EVEX : X86::KMOVQkr;
4241 }
4242 if (X86::GR32RegClass.contains(SrcReg))
4243 return Subtarget.hasBWI() ? (HasEGPR ? X86::KMOVDkr_EVEX : X86::KMOVDkr)
4244 : (HasEGPR ? X86::KMOVWkr_EVEX : X86::KMOVWkr);
4245 }
4246
4247 // SrcReg(VR128) -> DestReg(GR64)
4248 // SrcReg(VR64) -> DestReg(GR64)
4249 // SrcReg(GR64) -> DestReg(VR128)
4250 // SrcReg(GR64) -> DestReg(VR64)
4251
4252 if (X86::GR64RegClass.contains(DestReg)) {
4253 if (X86::VR128XRegClass.contains(SrcReg))
4254 // Copy from a VR128 register to a GR64 register.
4255 return HasAVX512 ? X86::VMOVPQIto64Zrr
4256 : HasAVX ? X86::VMOVPQIto64rr
4257 : X86::MOVPQIto64rr;
4258 if (X86::VR64RegClass.contains(SrcReg))
4259 // Copy from a VR64 register to a GR64 register.
4260 return X86::MMX_MOVD64from64rr;
4261 } else if (X86::GR64RegClass.contains(SrcReg)) {
4262 // Copy from a GR64 register to a VR128 register.
4263 if (X86::VR128XRegClass.contains(DestReg))
4264 return HasAVX512 ? X86::VMOV64toPQIZrr
4265 : HasAVX ? X86::VMOV64toPQIrr
4266 : X86::MOV64toPQIrr;
4267 // Copy from a GR64 register to a VR64 register.
4268 if (X86::VR64RegClass.contains(DestReg))
4269 return X86::MMX_MOVD64to64rr;
4270 }
4271
4272 // SrcReg(VR128) -> DestReg(GR32)
4273 // SrcReg(GR32) -> DestReg(VR128)
4274
4275 if (X86::GR32RegClass.contains(DestReg) &&
4276 X86::VR128XRegClass.contains(SrcReg))
4277 // Copy from a VR128 register to a GR32 register.
4278 return HasAVX512 ? X86::VMOVPDI2DIZrr
4279 : HasAVX ? X86::VMOVPDI2DIrr
4280 : X86::MOVPDI2DIrr;
4281
4282 if (X86::VR128XRegClass.contains(DestReg) &&
4283 X86::GR32RegClass.contains(SrcReg))
4284 // Copy from a GR32 register to a VR128 register.
4285 return HasAVX512 ? X86::VMOVDI2PDIZrr
4286 : HasAVX ? X86::VMOVDI2PDIrr
4287 : X86::MOVDI2PDIrr;
4288
4289 return 0;
4290}
4291
4294 const DebugLoc &DL, Register DestReg,
4295 Register SrcReg, bool KillSrc,
4296 bool RenamableDest, bool RenamableSrc) const {
4297 // First deal with the normal symmetric copies.
4298 bool HasAVX = Subtarget.hasAVX();
4299 bool HasVLX = Subtarget.hasVLX();
4300 bool HasEGPR = Subtarget.hasEGPR();
4301 unsigned Opc = 0;
4302 if (X86::GR64RegClass.contains(DestReg, SrcReg))
4303 Opc = X86::MOV64rr;
4304 else if (X86::GR32RegClass.contains(DestReg, SrcReg))
4305 Opc = X86::MOV32rr;
4306 else if (X86::GR16RegClass.contains(DestReg, SrcReg))
4307 Opc = X86::MOV16rr;
4308 else if (X86::GR8RegClass.contains(DestReg, SrcReg)) {
4309 // Copying to or from a physical H register on x86-64 requires a NOREX
4310 // move. Otherwise use a normal move.
4311 if ((isHReg(DestReg) || isHReg(SrcReg)) && Subtarget.is64Bit()) {
4312 Opc = X86::MOV8rr_NOREX;
4313 // Both operands must be encodable without an REX prefix.
4314 assert(X86::GR8_NOREXRegClass.contains(SrcReg, DestReg) &&
4315 "8-bit H register can not be copied outside GR8_NOREX");
4316 } else
4317 Opc = X86::MOV8rr;
4318 } else if (X86::VR64RegClass.contains(DestReg, SrcReg))
4319 Opc = X86::MMX_MOVQ64rr;
4320 else if (X86::VR128XRegClass.contains(DestReg, SrcReg)) {
4321 if (HasVLX)
4322 Opc = X86::VMOVAPSZ128rr;
4323 else if (X86::VR128RegClass.contains(DestReg, SrcReg))
4324 Opc = HasAVX ? X86::VMOVAPSrr : X86::MOVAPSrr;
4325 else {
4326 // If this an extended register and we don't have VLX we need to use a
4327 // 512-bit move.
4328 Opc = X86::VMOVAPSZrr;
4330 DestReg =
4331 TRI->getMatchingSuperReg(DestReg, X86::sub_xmm, &X86::VR512RegClass);
4332 SrcReg =
4333 TRI->getMatchingSuperReg(SrcReg, X86::sub_xmm, &X86::VR512RegClass);
4334 }
4335 } else if (X86::VR256XRegClass.contains(DestReg, SrcReg)) {
4336 if (HasVLX)
4337 Opc = X86::VMOVAPSZ256rr;
4338 else if (X86::VR256RegClass.contains(DestReg, SrcReg))
4339 Opc = X86::VMOVAPSYrr;
4340 else {
4341 // If this an extended register and we don't have VLX we need to use a
4342 // 512-bit move.
4343 Opc = X86::VMOVAPSZrr;
4345 DestReg =
4346 TRI->getMatchingSuperReg(DestReg, X86::sub_ymm, &X86::VR512RegClass);
4347 SrcReg =
4348 TRI->getMatchingSuperReg(SrcReg, X86::sub_ymm, &X86::VR512RegClass);
4349 }
4350 } else if (X86::VR512RegClass.contains(DestReg, SrcReg))
4351 Opc = X86::VMOVAPSZrr;
4352 // All KMASK RegClasses hold the same k registers, can be tested against
4353 // anyone.
4354 else if (X86::VK16RegClass.contains(DestReg, SrcReg))
4355 Opc = Subtarget.hasBWI() ? (HasEGPR ? X86::KMOVQkk_EVEX : X86::KMOVQkk)
4356 : (HasEGPR ? X86::KMOVWkk_EVEX : X86::KMOVWkk);
4357
4358 if (!Opc)
4359 Opc = CopyToFromAsymmetricReg(DestReg, SrcReg, Subtarget);
4360
4361 if (Opc) {
4362 BuildMI(MBB, MI, DL, get(Opc), DestReg)
4363 .addReg(SrcReg, getKillRegState(KillSrc));
4364 return;
4365 }
4366
4367 if (SrcReg == X86::EFLAGS || DestReg == X86::EFLAGS) {
4368 // FIXME: We use a fatal error here because historically LLVM has tried
4369 // lower some of these physreg copies and we want to ensure we get
4370 // reasonable bug reports if someone encounters a case no other testing
4371 // found. This path should be removed after the LLVM 7 release.
4372 report_fatal_error("Unable to copy EFLAGS physical register!");
4373 }
4374
4375 LLVM_DEBUG(dbgs() << "Cannot copy " << RI.getName(SrcReg) << " to "
4376 << RI.getName(DestReg) << '\n');
4377 report_fatal_error("Cannot emit physreg copy instruction");
4378}
4379
4380std::optional<DestSourcePair>
4382 if (MI.isMoveReg()) {
4383 // FIXME: Dirty hack for apparent invariant that doesn't hold when
4384 // subreg_to_reg is coalesced with ordinary copies, such that the bits that
4385 // were asserted as 0 are now undef.
4386 if (MI.getOperand(0).isUndef() && MI.getOperand(0).getSubReg())
4387 return std::nullopt;
4388
4389 return DestSourcePair{MI.getOperand(0), MI.getOperand(1)};
4390 }
4391 return std::nullopt;
4392}
4393
4394static unsigned getLoadStoreOpcodeForFP16(bool Load, const X86Subtarget &STI) {
4395 if (STI.hasFP16())
4396 return Load ? X86::VMOVSHZrm_alt : X86::VMOVSHZmr;
4397 if (Load)
4398 return X86::MOVSHPrm;
4399 return X86::MOVSHPmr;
4400}
4401
4403 const TargetRegisterClass *RC,
4404 bool IsStackAligned,
4405 const X86Subtarget &STI, bool Load) {
4406 bool HasAVX = STI.hasAVX();
4407 bool HasAVX512 = STI.hasAVX512();
4408 bool HasVLX = STI.hasVLX();
4409 bool HasEGPR = STI.hasEGPR();
4410
4411 assert(RC != nullptr && "Invalid target register class");
4412 switch (STI.getRegisterInfo()->getSpillSize(*RC)) {
4413 default:
4414 llvm_unreachable("Unknown spill size");
4415 case 1:
4416 assert(X86::GR8RegClass.hasSubClassEq(RC) && "Unknown 1-byte regclass");
4417 if (STI.is64Bit())
4418 // Copying to or from a physical H register on x86-64 requires a NOREX
4419 // move. Otherwise use a normal move.
4420 if (isHReg(Reg) || X86::GR8_ABCD_HRegClass.hasSubClassEq(RC))
4421 return Load ? X86::MOV8rm_NOREX : X86::MOV8mr_NOREX;
4422 return Load ? X86::MOV8rm : X86::MOV8mr;
4423 case 2:
4424 if (X86::VK16RegClass.hasSubClassEq(RC))
4425 return Load ? (HasEGPR ? X86::KMOVWkm_EVEX : X86::KMOVWkm)
4426 : (HasEGPR ? X86::KMOVWmk_EVEX : X86::KMOVWmk);
4427 assert(X86::GR16RegClass.hasSubClassEq(RC) && "Unknown 2-byte regclass");
4428 return Load ? X86::MOV16rm : X86::MOV16mr;
4429 case 4:
4430 if (X86::GR32RegClass.hasSubClassEq(RC))
4431 return Load ? X86::MOV32rm : X86::MOV32mr;
4432 if (X86::FR32XRegClass.hasSubClassEq(RC))
4433 return Load ? (HasAVX512 ? X86::VMOVSSZrm_alt
4434 : HasAVX ? X86::VMOVSSrm_alt
4435 : X86::MOVSSrm_alt)
4436 : (HasAVX512 ? X86::VMOVSSZmr
4437 : HasAVX ? X86::VMOVSSmr
4438 : X86::MOVSSmr);
4439 if (X86::RFP32RegClass.hasSubClassEq(RC))
4440 return Load ? X86::LD_Fp32m : X86::ST_Fp32m;
4441 if (X86::VK32RegClass.hasSubClassEq(RC)) {
4442 assert(STI.hasBWI() && "KMOVD requires BWI");
4443 return Load ? (HasEGPR ? X86::KMOVDkm_EVEX : X86::KMOVDkm)
4444 : (HasEGPR ? X86::KMOVDmk_EVEX : X86::KMOVDmk);
4445 }
4446 // All of these mask pair classes have the same spill size, the same kind
4447 // of kmov instructions can be used with all of them.
4448 if (X86::VK1PAIRRegClass.hasSubClassEq(RC) ||
4449 X86::VK2PAIRRegClass.hasSubClassEq(RC) ||
4450 X86::VK4PAIRRegClass.hasSubClassEq(RC) ||
4451 X86::VK8PAIRRegClass.hasSubClassEq(RC) ||
4452 X86::VK16PAIRRegClass.hasSubClassEq(RC))
4453 return Load ? X86::MASKPAIR16LOAD : X86::MASKPAIR16STORE;
4454 if (X86::FR16RegClass.hasSubClassEq(RC) ||
4455 X86::FR16XRegClass.hasSubClassEq(RC))
4456 return getLoadStoreOpcodeForFP16(Load, STI);
4457 llvm_unreachable("Unknown 4-byte regclass");
4458 case 8:
4459 if (X86::GR64RegClass.hasSubClassEq(RC))
4460 return Load ? X86::MOV64rm : X86::MOV64mr;
4461 if (X86::FR64XRegClass.hasSubClassEq(RC))
4462 return Load ? (HasAVX512 ? X86::VMOVSDZrm_alt
4463 : HasAVX ? X86::VMOVSDrm_alt
4464 : X86::MOVSDrm_alt)
4465 : (HasAVX512 ? X86::VMOVSDZmr
4466 : HasAVX ? X86::VMOVSDmr
4467 : X86::MOVSDmr);
4468 if (X86::VR64RegClass.hasSubClassEq(RC))
4469 return Load ? X86::MMX_MOVQ64rm : X86::MMX_MOVQ64mr;
4470 if (X86::RFP64RegClass.hasSubClassEq(RC))
4471 return Load ? X86::LD_Fp64m : X86::ST_Fp64m;
4472 if (X86::VK64RegClass.hasSubClassEq(RC)) {
4473 assert(STI.hasBWI() && "KMOVQ requires BWI");
4474 return Load ? (HasEGPR ? X86::KMOVQkm_EVEX : X86::KMOVQkm)
4475 : (HasEGPR ? X86::KMOVQmk_EVEX : X86::KMOVQmk);
4476 }
4477 llvm_unreachable("Unknown 8-byte regclass");
4478 case 10:
4479 assert(X86::RFP80RegClass.hasSubClassEq(RC) && "Unknown 10-byte regclass");
4480 return Load ? X86::LD_Fp80m : X86::ST_FpP80m;
4481 case 16: {
4482 if (X86::VR128XRegClass.hasSubClassEq(RC)) {
4483 // If stack is realigned we can use aligned stores.
4484 if (IsStackAligned)
4485 return Load ? (HasVLX ? X86::VMOVAPSZ128rm
4486 : HasAVX512 ? X86::VMOVAPSZ128rm_NOVLX
4487 : HasAVX ? X86::VMOVAPSrm
4488 : X86::MOVAPSrm)
4489 : (HasVLX ? X86::VMOVAPSZ128mr
4490 : HasAVX512 ? X86::VMOVAPSZ128mr_NOVLX
4491 : HasAVX ? X86::VMOVAPSmr
4492 : X86::MOVAPSmr);
4493 else
4494 return Load ? (HasVLX ? X86::VMOVUPSZ128rm
4495 : HasAVX512 ? X86::VMOVUPSZ128rm_NOVLX
4496 : HasAVX ? X86::VMOVUPSrm
4497 : X86::MOVUPSrm)
4498 : (HasVLX ? X86::VMOVUPSZ128mr
4499 : HasAVX512 ? X86::VMOVUPSZ128mr_NOVLX
4500 : HasAVX ? X86::VMOVUPSmr
4501 : X86::MOVUPSmr);
4502 }
4503 llvm_unreachable("Unknown 16-byte regclass");
4504 }
4505 case 32:
4506 assert(X86::VR256XRegClass.hasSubClassEq(RC) && "Unknown 32-byte regclass");
4507 // If stack is realigned we can use aligned stores.
4508 if (IsStackAligned)
4509 return Load ? (HasVLX ? X86::VMOVAPSZ256rm
4510 : HasAVX512 ? X86::VMOVAPSZ256rm_NOVLX
4511 : X86::VMOVAPSYrm)
4512 : (HasVLX ? X86::VMOVAPSZ256mr
4513 : HasAVX512 ? X86::VMOVAPSZ256mr_NOVLX
4514 : X86::VMOVAPSYmr);
4515 else
4516 return Load ? (HasVLX ? X86::VMOVUPSZ256rm
4517 : HasAVX512 ? X86::VMOVUPSZ256rm_NOVLX
4518 : X86::VMOVUPSYrm)
4519 : (HasVLX ? X86::VMOVUPSZ256mr
4520 : HasAVX512 ? X86::VMOVUPSZ256mr_NOVLX
4521 : X86::VMOVUPSYmr);
4522 case 64:
4523 assert(X86::VR512RegClass.hasSubClassEq(RC) && "Unknown 64-byte regclass");
4524 assert(STI.hasAVX512() && "Using 512-bit register requires AVX512");
4525 if (IsStackAligned)
4526 return Load ? X86::VMOVAPSZrm : X86::VMOVAPSZmr;
4527 else
4528 return Load ? X86::VMOVUPSZrm : X86::VMOVUPSZmr;
4529 case 1024:
4530 assert(X86::TILERegClass.hasSubClassEq(RC) && "Unknown 1024-byte regclass");
4531 assert(STI.hasAMXTILE() && "Using 8*1024-bit register requires AMX-TILE");
4532#define GET_EGPR_IF_ENABLED(OPC) (STI.hasEGPR() ? OPC##_EVEX : OPC)
4533 return Load ? GET_EGPR_IF_ENABLED(X86::TILELOADD)
4534 : GET_EGPR_IF_ENABLED(X86::TILESTORED);
4535#undef GET_EGPR_IF_ENABLED
4536 }
4537}
4538
4539std::optional<ExtAddrMode>
4541 const TargetRegisterInfo *TRI) const {
4542 int MemRefBegin = X86II::getMemoryOperandIdx(MemI.getDesc());
4543 if (MemRefBegin < 0)
4544 return std::nullopt;
4545
4546 auto &BaseOp = MemI.getOperand(MemRefBegin + X86::AddrBaseReg);
4547 if (!BaseOp.isReg()) // Can be an MO_FrameIndex
4548 return std::nullopt;
4549
4550 const MachineOperand &DispMO = MemI.getOperand(MemRefBegin + X86::AddrDisp);
4551 // Displacement can be symbolic
4552 if (!DispMO.isImm())
4553 return std::nullopt;
4554
4555 ExtAddrMode AM;
4556 AM.BaseReg = BaseOp.getReg();
4557 AM.ScaledReg = MemI.getOperand(MemRefBegin + X86::AddrIndexReg).getReg();
4558 AM.Scale = MemI.getOperand(MemRefBegin + X86::AddrScaleAmt).getImm();
4559 AM.Displacement = DispMO.getImm();
4560 return AM;
4561}
4562
4564 StringRef &ErrInfo) const {
4565 std::optional<ExtAddrMode> AMOrNone = getAddrModeFromMemoryOp(MI, nullptr);
4566 if (!AMOrNone)
4567 return true;
4568
4569 ExtAddrMode AM = *AMOrNone;
4571 if (AM.ScaledReg != X86::NoRegister) {
4572 switch (AM.Scale) {
4573 case 1:
4574 case 2:
4575 case 4:
4576 case 8:
4577 break;
4578 default:
4579 ErrInfo = "Scale factor in address must be 1, 2, 4 or 8";
4580 return false;
4581 }
4582 }
4583 if (!isInt<32>(AM.Displacement)) {
4584 ErrInfo = "Displacement in address must fit into 32-bit signed "
4585 "integer";
4586 return false;
4587 }
4588
4589 return true;
4590}
4591
4593 const Register Reg,
4594 int64_t &ImmVal) const {
4595 Register MovReg = Reg;
4596 const MachineInstr *MovMI = &MI;
4597
4598 // Follow use-def for SUBREG_TO_REG to find the real move immediate
4599 // instruction. It is quite common for x86-64.
4600 if (MI.isSubregToReg()) {
4601 // We use following pattern to setup 64b immediate.
4602 // %8:gr32 = MOV32r0 implicit-def dead $eflags
4603 // %6:gr64 = SUBREG_TO_REG killed %8:gr32, %subreg.sub_32bit
4604 unsigned SubIdx = MI.getOperand(2).getImm();
4605 MovReg = MI.getOperand(1).getReg();
4606 if (SubIdx != X86::sub_32bit)
4607 return false;
4608 const MachineRegisterInfo &MRI = MI.getParent()->getParent()->getRegInfo();
4609 MovMI = MRI.getUniqueVRegDef(MovReg);
4610 if (!MovMI)
4611 return false;
4612 }
4613
4614 if (MovMI->getOpcode() == X86::MOV32r0 &&
4615 MovMI->getOperand(0).getReg() == MovReg) {
4616 ImmVal = 0;
4617 return true;
4618 }
4619
4620 if (MovMI->getOpcode() != X86::MOV32ri &&
4621 MovMI->getOpcode() != X86::MOV64ri &&
4622 MovMI->getOpcode() != X86::MOV32ri64 && MovMI->getOpcode() != X86::MOV8ri)
4623 return false;
4624 // Mov Src can be a global address.
4625 if (!MovMI->getOperand(1).isImm() || MovMI->getOperand(0).getReg() != MovReg)
4626 return false;
4627 ImmVal = MovMI->getOperand(1).getImm();
4628 return true;
4629}
4630
4632 const MachineInstr *MI, const Register NullValueReg,
4633 const TargetRegisterInfo *TRI) const {
4634 if (!MI->modifiesRegister(NullValueReg, TRI))
4635 return true;
4636 switch (MI->getOpcode()) {
4637 // Shift right/left of a null unto itself is still a null, i.e. rax = shl rax
4638 // X.
4639 case X86::SHR64ri:
4640 case X86::SHR32ri:
4641 case X86::SHL64ri:
4642 case X86::SHL32ri:
4643 assert(MI->getOperand(0).isDef() && MI->getOperand(1).isUse() &&
4644 "expected for shift opcode!");
4645 return MI->getOperand(0).getReg() == NullValueReg &&
4646 MI->getOperand(1).getReg() == NullValueReg;
4647 // Zero extend of a sub-reg of NullValueReg into itself does not change the
4648 // null value.
4649 case X86::MOV32rr:
4650 return llvm::all_of(MI->operands(), [&](const MachineOperand &MO) {
4651 return TRI->isSubRegisterEq(NullValueReg, MO.getReg());
4652 });
4653 default:
4654 return false;
4655 }
4656 llvm_unreachable("Should be handled above!");
4657}
4658
4661 int64_t &Offset, bool &OffsetIsScalable, LocationSize &Width,
4662 const TargetRegisterInfo *TRI) const {
4663 int MemRefBegin = X86II::getMemoryOperandIdx(MemOp.getDesc());
4664 if (MemRefBegin < 0)
4665 return false;
4666
4667 const MachineOperand *BaseOp =
4668 &MemOp.getOperand(MemRefBegin + X86::AddrBaseReg);
4669 if (!BaseOp->isReg()) // Can be an MO_FrameIndex
4670 return false;
4671
4672 if (MemOp.getOperand(MemRefBegin + X86::AddrScaleAmt).getImm() != 1)
4673 return false;
4674
4675 if (MemOp.getOperand(MemRefBegin + X86::AddrIndexReg).getReg() !=
4676 X86::NoRegister)
4677 return false;
4678
4679 const MachineOperand &DispMO = MemOp.getOperand(MemRefBegin + X86::AddrDisp);
4680
4681 // Displacement can be symbolic
4682 if (!DispMO.isImm())
4683 return false;
4684
4685 Offset = DispMO.getImm();
4686
4687 if (!BaseOp->isReg())
4688 return false;
4689
4690 OffsetIsScalable = false;
4691 // FIXME: Relying on memoperands() may not be right thing to do here. Check
4692 // with X86 maintainers, and fix it accordingly. For now, it is ok, since
4693 // there is no use of `Width` for X86 back-end at the moment.
4694 Width = !MemOp.memoperands_empty() ? MemOp.memoperands().front()->getSize()
4696 BaseOps.push_back(BaseOp);
4697 return true;
4698}
4699
4700static unsigned getStoreRegOpcode(Register SrcReg,
4701 const TargetRegisterClass *RC,
4702 bool IsStackAligned,
4703 const X86Subtarget &STI) {
4704 return getLoadStoreRegOpcode(SrcReg, RC, IsStackAligned, STI, false);
4705}
4706
4707static unsigned getLoadRegOpcode(Register DestReg,
4708 const TargetRegisterClass *RC,
4709 bool IsStackAligned, const X86Subtarget &STI) {
4710 return getLoadStoreRegOpcode(DestReg, RC, IsStackAligned, STI, true);
4711}
4712
4713static bool isAMXOpcode(unsigned Opc) {
4714 switch (Opc) {
4715 default:
4716 return false;
4717 case X86::TILELOADD:
4718 case X86::TILESTORED:
4719 case X86::TILELOADD_EVEX:
4720 case X86::TILESTORED_EVEX:
4721 return true;
4722 }
4723}
4724
4727 unsigned Opc, Register Reg, int FrameIdx,
4728 bool isKill) const {
4729 switch (Opc) {
4730 default:
4731 llvm_unreachable("Unexpected special opcode!");
4732 case X86::TILESTORED:
4733 case X86::TILESTORED_EVEX: {
4734 // tilestored %tmm, (%sp, %idx)
4735 MachineRegisterInfo &RegInfo = MBB.getParent()->getRegInfo();
4736 Register VirtReg = RegInfo.createVirtualRegister(&X86::GR64_NOSPRegClass);
4737 BuildMI(MBB, MI, DebugLoc(), get(X86::MOV64ri), VirtReg).addImm(64);
4738 MachineInstr *NewMI =
4739 addFrameReference(BuildMI(MBB, MI, DebugLoc(), get(Opc)), FrameIdx)
4740 .addReg(Reg, getKillRegState(isKill));
4742 MO.setReg(VirtReg);
4743 MO.setIsKill(true);
4744 break;
4745 }
4746 case X86::TILELOADD:
4747 case X86::TILELOADD_EVEX: {
4748 // tileloadd (%sp, %idx), %tmm
4749 MachineRegisterInfo &RegInfo = MBB.getParent()->getRegInfo();
4750 Register VirtReg = RegInfo.createVirtualRegister(&X86::GR64_NOSPRegClass);
4751 BuildMI(MBB, MI, DebugLoc(), get(X86::MOV64ri), VirtReg).addImm(64);
4753 BuildMI(MBB, MI, DebugLoc(), get(Opc), Reg), FrameIdx);
4755 MO.setReg(VirtReg);
4756 MO.setIsKill(true);
4757 break;
4758 }
4759 }
4760}
4761
4764 bool isKill, int FrameIdx, const TargetRegisterClass *RC,
4765
4766 Register VReg, MachineInstr::MIFlag Flags) const {
4767 const MachineFunction &MF = *MBB.getParent();
4768 const MachineFrameInfo &MFI = MF.getFrameInfo();
4769 assert(MFI.getObjectSize(FrameIdx) >= RI.getSpillSize(*RC) &&
4770 "Stack slot too small for store");
4771
4772 unsigned Alignment = std::max<uint32_t>(RI.getSpillSize(*RC), 16);
4773 bool isAligned =
4774 (Subtarget.getFrameLowering()->getStackAlign() >= Alignment) ||
4775 (RI.canRealignStack(MF) && !MFI.isFixedObjectIndex(FrameIdx));
4776
4777 unsigned Opc = getStoreRegOpcode(SrcReg, RC, isAligned, Subtarget);
4778 if (isAMXOpcode(Opc))
4779 loadStoreTileReg(MBB, MI, Opc, SrcReg, FrameIdx, isKill);
4780 else
4781 addFrameReference(BuildMI(MBB, MI, DebugLoc(), get(Opc)), FrameIdx)
4782 .addReg(SrcReg, getKillRegState(isKill))
4783 .setMIFlag(Flags);
4784}
4785
4788 Register DestReg, int FrameIdx,
4789 const TargetRegisterClass *RC,
4790 Register VReg, unsigned SubReg,
4791 MachineInstr::MIFlag Flags) const {
4792 const MachineFunction &MF = *MBB.getParent();
4793 const MachineFrameInfo &MFI = MF.getFrameInfo();
4794 assert(MFI.getObjectSize(FrameIdx) >= RI.getSpillSize(*RC) &&
4795 "Load size exceeds stack slot");
4796 unsigned Alignment = std::max<uint32_t>(RI.getSpillSize(*RC), 16);
4797 bool isAligned =
4798 (Subtarget.getFrameLowering()->getStackAlign() >= Alignment) ||
4799 (RI.canRealignStack(MF) && !MFI.isFixedObjectIndex(FrameIdx));
4800
4801 unsigned Opc = getLoadRegOpcode(DestReg, RC, isAligned, Subtarget);
4802 if (isAMXOpcode(Opc))
4803 loadStoreTileReg(MBB, MI, Opc, DestReg, FrameIdx);
4804 else
4805 addFrameReference(BuildMI(MBB, MI, DebugLoc(), get(Opc), DestReg), FrameIdx)
4806 .setMIFlag(Flags);
4807}
4808
4810 Register &SrcReg2, int64_t &CmpMask,
4811 int64_t &CmpValue) const {
4812 switch (MI.getOpcode()) {
4813 default:
4814 break;
4815 case X86::CMP64ri32:
4816 case X86::CMP32ri:
4817 case X86::CMP16ri:
4818 case X86::CMP8ri:
4819 SrcReg = MI.getOperand(0).getReg();
4820 SrcReg2 = 0;
4821 if (MI.getOperand(1).isImm()) {
4822 CmpMask = ~0;
4823 CmpValue = MI.getOperand(1).getImm();
4824 } else {
4825 CmpMask = CmpValue = 0;
4826 }
4827 return true;
4828 // A SUB can be used to perform comparison.
4829 CASE_ND(SUB64rm)
4830 CASE_ND(SUB32rm)
4831 CASE_ND(SUB16rm)
4832 CASE_ND(SUB8rm)
4833 SrcReg = MI.getOperand(1).getReg();
4834 SrcReg2 = 0;
4835 CmpMask = 0;
4836 CmpValue = 0;
4837 return true;
4838 CASE_ND(SUB64rr)
4839 CASE_ND(SUB32rr)
4840 CASE_ND(SUB16rr)
4841 CASE_ND(SUB8rr)
4842 SrcReg = MI.getOperand(1).getReg();
4843 SrcReg2 = MI.getOperand(2).getReg();
4844 CmpMask = 0;
4845 CmpValue = 0;
4846 return true;
4847 CASE_ND(SUB64ri32)
4848 CASE_ND(SUB32ri)
4849 CASE_ND(SUB16ri)
4850 CASE_ND(SUB8ri)
4851 SrcReg = MI.getOperand(1).getReg();
4852 SrcReg2 = 0;
4853 if (MI.getOperand(2).isImm()) {
4854 CmpMask = ~0;
4855 CmpValue = MI.getOperand(2).getImm();
4856 } else {
4857 CmpMask = CmpValue = 0;
4858 }
4859 return true;
4860 case X86::CMP64rr:
4861 case X86::CMP32rr:
4862 case X86::CMP16rr:
4863 case X86::CMP8rr:
4864 SrcReg = MI.getOperand(0).getReg();
4865 SrcReg2 = MI.getOperand(1).getReg();
4866 CmpMask = 0;
4867 CmpValue = 0;
4868 return true;
4869 case X86::TEST8rr:
4870 case X86::TEST16rr:
4871 case X86::TEST32rr:
4872 case X86::TEST64rr:
4873 SrcReg = MI.getOperand(0).getReg();
4874 if (MI.getOperand(1).getReg() != SrcReg)
4875 return false;
4876 // Compare against zero.
4877 SrcReg2 = 0;
4878 CmpMask = ~0;
4879 CmpValue = 0;
4880 return true;
4881 case X86::TEST64ri32:
4882 case X86::TEST32ri:
4883 case X86::TEST16ri:
4884 case X86::TEST8ri:
4885 SrcReg = MI.getOperand(0).getReg();
4886 SrcReg2 = 0;
4887 // Force identical compare.
4888 CmpMask = 0;
4889 CmpValue = 0;
4890 return true;
4891 }
4892 return false;
4893}
4894
4895bool X86InstrInfo::isRedundantFlagInstr(const MachineInstr &FlagI,
4896 Register SrcReg, Register SrcReg2,
4897 int64_t ImmMask, int64_t ImmValue,
4898 const MachineInstr &OI, bool *IsSwapped,
4899 int64_t *ImmDelta) const {
4900 switch (OI.getOpcode()) {
4901 case X86::CMP64rr:
4902 case X86::CMP32rr:
4903 case X86::CMP16rr:
4904 case X86::CMP8rr:
4905 CASE_ND(SUB64rr)
4906 CASE_ND(SUB32rr)
4907 CASE_ND(SUB16rr)
4908 CASE_ND(SUB8rr) {
4909 Register OISrcReg;
4910 Register OISrcReg2;
4911 int64_t OIMask;
4912 int64_t OIValue;
4913 if (!analyzeCompare(OI, OISrcReg, OISrcReg2, OIMask, OIValue) ||
4914 OIMask != ImmMask || OIValue != ImmValue)
4915 return false;
4916 if (SrcReg == OISrcReg && SrcReg2 == OISrcReg2) {
4917 *IsSwapped = false;
4918 return true;
4919 }
4920 if (SrcReg == OISrcReg2 && SrcReg2 == OISrcReg) {
4921 *IsSwapped = true;
4922 return true;
4923 }
4924 return false;
4925 }
4926 case X86::CMP64ri32:
4927 case X86::CMP32ri:
4928 case X86::CMP16ri:
4929 case X86::CMP8ri:
4930 case X86::TEST64ri32:
4931 case X86::TEST32ri:
4932 case X86::TEST16ri:
4933 case X86::TEST8ri:
4934 CASE_ND(SUB64ri32)
4935 CASE_ND(SUB32ri)
4936 CASE_ND(SUB16ri)
4937 CASE_ND(SUB8ri)
4938 case X86::TEST64rr:
4939 case X86::TEST32rr:
4940 case X86::TEST16rr:
4941 case X86::TEST8rr: {
4942 if (ImmMask != 0) {
4943 Register OISrcReg;
4944 Register OISrcReg2;
4945 int64_t OIMask;
4946 int64_t OIValue;
4947 if (analyzeCompare(OI, OISrcReg, OISrcReg2, OIMask, OIValue) &&
4948 SrcReg == OISrcReg && ImmMask == OIMask) {
4949 if (OIValue == ImmValue) {
4950 *ImmDelta = 0;
4951 return true;
4952 } else if (static_cast<uint64_t>(ImmValue) ==
4953 static_cast<uint64_t>(OIValue) - 1) {
4954 *ImmDelta = -1;
4955 return true;
4956 } else if (static_cast<uint64_t>(ImmValue) ==
4957 static_cast<uint64_t>(OIValue) + 1) {
4958 *ImmDelta = 1;
4959 return true;
4960 } else {
4961 return false;
4962 }
4963 }
4964 }
4965 return FlagI.isIdenticalTo(OI);
4966 }
4967 default:
4968 return false;
4969 }
4970}
4971
4972inline static bool isCmpRedundantAfterLTZCNT(Register SrcReg, Register SrcReg2,
4973 int64_t ImmMask, int64_t ImmValue,
4974 const MachineInstr &OI) {
4975 switch (OI.getOpcode()) {
4976 default:
4977 return false;
4978 case X86::LZCNT16rr:
4979 case X86::LZCNT32rr:
4980 case X86::LZCNT64rr:
4981 case X86::TZCNT16rr:
4982 case X86::TZCNT32rr:
4983 case X86::TZCNT64rr: {
4984 if (ImmMask != 0 && !SrcReg2.isValid() && ImmValue == 1 &&
4985 OI.getOperand(1).isReg() && SrcReg == OI.getOperand(1).getReg()) {
4986 return true;
4987 }
4988 return false;
4989 }
4990 }
4991}
4992
4993#define CASE_EVEX(OP) \
4994 case X86::OP: \
4995 case X86::OP##_EVEX:
4996
4997/// Check whether the definition can be converted
4998/// to remove a comparison against zero.
4999inline static bool isDefConvertible(const MachineInstr &MI, bool &NoSignFlag,
5000 bool &ClearsOverflowFlag) {
5001 NoSignFlag = false;
5002 ClearsOverflowFlag = false;
5003
5004 // "ELF Handling for Thread-Local Storage" specifies that x86-64 GOTTPOFF, and
5005 // i386 GOTNTPOFF/INDNTPOFF relocations can convert an ADD to a LEA during
5006 // Initial Exec to Local Exec relaxation. In these cases, we must not depend
5007 // on the EFLAGS modification of ADD actually happening in the final binary.
5008 if (MI.getOpcode() == X86::ADD64rm || MI.getOpcode() == X86::ADD32rm) {
5009 unsigned Flags = MI.getOperand(5).getTargetFlags();
5010 if (Flags == X86II::MO_GOTTPOFF || Flags == X86II::MO_INDNTPOFF ||
5011 Flags == X86II::MO_GOTNTPOFF)
5012 return false;
5013 }
5014
5015 switch (MI.getOpcode()) {
5016 default:
5017 return false;
5018
5019 // The shift instructions only modify ZF if their shift count is non-zero.
5020 // N.B.: The processor truncates the shift count depending on the encoding.
5021 CASE_ND(SAR8ri)
5022 CASE_ND(SAR16ri)
5023 CASE_ND(SAR32ri)
5024 CASE_ND(SAR64ri)
5025 CASE_ND(SHR8ri)
5026 CASE_ND(SHR16ri)
5027 CASE_ND(SHR32ri)
5028 CASE_ND(SHR64ri)
5029 return getTruncatedShiftCount(MI, 2) != 0;
5030
5031 // Some left shift instructions can be turned into LEA instructions but only
5032 // if their flags aren't used. Avoid transforming such instructions.
5033 CASE_ND(SHL8ri)
5034 CASE_ND(SHL16ri)
5035 CASE_ND(SHL32ri)
5036 CASE_ND(SHL64ri) {
5037 unsigned ShAmt = getTruncatedShiftCount(MI, 2);
5038 // Converting to LEA only pays off when the shifted operand stays live,
5039 // since it spares a register copy; when the shift is the operand's only
5040 // user, reusing the flags is strictly better.
5041 if (isTruncatedShiftCountForLEA(ShAmt)) {
5042 Register SrcReg = MI.getOperand(1).getReg();
5043 const MachineRegisterInfo &MRI = MI.getMF()->getRegInfo();
5044 if (!SrcReg.isVirtual() || !MRI.hasOneNonDBGUse(SrcReg))
5045 return false;
5046 }
5047 return ShAmt != 0;
5048 }
5049
5050 CASE_ND(SHRD16rri8)
5051 CASE_ND(SHRD32rri8)
5052 CASE_ND(SHRD64rri8)
5053 CASE_ND(SHLD16rri8)
5054 CASE_ND(SHLD32rri8)
5055 CASE_ND(SHLD64rri8)
5056 return getTruncatedShiftCount(MI, 3) != 0;
5057
5058 CASE_ND(SUB64ri32)
5059 CASE_ND(SUB32ri)
5060 CASE_ND(SUB16ri)
5061 CASE_ND(SUB8ri)
5062 CASE_ND(SUB64rr)
5063 CASE_ND(SUB32rr)
5064 CASE_ND(SUB16rr)
5065 CASE_ND(SUB8rr)
5066 CASE_ND(SUB64rm)
5067 CASE_ND(SUB32rm)
5068 CASE_ND(SUB16rm)
5069 CASE_ND(SUB8rm)
5070 CASE_ND(DEC64r)
5071 CASE_ND(DEC32r)
5072 CASE_ND(DEC16r)
5073 CASE_ND(DEC8r)
5074 CASE_ND(ADD64ri32)
5075 CASE_ND(ADD32ri)
5076 CASE_ND(ADD16ri)
5077 CASE_ND(ADD8ri)
5078 CASE_ND(ADD64rr)
5079 CASE_ND(ADD32rr)
5080 CASE_ND(ADD16rr)
5081 CASE_ND(ADD8rr)
5082 CASE_ND(ADD64rm)
5083 CASE_ND(ADD32rm)
5084 CASE_ND(ADD16rm)
5085 CASE_ND(ADD8rm)
5086 CASE_ND(INC64r)
5087 CASE_ND(INC32r)
5088 CASE_ND(INC16r)
5089 CASE_ND(INC8r)
5090 CASE_ND(ADC64ri32)
5091 CASE_ND(ADC32ri)
5092 CASE_ND(ADC16ri)
5093 CASE_ND(ADC8ri)
5094 CASE_ND(ADC64rr)
5095 CASE_ND(ADC32rr)
5096 CASE_ND(ADC16rr)
5097 CASE_ND(ADC8rr)
5098 CASE_ND(ADC64rm)
5099 CASE_ND(ADC32rm)
5100 CASE_ND(ADC16rm)
5101 CASE_ND(ADC8rm)
5102 CASE_ND(SBB64ri32)
5103 CASE_ND(SBB32ri)
5104 CASE_ND(SBB16ri)
5105 CASE_ND(SBB8ri)
5106 CASE_ND(SBB64rr)
5107 CASE_ND(SBB32rr)
5108 CASE_ND(SBB16rr)
5109 CASE_ND(SBB8rr)
5110 CASE_ND(SBB64rm)
5111 CASE_ND(SBB32rm)
5112 CASE_ND(SBB16rm)
5113 CASE_ND(SBB8rm)
5114 CASE_ND(NEG8r)
5115 CASE_ND(NEG16r)
5116 CASE_ND(NEG32r)
5117 CASE_ND(NEG64r)
5118 case X86::LZCNT16rr:
5119 case X86::LZCNT16rm:
5120 case X86::LZCNT32rr:
5121 case X86::LZCNT32rm:
5122 case X86::LZCNT64rr:
5123 case X86::LZCNT64rm:
5124 case X86::POPCNT16rr:
5125 case X86::POPCNT16rm:
5126 case X86::POPCNT32rr:
5127 case X86::POPCNT32rm:
5128 case X86::POPCNT64rr:
5129 case X86::POPCNT64rm:
5130 case X86::TZCNT16rr:
5131 case X86::TZCNT16rm:
5132 case X86::TZCNT32rr:
5133 case X86::TZCNT32rm:
5134 case X86::TZCNT64rr:
5135 case X86::TZCNT64rm:
5136 return true;
5137 CASE_ND(AND64ri32)
5138 CASE_ND(AND32ri)
5139 CASE_ND(AND16ri)
5140 CASE_ND(AND8ri)
5141 CASE_ND(AND64rr)
5142 CASE_ND(AND32rr)
5143 CASE_ND(AND16rr)
5144 CASE_ND(AND8rr)
5145 CASE_ND(AND64rm)
5146 CASE_ND(AND32rm)
5147 CASE_ND(AND16rm)
5148 CASE_ND(AND8rm)
5149 CASE_ND(XOR64ri32)
5150 CASE_ND(XOR32ri)
5151 CASE_ND(XOR16ri)
5152 CASE_ND(XOR8ri)
5153 CASE_ND(XOR64rr)
5154 CASE_ND(XOR32rr)
5155 CASE_ND(XOR16rr)
5156 CASE_ND(XOR8rr)
5157 CASE_ND(XOR64rm)
5158 CASE_ND(XOR32rm)
5159 CASE_ND(XOR16rm)
5160 CASE_ND(XOR8rm)
5161 CASE_ND(OR64ri32)
5162 CASE_ND(OR32ri)
5163 CASE_ND(OR16ri)
5164 CASE_ND(OR8ri)
5165 CASE_ND(OR64rr)
5166 CASE_ND(OR32rr)
5167 CASE_ND(OR16rr)
5168 CASE_ND(OR8rr)
5169 CASE_ND(OR64rm)
5170 CASE_ND(OR32rm)
5171 CASE_ND(OR16rm)
5172 CASE_ND(OR8rm)
5173 CASE_EVEX(ANDN32rr)
5174 CASE_EVEX(ANDN32rm)
5175 CASE_EVEX(ANDN64rr)
5176 CASE_EVEX(ANDN64rm)
5177 CASE_EVEX(BLSI32rr)
5178 CASE_EVEX(BLSI32rm)
5179 CASE_EVEX(BLSI64rr)
5180 CASE_EVEX(BLSI64rm)
5181 CASE_EVEX(BLSMSK32rr)
5182 CASE_EVEX(BLSMSK32rm)
5183 CASE_EVEX(BLSMSK64rr)
5184 CASE_EVEX(BLSMSK64rm)
5185 CASE_EVEX(BLSR32rr)
5186 CASE_EVEX(BLSR32rm)
5187 CASE_EVEX(BLSR64rr)
5188 CASE_EVEX(BLSR64rm)
5189 case X86::BLCFILL32rr:
5190 case X86::BLCFILL32rm:
5191 case X86::BLCFILL64rr:
5192 case X86::BLCFILL64rm:
5193 case X86::BLCI32rr:
5194 case X86::BLCI32rm:
5195 case X86::BLCI64rr:
5196 case X86::BLCI64rm:
5197 case X86::BLCIC32rr:
5198 case X86::BLCIC32rm:
5199 case X86::BLCIC64rr:
5200 case X86::BLCIC64rm:
5201 case X86::BLCMSK32rr:
5202 case X86::BLCMSK32rm:
5203 case X86::BLCMSK64rr:
5204 case X86::BLCMSK64rm:
5205 case X86::BLCS32rr:
5206 case X86::BLCS32rm:
5207 case X86::BLCS64rr:
5208 case X86::BLCS64rm:
5209 case X86::BLSFILL32rr:
5210 case X86::BLSFILL32rm:
5211 case X86::BLSFILL64rr:
5212 case X86::BLSFILL64rm:
5213 case X86::BLSIC32rr:
5214 case X86::BLSIC32rm:
5215 case X86::BLSIC64rr:
5216 case X86::BLSIC64rm:
5217 CASE_EVEX(BZHI32rr)
5218 CASE_EVEX(BZHI32rm)
5219 CASE_EVEX(BZHI64rr)
5220 CASE_EVEX(BZHI64rm)
5221 case X86::T1MSKC32rr:
5222 case X86::T1MSKC32rm:
5223 case X86::T1MSKC64rr:
5224 case X86::T1MSKC64rm:
5225 case X86::TZMSK32rr:
5226 case X86::TZMSK32rm:
5227 case X86::TZMSK64rr:
5228 case X86::TZMSK64rm:
5229 // These instructions clear the overflow flag just like TEST.
5230 // FIXME: These are not the only instructions in this switch that clear the
5231 // overflow flag.
5232 ClearsOverflowFlag = true;
5233 return true;
5234 CASE_EVEX(BEXTR32rr)
5235 CASE_EVEX(BEXTR64rr)
5236 CASE_EVEX(BEXTR32rm)
5237 CASE_EVEX(BEXTR64rm)
5238 case X86::BEXTRI32ri:
5239 case X86::BEXTRI32mi:
5240 case X86::BEXTRI64ri:
5241 case X86::BEXTRI64mi:
5242 // BEXTR doesn't update the sign flag so we can't use it. It does clear
5243 // the overflow flag, but that's not useful without the sign flag.
5244 NoSignFlag = true;
5245 return true;
5246 }
5247}
5248
5249/// Check whether the use can be converted to remove a comparison against zero.
5250/// Returns the EFLAGS condition and the operand that we are comparing against zero.
5251static std::pair<X86::CondCode, unsigned> isUseDefConvertible(const MachineInstr &MI) {
5252 switch (MI.getOpcode()) {
5253 default:
5254 return std::make_pair(X86::COND_INVALID, ~0U);
5255 CASE_ND(NEG8r)
5256 CASE_ND(NEG16r)
5257 CASE_ND(NEG32r)
5258 CASE_ND(NEG64r)
5259 return std::make_pair(X86::COND_AE, 1U);
5260 case X86::LZCNT16rr:
5261 case X86::LZCNT32rr:
5262 case X86::LZCNT64rr:
5263 return std::make_pair(X86::COND_B, 1U);
5264 case X86::POPCNT16rr:
5265 case X86::POPCNT32rr:
5266 case X86::POPCNT64rr:
5267 return std::make_pair(X86::COND_E, 1U);
5268 case X86::TZCNT16rr:
5269 case X86::TZCNT32rr:
5270 case X86::TZCNT64rr:
5271 return std::make_pair(X86::COND_B, 1U);
5272 case X86::BSF16rr:
5273 case X86::BSF32rr:
5274 case X86::BSF64rr:
5275 case X86::BSR16rr:
5276 case X86::BSR32rr:
5277 case X86::BSR64rr:
5278 return std::make_pair(X86::COND_E, 2U);
5279 CASE_EVEX(BLSI32rr)
5280 CASE_EVEX(BLSI64rr)
5281 return std::make_pair(X86::COND_AE, 1U);
5282 CASE_EVEX(BLSR32rr)
5283 CASE_EVEX(BLSR64rr)
5284 CASE_EVEX(BLSMSK32rr)
5285 CASE_EVEX(BLSMSK64rr)
5286 return std::make_pair(X86::COND_B, 1U);
5287 // TODO: TBM instructions.
5288 }
5289}
5290#undef CASE_EVEX
5291
5292MachineInstr *X86InstrInfo::findDominatingRedundantFlagInstr(
5293 MachineInstr &CmpInstr, Register SrcReg, Register SrcReg2, int64_t CmpMask,
5294 int64_t CmpValue, MachineBasicBlock *MultiPredMBB, bool &IsSwapped,
5295 int64_t &ImmDelta,
5296 SmallVectorImpl<std::pair<MachineInstr *, unsigned>> &InstsToUpdate) const {
5297 assert(Subtarget.hasNF() && "NF feature required");
5298 const TargetRegisterInfo *TRI = &getRegisterInfo();
5299
5300 // The caller already scanned MultiPredMBB without finding the producer, so it
5301 // must live in a block that strictly dominates MultiPredMBB. Walk
5302 // predecessors backward to find it and prove dominance, avoiding a
5303 // whole-function MachineDominatorTree that would be rebuilt in O(function
5304 // size) per compare.
5305 //
5306 // The producer's block dominates MultiPredMBB iff every backward path funnels
5307 // through it before a function-entry block, so expand predecessors but stop
5308 // at a block holding the producer. Bail if a predecessor-less block is
5309 // reached without the producer (a path bypasses it) or the producer is found
5310 // in two blocks (neither dominates alone). Within a block, scan backward,
5311 // collecting the NF-convertible EFLAGS clobbers above the producer and
5312 // bailing on any other clobber (it would shadow the producer's flags from
5313 // CmpInstr).
5314 //
5315 // Clobbers are staged in Pending and committed only on success. Visited
5316 // is seeded with the caller's single-predecessor chain (CmpMBB through
5317 // MultiPredMBB) so the walk doesn't re-scan blocks the caller already
5318 // staged. The walk doubles as a cycle detector: a predecessor equal to
5319 // CmpMBB is a back-edge from CmpMBB's successors into the walked region,
5320 // which means CmpMBB is on a CFG cycle. In that case the region below
5321 // CmpInstr executes on the back-edge before the next iteration's CmpInstr
5322 // and must be checked too: bail on any non-NF-convertible EFLAGS clobber,
5323 // stage NF-convertible ones.
5324 //
5325 // Each NF conversion trades a compact legacy/EVEX-compressed encoding for a
5326 // wider EVEX (often NDD three-operand) one, growing code size, while the
5327 // reuse only removes a single compare. Cap the total number of conversions
5328 // (caller chain + predecessor walk + below-scan) so the reuse cannot bloat
5329 // code just to delete one compare.
5330 MachineInstr *Sub = nullptr;
5331 MachineBasicBlock *SubMBB = nullptr;
5333
5334 MachineBasicBlock *CmpMBB = CmpInstr.getParent();
5335 SmallPtrSet<MachineBasicBlock *, 8> Visited;
5337 for (MachineBasicBlock *MBB = CmpMBB; MBB != MultiPredMBB;
5339 Visited.insert(MBB);
5340 Visited.insert(MultiPredMBB);
5341
5342 bool CmpMBBOnCycle = false;
5343 auto TryPush = [&](MachineBasicBlock *Pred) {
5344 if (Pred == CmpMBB)
5345 CmpMBBOnCycle = true;
5346 if (Visited.insert(Pred).second)
5347 Worklist.push_back(Pred);
5348 };
5349
5350 for (MachineBasicBlock *Pred : MultiPredMBB->predecessors())
5351 TryPush(Pred);
5352 while (!Worklist.empty()) {
5353 MachineBasicBlock *MBB = Worklist.pop_back_val();
5354 MachineInstr *Producer = nullptr;
5355 for (MachineInstr &Inst : reverse(*MBB)) {
5356 if (!Inst.modifiesRegister(X86::EFLAGS, TRI))
5357 continue;
5358 if (isRedundantFlagInstr(CmpInstr, SrcReg, SrcReg2, CmpMask, CmpValue,
5359 Inst, &IsSwapped, &ImmDelta)) {
5360 Producer = &Inst;
5361 break;
5362 }
5363 unsigned NewOpc = X86::getNFVariantIfClobberRemovable(Inst, TRI);
5364 if (!NewOpc)
5365 return nullptr;
5366 if (InstsToUpdate.size() + Pending.size() >= MaxNFConversions)
5367 return nullptr;
5368 Pending.push_back(std::make_pair(&Inst, NewOpc));
5369 }
5370 if (Producer) {
5371 // A producer in a second block means neither dominates alone.
5372 if (Sub && SubMBB != MBB)
5373 return nullptr;
5374 Sub = Producer;
5375 SubMBB = MBB;
5376 continue;
5377 }
5378 // Entry reached without the producer: some path bypasses it.
5379 if (MBB->pred_empty())
5380 return nullptr;
5381 for (MachineBasicBlock *Pred : MBB->predecessors())
5382 TryPush(Pred);
5383 }
5384 if (!Sub)
5385 return nullptr;
5386
5387 // The forward condition-code fixup in the caller (OpsToUpdate) only rewrites
5388 // EFLAGS users within CmpMBB. When the producer's flags require a condition
5389 // swap or an immediate adjustment, EFLAGS users elsewhere in the dominated
5390 // region or in CmpMBB's successors (when EFLAGS is live-out) would also need
5391 // rewriting, which is not handled here. Restrict the multi-predecessor case
5392 // to producers that yield identical flags.
5393 if (IsSwapped || ImmDelta != 0)
5394 return nullptr;
5395
5396 // If CmpMBB is on a CFG cycle, its below-CmpInstr region is on the back-edge
5397 // path and must also be free of non-NF-convertible EFLAGS clobbers.
5398 if (CmpMBBOnCycle) {
5399 for (MachineInstr &Inst : make_range(
5400 std::next(MachineBasicBlock::iterator(CmpInstr)), CmpMBB->end())) {
5401 if (!Inst.modifiesRegister(X86::EFLAGS, TRI))
5402 continue;
5403 unsigned NewOpc = X86::getNFVariantIfClobberRemovable(Inst, TRI);
5404 if (!NewOpc)
5405 return nullptr;
5406 if (InstsToUpdate.size() + Pending.size() >= MaxNFConversions)
5407 return nullptr;
5408 Pending.push_back(std::make_pair(&Inst, NewOpc));
5409 }
5410 }
5411
5412 InstsToUpdate.append(Pending.begin(), Pending.end());
5413 return Sub;
5414}
5415
5416/// Check if there exists an earlier instruction that
5417/// operates on the same source operands and sets flags in the same way as
5418/// Compare; remove Compare if possible.
5420 Register SrcReg2, int64_t CmpMask,
5421 int64_t CmpValue,
5422 const MachineRegisterInfo *MRI) const {
5423 // Check whether we can replace SUB with CMP.
5424 switch (CmpInstr.getOpcode()) {
5425 default:
5426 break;
5427 CASE_ND(SUB64ri32)
5428 CASE_ND(SUB32ri)
5429 CASE_ND(SUB16ri)
5430 CASE_ND(SUB8ri)
5431 CASE_ND(SUB64rm)
5432 CASE_ND(SUB32rm)
5433 CASE_ND(SUB16rm)
5434 CASE_ND(SUB8rm)
5435 CASE_ND(SUB64rr)
5436 CASE_ND(SUB32rr)
5437 CASE_ND(SUB16rr)
5438 CASE_ND(SUB8rr) {
5439 if (!MRI->use_nodbg_empty(CmpInstr.getOperand(0).getReg()))
5440 return false;
5441 // There is no use of the destination register, we can replace SUB with CMP.
5442 unsigned NewOpcode = 0;
5443#define FROM_TO(A, B) \
5444 CASE_ND(A) NewOpcode = X86::B; \
5445 break;
5446 switch (CmpInstr.getOpcode()) {
5447 default:
5448 llvm_unreachable("Unreachable!");
5449 FROM_TO(SUB64rm, CMP64rm)
5450 FROM_TO(SUB32rm, CMP32rm)
5451 FROM_TO(SUB16rm, CMP16rm)
5452 FROM_TO(SUB8rm, CMP8rm)
5453 FROM_TO(SUB64rr, CMP64rr)
5454 FROM_TO(SUB32rr, CMP32rr)
5455 FROM_TO(SUB16rr, CMP16rr)
5456 FROM_TO(SUB8rr, CMP8rr)
5457 FROM_TO(SUB64ri32, CMP64ri32)
5458 FROM_TO(SUB32ri, CMP32ri)
5459 FROM_TO(SUB16ri, CMP16ri)
5460 FROM_TO(SUB8ri, CMP8ri)
5461 }
5462#undef FROM_TO
5463 CmpInstr.setDesc(get(NewOpcode));
5464 CmpInstr.removeOperand(0);
5465 // Mutating this instruction invalidates any debug data associated with it.
5466 CmpInstr.dropDebugNumber();
5467 // Fall through to optimize Cmp if Cmp is CMPrr or CMPri.
5468 if (NewOpcode == X86::CMP64rm || NewOpcode == X86::CMP32rm ||
5469 NewOpcode == X86::CMP16rm || NewOpcode == X86::CMP8rm)
5470 return false;
5471 }
5472 }
5473
5474 // The following code tries to remove the comparison by re-using EFLAGS
5475 // from earlier instructions.
5476
5477 bool IsCmpZero = (CmpMask != 0 && CmpValue == 0);
5478
5479 // Transformation currently requires SSA values.
5480 if (SrcReg2.isPhysical())
5481 return false;
5482 MachineInstr *SrcRegDef = MRI->getVRegDef(SrcReg);
5483 if (!SrcRegDef)
5484 return false;
5485
5486 MachineInstr *MI = nullptr;
5487 MachineInstr *Sub = nullptr;
5488 MachineInstr *Movr0Inst = nullptr;
5489 MachineInstr *LTZCNTInst = nullptr;
5491 bool NoSignFlag = false;
5492 bool ClearsOverflowFlag = false;
5493 bool ShouldUpdateCC = false;
5494 bool IsSwapped = false;
5495 bool HasNF = Subtarget.hasNF();
5496 unsigned OpNo = 0;
5498 int64_t ImmDelta = 0;
5499
5500 // Search backward from CmpInstr for the next instruction defining EFLAGS.
5502 MachineBasicBlock &CmpMBB = *CmpInstr.getParent();
5504 std::next(MachineBasicBlock::reverse_iterator(CmpInstr));
5505 for (MachineBasicBlock *MBB = &CmpMBB;;) {
5506 for (MachineInstr &Inst : make_range(From, MBB->rend())) {
5507 // Try to use EFLAGS from the instruction defining %SrcReg. Example:
5508 // %eax = addl ...
5509 // ... // EFLAGS not changed
5510 // testl %eax, %eax // <-- can be removed
5511 if (&Inst == SrcRegDef) {
5512 if (IsCmpZero &&
5513 isDefConvertible(Inst, NoSignFlag, ClearsOverflowFlag)) {
5514 MI = &Inst;
5515 break;
5516 }
5517
5518 // Look back for the following pattern, in which case the
5519 // test16rr/test64rr instruction could be erased.
5520 //
5521 // Example for test16rr:
5522 // %reg = and32ri %in_reg, 5
5523 // ... // EFLAGS not changed.
5524 // %src_reg = copy %reg.sub_16bit:gr32
5525 // test16rr %src_reg, %src_reg, implicit-def $eflags
5526 // Example for test64rr:
5527 // %reg = and32ri %in_reg, 5
5528 // ... // EFLAGS not changed.
5529 // %src_reg = subreg_to_reg %reg, %subreg.sub_index
5530 // test64rr %src_reg, %src_reg, implicit-def $eflags
5531 MachineInstr *AndInstr = nullptr;
5532 if (IsCmpZero &&
5533 findRedundantFlagInstr(CmpInstr, Inst, MRI, &AndInstr, TRI,
5534 Subtarget, NoSignFlag, ClearsOverflowFlag)) {
5535 assert(AndInstr != nullptr && X86::isAND(AndInstr->getOpcode()));
5536 MI = AndInstr;
5537 break;
5538 }
5539 // Cannot find other candidates before definition of SrcReg.
5540 return false;
5541 }
5542
5543 if (Inst.modifiesRegister(X86::EFLAGS, TRI)) {
5544 // Try to use EFLAGS produced by an instruction reading %SrcReg.
5545 // Example:
5546 // %eax = ...
5547 // ...
5548 // popcntl %eax
5549 // ... // EFLAGS not changed
5550 // testl %eax, %eax // <-- can be removed
5551 if (IsCmpZero) {
5552 std::tie(NewCC, OpNo) = isUseDefConvertible(Inst);
5553 if (NewCC != X86::COND_INVALID && Inst.getOperand(OpNo).isReg() &&
5554 Inst.getOperand(OpNo).getReg() == SrcReg) {
5555 ShouldUpdateCC = true;
5556 MI = &Inst;
5557 break;
5558 }
5559 }
5560
5561 // Try to use EFLAGS from an instruction with similar flag results.
5562 // Example:
5563 // sub x, y or cmp x, y
5564 // ... // EFLAGS not changed
5565 // cmp x, y // <-- can be removed
5566 if (isRedundantFlagInstr(CmpInstr, SrcReg, SrcReg2, CmpMask, CmpValue,
5567 Inst, &IsSwapped, &ImmDelta)) {
5568 Sub = &Inst;
5569 break;
5570 }
5571
5572 // Try to use CF produced by an LZCNT/TZCNT reading %SrcReg: it and
5573 // "cmp $1, %SrcReg" both set CF iff %SrcReg is zero. The other flags
5574 // differ, so all EFLAGS users need to read CF only (ADC/SBB/RCL/RCR).
5575 // Example:
5576 // lzcntq %rdi, %rax
5577 // ... // EFLAGS not changed
5578 // cmpq $1, %rdi // <-- can be removed
5579 // adcq $0, %rax // reads CF only
5580 if (isCmpRedundantAfterLTZCNT(SrcReg, SrcReg2, CmpMask, CmpValue,
5581 Inst)) {
5582 LTZCNTInst = &Inst;
5583 break;
5584 }
5585
5586 // MOV32r0 is implemented with xor which clobbers condition code. It is
5587 // safe to move up, if the definition to EFLAGS is dead and earlier
5588 // instructions do not read or write EFLAGS.
5589 if (!Movr0Inst && Inst.getOpcode() == X86::MOV32r0 &&
5590 Inst.registerDefIsDead(X86::EFLAGS, TRI)) {
5591 Movr0Inst = &Inst;
5592 continue;
5593 }
5594
5595 // Try to replace non-NF with NF instructions.
5596 if (HasNF) {
5597 unsigned NewOp = X86::getNFVariantIfClobberRemovable(Inst, TRI);
5598 if (!NewOp)
5599 return false;
5600
5601 InstsToUpdate.push_back(std::make_pair(&Inst, NewOp));
5602 continue;
5603 }
5604
5605 // Cannot do anything for any other EFLAG changes.
5606 return false;
5607 }
5608 }
5609
5610 if (MI || Sub || LTZCNTInst)
5611 break;
5612
5613 // Reached the begin of the basic block. If it has exactly one predecessor,
5614 // continue the backward scan there. Otherwise (multiple predecessors), try
5615 // to reuse EFLAGS from a dominating producer (handled below).
5616 if (MBB->pred_size() != 1) {
5617 // The block has multiple predecessors. We can still reuse EFLAGS from an
5618 // equivalent flag producer that dominates CmpInstr, provided every path
5619 // from that producer to CmpInstr only clobbers EFLAGS via instructions
5620 // that have an NF (no-flags) variant (which requires APX). This handles
5621 // patterns like (CMP duplicated by CodeGenPrepare across a diamond):
5622 // entry: cmp %x, C ; br
5623 // bb1: imul ... ; clobbers EFLAGS -> {nf} imul
5624 // bb2: ...
5625 // bb3: cmp %x, C ; <-- redundant, reuse EFLAGS from entry
5626 // cmovcc ...
5627 // The helper caps the total number of NF conversions so this cannot grow
5628 // code size without bound just to delete one compare.
5629 if (HasNF)
5630 Sub = findDominatingRedundantFlagInstr(
5631 CmpInstr, SrcReg, SrcReg2, CmpMask, CmpValue, MBB, IsSwapped,
5632 ImmDelta, InstsToUpdate);
5633 if (!Sub)
5634 return false;
5635 break;
5636 }
5637 MBB = *MBB->pred_begin();
5638 From = MBB->rbegin();
5639 }
5640
5641 // Scan forward from the instruction after CmpInstr for uses of EFLAGS.
5642 // It is safe to remove CmpInstr if EFLAGS is redefined or killed.
5643 // If we are done with the basic block, we need to check whether EFLAGS is
5644 // live-out.
5645 bool FlagsMayLiveOut = true;
5647 MachineBasicBlock::iterator AfterCmpInstr =
5648 std::next(MachineBasicBlock::iterator(CmpInstr));
5649 for (MachineInstr &Instr : make_range(AfterCmpInstr, CmpMBB.end())) {
5650 bool ModifyEFLAGS = Instr.modifiesRegister(X86::EFLAGS, TRI);
5651 bool UseEFLAGS = Instr.readsRegister(X86::EFLAGS, TRI);
5652 // We should check the usage if this instruction uses and updates EFLAGS.
5653 if (!UseEFLAGS && ModifyEFLAGS) {
5654 // It is safe to remove CmpInstr if EFLAGS is updated again.
5655 FlagsMayLiveOut = false;
5656 break;
5657 }
5658 if (!UseEFLAGS && !ModifyEFLAGS)
5659 continue;
5660
5661 // EFLAGS is used by this instruction.
5662 X86::CondCode OldCC = X86::getCondFromMI(Instr);
5663 if ((MI || IsSwapped || ImmDelta != 0) && OldCC == X86::COND_INVALID)
5664 return false;
5665
5666 X86::CondCode ReplacementCC = X86::COND_INVALID;
5667 if (MI) {
5668 switch (OldCC) {
5669 default:
5670 break;
5671 case X86::COND_A:
5672 case X86::COND_AE:
5673 case X86::COND_B:
5674 case X86::COND_BE:
5675 // CF is used, we can't perform this optimization.
5676 return false;
5677 case X86::COND_G:
5678 case X86::COND_GE:
5679 case X86::COND_L:
5680 case X86::COND_LE:
5681 // If SF is used, but the instruction doesn't update the SF, then we
5682 // can't do the optimization.
5683 if (NoSignFlag)
5684 return false;
5685 [[fallthrough]];
5686 case X86::COND_O:
5687 case X86::COND_NO:
5688 // If OF is used, the instruction needs to clear it like CmpZero does.
5689 if (!ClearsOverflowFlag)
5690 return false;
5691 break;
5692 case X86::COND_S:
5693 case X86::COND_NS:
5694 // If SF is used, but the instruction doesn't update the SF, then we
5695 // can't do the optimization.
5696 if (NoSignFlag)
5697 return false;
5698 break;
5699 }
5700
5701 // If we're updating the condition code check if we have to reverse the
5702 // condition.
5703 if (ShouldUpdateCC)
5704 switch (OldCC) {
5705 default:
5706 return false;
5707 case X86::COND_E:
5708 ReplacementCC = NewCC;
5709 break;
5710 case X86::COND_NE:
5711 ReplacementCC = GetOppositeBranchCondition(NewCC);
5712 break;
5713 }
5714 } else if (IsSwapped) {
5715 // If we have SUB(r1, r2) and CMP(r2, r1), the condition code needs
5716 // to be changed from r2 > r1 to r1 < r2, from r2 < r1 to r1 > r2, etc.
5717 // We swap the condition code and synthesize the new opcode.
5718 ReplacementCC = getSwappedCondition(OldCC);
5719 if (ReplacementCC == X86::COND_INVALID)
5720 return false;
5721 ShouldUpdateCC = true;
5722 } else if (ImmDelta != 0) {
5723 unsigned BitWidth = RI.getRegSizeInBits(*MRI->getRegClass(SrcReg));
5724 // Shift amount for min/max constants to adjust for 8/16/32 instruction
5725 // sizes.
5726 switch (OldCC) {
5727 case X86::COND_L: // x <s (C + 1) --> x <=s C
5728 if (ImmDelta != 1 || APInt::getSignedMinValue(BitWidth) == CmpValue)
5729 return false;
5730 ReplacementCC = X86::COND_LE;
5731 break;
5732 case X86::COND_B: // x <u (C + 1) --> x <=u C
5733 if (ImmDelta != 1 || CmpValue == 0)
5734 return false;
5735 ReplacementCC = X86::COND_BE;
5736 break;
5737 case X86::COND_GE: // x >=s (C + 1) --> x >s C
5738 if (ImmDelta != 1 || APInt::getSignedMinValue(BitWidth) == CmpValue)
5739 return false;
5740 ReplacementCC = X86::COND_G;
5741 break;
5742 case X86::COND_AE: // x >=u (C + 1) --> x >u C
5743 if (ImmDelta != 1 || CmpValue == 0)
5744 return false;
5745 ReplacementCC = X86::COND_A;
5746 break;
5747 case X86::COND_G: // x >s (C - 1) --> x >=s C
5748 if (ImmDelta != -1 || APInt::getSignedMaxValue(BitWidth) == CmpValue)
5749 return false;
5750 ReplacementCC = X86::COND_GE;
5751 break;
5752 case X86::COND_A: // x >u (C - 1) --> x >=u C
5753 if (ImmDelta != -1 || APInt::getMaxValue(BitWidth) == CmpValue)
5754 return false;
5755 ReplacementCC = X86::COND_AE;
5756 break;
5757 case X86::COND_LE: // x <=s (C - 1) --> x <s C
5758 if (ImmDelta != -1 || APInt::getSignedMaxValue(BitWidth) == CmpValue)
5759 return false;
5760 ReplacementCC = X86::COND_L;
5761 break;
5762 case X86::COND_BE: // x <=u (C - 1) --> x <u C
5763 if (ImmDelta != -1 || APInt::getMaxValue(BitWidth) == CmpValue)
5764 return false;
5765 ReplacementCC = X86::COND_B;
5766 break;
5767 default:
5768 return false;
5769 }
5770 ShouldUpdateCC = true;
5771 }
5772
5773 if (LTZCNTInst) {
5774 unsigned InstCode = Instr.getOpcode();
5775 if (!X86::isADC(InstCode) && !X86::isSBB(InstCode) &&
5776 !X86::isRCL(InstCode) && !X86::isRCR(InstCode))
5777 return false;
5778
5779 MI = LTZCNTInst;
5780 }
5781
5782 if (ShouldUpdateCC && ReplacementCC != OldCC) {
5783 // Push the MachineInstr to OpsToUpdate.
5784 // If it is safe to remove CmpInstr, the condition code of these
5785 // instructions will be modified.
5786 OpsToUpdate.push_back(std::make_pair(&Instr, ReplacementCC));
5787 }
5788 if (ModifyEFLAGS || Instr.killsRegister(X86::EFLAGS, TRI)) {
5789 // It is safe to remove CmpInstr if EFLAGS is updated again or killed.
5790 FlagsMayLiveOut = false;
5791 break;
5792 }
5793 }
5794
5795 if (LTZCNTInst && !MI)
5796 return false;
5797
5798 // If we have to update users but EFLAGS is live-out abort, since we cannot
5799 // easily find all of the users.
5800 if ((MI != nullptr || ShouldUpdateCC) && FlagsMayLiveOut) {
5801 for (MachineBasicBlock *Successor : CmpMBB.successors())
5802 if (Successor->isLiveIn(X86::EFLAGS))
5803 return false;
5804 }
5805
5806 // The instruction to be updated is either Sub or MI.
5807 assert((MI == nullptr || Sub == nullptr) && "Should not have Sub and MI set");
5808 Sub = MI != nullptr ? MI : Sub;
5809 MachineBasicBlock *SubBB = Sub->getParent();
5810 // Move Movr0Inst to the appropriate place before Sub.
5811 if (Movr0Inst) {
5812 // Only move within the same block so we don't accidentally move to a
5813 // block with higher execution frequency.
5814 if (&CmpMBB != SubBB)
5815 return false;
5816 // Look backwards until we find a def that doesn't use the current EFLAGS.
5818 InsertE = Sub->getParent()->rend();
5819 for (; InsertI != InsertE; ++InsertI) {
5820 MachineInstr *Instr = &*InsertI;
5821 if (!Instr->readsRegister(X86::EFLAGS, TRI) &&
5822 Instr->modifiesRegister(X86::EFLAGS, TRI)) {
5823 Movr0Inst->getParent()->remove(Movr0Inst);
5824 Instr->getParent()->insert(MachineBasicBlock::iterator(Instr),
5825 Movr0Inst);
5826 break;
5827 }
5828 }
5829 if (InsertI == InsertE)
5830 return false;
5831 }
5832
5833 // Replace non-NF with NF instructions.
5834 for (auto &Inst : InstsToUpdate) {
5835 Inst.first->setDesc(get(Inst.second));
5836 Inst.first->removeOperand(
5837 Inst.first->findRegisterDefOperandIdx(X86::EFLAGS, /*TRI=*/nullptr));
5838 }
5839
5840 // Make sure Sub instruction defines EFLAGS and mark the def live.
5841 MachineOperand *FlagDef =
5842 Sub->findRegisterDefOperand(X86::EFLAGS, /*TRI=*/nullptr);
5843 assert(FlagDef && "Unable to locate a def EFLAGS operand");
5844 FlagDef->setIsDead(false);
5845
5846 CmpInstr.eraseFromParent();
5847
5848 // Modify the condition code of instructions in OpsToUpdate.
5849 for (auto &Op : OpsToUpdate) {
5850 Op.first->getOperand(Op.first->getDesc().getNumOperands() - 1)
5851 .setImm(Op.second);
5852 }
5853 // Add EFLAGS to block live-ins between CmpBB and block of flags producer.
5854 // Walk the CFG backward from CmpMBB up to (but excluding) SubBB, marking
5855 // EFLAGS live-in on every block in between. SubBB dominates CmpMBB (whether
5856 // the producer was found by the single-predecessor backward walk or the
5857 // multi-predecessor dominator search), so the walk reaches SubBB on every
5858 // path and never escapes above it. A single-predecessor chain is just the
5859 // degenerate case where every block has exactly one predecessor.
5861 SmallVector<MachineBasicBlock *, 8> Worklist(1, &CmpMBB);
5862 Visited.insert(&CmpMBB);
5863 while (!Worklist.empty()) {
5864 MachineBasicBlock *MBB = Worklist.pop_back_val();
5865 // EFLAGS is produced inside SubBB, so it is not live-in there.
5866 if (MBB == SubBB)
5867 continue;
5868 if (!MBB->isLiveIn(X86::EFLAGS))
5869 MBB->addLiveIn(X86::EFLAGS);
5870 for (MachineBasicBlock *Pred : MBB->predecessors())
5871 if (Visited.insert(Pred).second)
5872 Worklist.push_back(Pred);
5873 }
5874 return true;
5875}
5876
5877/// \returns true if the instruction can be changed to COPY when imm is 0.
5878static bool canConvert2Copy(unsigned Opc) {
5879 switch (Opc) {
5880 default:
5881 return false;
5882 CASE_ND(ADD64ri32)
5883 CASE_ND(SUB64ri32)
5884 CASE_ND(OR64ri32)
5885 CASE_ND(XOR64ri32)
5886 CASE_ND(ADD32ri)
5887 CASE_ND(SUB32ri)
5888 CASE_ND(OR32ri)
5889 CASE_ND(XOR32ri)
5890 return true;
5891 }
5892}
5893
5894/// Convert an ALUrr opcode to corresponding ALUri opcode. Such as
5895/// ADD32rr ==> ADD32ri
5896static unsigned convertALUrr2ALUri(unsigned Opc) {
5897 switch (Opc) {
5898 default:
5899 return 0;
5900#define FROM_TO(FROM, TO) \
5901 case X86::FROM: \
5902 return X86::TO; \
5903 case X86::FROM##_ND: \
5904 return X86::TO##_ND;
5905 FROM_TO(ADC64rr, ADC64ri32)
5906 FROM_TO(SBB64rr, SBB64ri32)
5907 FROM_TO(AND64rr, AND64ri32)
5908 FROM_TO(OR64rr, OR64ri32)
5909 FROM_TO(XOR64rr, XOR64ri32)
5910 FROM_TO(SHR64rCL, SHR64ri)
5911 FROM_TO(SHL64rCL, SHL64ri)
5912 FROM_TO(SAR64rCL, SAR64ri)
5913 FROM_TO(ROL64rCL, ROL64ri)
5914 FROM_TO(ROR64rCL, ROR64ri)
5915 FROM_TO(RCL64rCL, RCL64ri)
5916 FROM_TO(RCR64rCL, RCR64ri)
5917 FROM_TO(ADD32rr, ADD32ri)
5918 FROM_TO(ADC32rr, ADC32ri)
5919 FROM_TO(SUB32rr, SUB32ri)
5920 FROM_TO(SBB32rr, SBB32ri)
5921 FROM_TO(AND32rr, AND32ri)
5922 FROM_TO(OR32rr, OR32ri)
5923 FROM_TO(XOR32rr, XOR32ri)
5924 FROM_TO(SHR32rCL, SHR32ri)
5925 FROM_TO(SHL32rCL, SHL32ri)
5926 FROM_TO(SAR32rCL, SAR32ri)
5927 FROM_TO(ROL32rCL, ROL32ri)
5928 FROM_TO(ROR32rCL, ROR32ri)
5929 FROM_TO(RCL32rCL, RCL32ri)
5930 FROM_TO(RCR32rCL, RCR32ri)
5931#undef FROM_TO
5932#define FROM_TO(FROM, TO) \
5933 case X86::FROM: \
5934 return X86::TO;
5935 FROM_TO(ADD64rr, ADD64ri32)
5936 FROM_TO(SUB64rr, SUB64ri32)
5937 FROM_TO(TEST64rr, TEST64ri32)
5938 FROM_TO(CTEST64rr, CTEST64ri32)
5939 FROM_TO(CMP64rr, CMP64ri32)
5940 FROM_TO(CCMP64rr, CCMP64ri32)
5941 FROM_TO(TEST32rr, TEST32ri)
5942 FROM_TO(CTEST32rr, CTEST32ri)
5943 FROM_TO(CMP32rr, CMP32ri)
5944 FROM_TO(CCMP32rr, CCMP32ri)
5945#undef FROM_TO
5946 case X86::ADD64rr_ND:
5947 return X86::ADD64ri32_ND;
5948 case X86::SUB64rr_ND:
5949 return X86::SUB64ri32_ND;
5950 }
5951}
5952
5953/// Reg is assigned ImmVal in DefMI, and is used in UseMI.
5954/// If MakeChange is true, this function tries to replace Reg by ImmVal in
5955/// UseMI. If MakeChange is false, just check if folding is possible.
5956//
5957/// \returns true if folding is successful or possible.
5958bool X86InstrInfo::foldImmediateImpl(MachineInstr &UseMI, MachineInstr *DefMI,
5959 Register Reg, int64_t ImmVal,
5961 bool MakeChange) const {
5962 bool Modified = false;
5963
5964 // 64 bit operations accept sign extended 32 bit immediates.
5965 // 32 bit operations accept all 32 bit immediates, so we don't need to check
5966 // them.
5967 const TargetRegisterClass *RC = nullptr;
5968 if (Reg.isVirtual())
5969 RC = MRI->getRegClass(Reg);
5970 if ((Reg.isPhysical() && X86::GR64RegClass.contains(Reg)) ||
5971 (Reg.isVirtual() && X86::GR64RegClass.hasSubClassEq(RC))) {
5972 if (!isInt<32>(ImmVal))
5973 return false;
5974 }
5975
5976 if (UseMI.findRegisterUseOperand(Reg, /*TRI=*/nullptr)->getSubReg())
5977 return false;
5978 // Immediate has larger code size than register. So avoid folding the
5979 // immediate if it has more than 1 use and we are optimizing for size.
5980 if (UseMI.getMF()->getFunction().hasOptSize() && Reg.isVirtual() &&
5981 !MRI->hasOneNonDBGUse(Reg))
5982 return false;
5983
5984 unsigned Opc = UseMI.getOpcode();
5985 unsigned NewOpc;
5986 if (Opc == TargetOpcode::COPY) {
5987 Register ToReg = UseMI.getOperand(0).getReg();
5988 const TargetRegisterClass *RC = nullptr;
5989 if (ToReg.isVirtual())
5990 RC = MRI->getRegClass(ToReg);
5991 bool GR32Reg = (ToReg.isVirtual() && X86::GR32RegClass.hasSubClassEq(RC)) ||
5992 (ToReg.isPhysical() && X86::GR32RegClass.contains(ToReg));
5993 bool GR64Reg = (ToReg.isVirtual() && X86::GR64RegClass.hasSubClassEq(RC)) ||
5994 (ToReg.isPhysical() && X86::GR64RegClass.contains(ToReg));
5995 bool GR8Reg = (ToReg.isVirtual() && X86::GR8RegClass.hasSubClassEq(RC)) ||
5996 (ToReg.isPhysical() && X86::GR8RegClass.contains(ToReg));
5997
5998 if (ImmVal == 0) {
5999 // We have MOV32r0 only.
6000 if (!GR32Reg)
6001 return false;
6002 }
6003
6004 if (GR64Reg) {
6005 if (isUInt<32>(ImmVal))
6006 NewOpc = X86::MOV32ri64;
6007 else
6008 NewOpc = X86::MOV64ri;
6009 } else if (GR32Reg) {
6010 NewOpc = X86::MOV32ri;
6011 if (ImmVal == 0) {
6012 // MOV32r0 clobbers EFLAGS.
6013 const TargetRegisterInfo *TRI = &getRegisterInfo();
6014 if (UseMI.getParent()->computeRegisterLiveness(
6015 TRI, X86::EFLAGS, UseMI) != MachineBasicBlock::LQR_Dead)
6016 return false;
6017
6018 // MOV32r0 is different than other cases because it doesn't encode the
6019 // immediate in the instruction. So we directly modify it here.
6020 if (!MakeChange)
6021 return true;
6022 UseMI.setDesc(get(X86::MOV32r0));
6023 UseMI.removeOperand(
6024 UseMI.findRegisterUseOperandIdx(Reg, /*TRI=*/nullptr));
6025 UseMI.addOperand(MachineOperand::CreateReg(X86::EFLAGS, /*isDef=*/true,
6026 /*isImp=*/true,
6027 /*isKill=*/false,
6028 /*isDead=*/true));
6029 Modified = true;
6030 }
6031 } else if (GR8Reg)
6032 NewOpc = X86::MOV8ri;
6033 else
6034 return false;
6035 } else
6036 NewOpc = convertALUrr2ALUri(Opc);
6037
6038 if (!NewOpc)
6039 return false;
6040
6041 // For SUB instructions the immediate can only be the second source operand.
6042 if ((NewOpc == X86::SUB64ri32 || NewOpc == X86::SUB32ri ||
6043 NewOpc == X86::SBB64ri32 || NewOpc == X86::SBB32ri ||
6044 NewOpc == X86::SUB64ri32_ND || NewOpc == X86::SUB32ri_ND ||
6045 NewOpc == X86::SBB64ri32_ND || NewOpc == X86::SBB32ri_ND) &&
6046 UseMI.findRegisterUseOperandIdx(Reg, /*TRI=*/nullptr) != 2)
6047 return false;
6048 // For CMP instructions the immediate can only be at index 1.
6049 if (((NewOpc == X86::CMP64ri32 || NewOpc == X86::CMP32ri) ||
6050 (NewOpc == X86::CCMP64ri32 || NewOpc == X86::CCMP32ri)) &&
6051 UseMI.findRegisterUseOperandIdx(Reg, /*TRI=*/nullptr) != 1)
6052 return false;
6053
6054 using namespace X86;
6055 if (isSHL(Opc) || isSHR(Opc) || isSAR(Opc) || isROL(Opc) || isROR(Opc) ||
6056 isRCL(Opc) || isRCR(Opc)) {
6057 unsigned RegIdx = UseMI.findRegisterUseOperandIdx(Reg, /*TRI=*/nullptr);
6058 if (RegIdx < 2)
6059 return false;
6060 if (!isInt<8>(ImmVal))
6061 return false;
6062 assert(Reg == X86::CL);
6063
6064 if (!MakeChange)
6065 return true;
6066 UseMI.setDesc(get(NewOpc));
6067 UseMI.removeOperand(RegIdx);
6068 UseMI.addOperand(MachineOperand::CreateImm(ImmVal));
6069 // Reg is physical register $cl, so we don't know if DefMI is dead through
6070 // MRI. Let the caller handle it, or pass dead-mi-elimination can delete
6071 // the dead physical register define instruction.
6072 return true;
6073 }
6074
6075 if (!MakeChange)
6076 return true;
6077
6078 if (!Modified) {
6079 // Modify the instruction.
6080 if (ImmVal == 0 && canConvert2Copy(NewOpc) &&
6081 UseMI.registerDefIsDead(X86::EFLAGS, /*TRI=*/nullptr)) {
6082 // %100 = add %101, 0
6083 // ==>
6084 // %100 = COPY %101
6085 UseMI.setDesc(get(TargetOpcode::COPY));
6086 UseMI.removeOperand(
6087 UseMI.findRegisterUseOperandIdx(Reg, /*TRI=*/nullptr));
6088 UseMI.removeOperand(
6089 UseMI.findRegisterDefOperandIdx(X86::EFLAGS, /*TRI=*/nullptr));
6090 UseMI.untieRegOperand(0);
6093 } else {
6094 unsigned Op1 = 1, Op2 = CommuteAnyOperandIndex;
6095 unsigned ImmOpNum = 2;
6096 if (!UseMI.getOperand(0).isDef()) {
6097 Op1 = 0; // TEST, CMP, CTEST, CCMP
6098 ImmOpNum = 1;
6099 }
6100 if (Opc == TargetOpcode::COPY)
6101 ImmOpNum = 1;
6102 if (findCommutedOpIndices(UseMI, Op1, Op2) &&
6103 UseMI.getOperand(Op1).getReg() == Reg)
6104 commuteInstruction(UseMI);
6105
6106 assert(UseMI.getOperand(ImmOpNum).getReg() == Reg);
6107 UseMI.setDesc(get(NewOpc));
6108 UseMI.getOperand(ImmOpNum).ChangeToImmediate(ImmVal);
6109 }
6110 }
6111
6112 if (Reg.isVirtual() && MRI->use_nodbg_empty(Reg))
6114
6115 return true;
6116}
6117
6118/// foldImmediate - 'Reg' is known to be defined by a move immediate
6119/// instruction, try to fold the immediate into the use instruction.
6121 Register Reg, MachineRegisterInfo *MRI) const {
6122 int64_t ImmVal;
6123 if (!getConstValDefinedInReg(DefMI, Reg, ImmVal))
6124 return false;
6125
6126 return foldImmediateImpl(UseMI, &DefMI, Reg, ImmVal, MRI, true);
6127}
6128
6129/// Expand a single-def pseudo instruction to a two-addr
6130/// instruction with two undef reads of the register being defined.
6131/// This is used for mapping:
6132/// %xmm4 = V_SET0
6133/// to:
6134/// %xmm4 = PXORrr undef %xmm4, undef %xmm4
6135///
6137 const MCInstrDesc &Desc) {
6138 assert(Desc.getNumOperands() == 3 && "Expected two-addr instruction.");
6139 Register Reg = MIB.getReg(0);
6140 MIB->setDesc(Desc);
6141
6142 // MachineInstr::addOperand() will insert explicit operands before any
6143 // implicit operands.
6145 // But we don't trust that.
6146 assert(MIB.getReg(1) == Reg && MIB.getReg(2) == Reg && "Misplaced operand");
6147 return true;
6148}
6149
6150/// Expand a single-def pseudo instruction to a two-addr
6151/// instruction with two %k0 reads.
6152/// This is used for mapping:
6153/// %k4 = K_SET1
6154/// to:
6155/// %k4 = KXNORrr %k0, %k0
6157 Register Reg) {
6158 assert(Desc.getNumOperands() == 3 && "Expected two-addr instruction.");
6159 MIB->setDesc(Desc);
6161 return true;
6162}
6163
6165 bool MinusOne) {
6166 MachineBasicBlock &MBB = *MIB->getParent();
6167 const DebugLoc &DL = MIB->getDebugLoc();
6168 Register Reg = MIB.getReg(0);
6169
6170 // Insert the XOR.
6171 BuildMI(MBB, MIB.getInstr(), DL, TII.get(X86::XOR32rr), Reg)
6174
6175 // Turn the pseudo into an INC or DEC.
6176 MIB->setDesc(TII.get(MinusOne ? X86::DEC32r : X86::INC32r));
6177 MIB.addReg(Reg);
6178
6179 return true;
6180}
6181
6183 const TargetInstrInfo &TII,
6184 const X86Subtarget &Subtarget) {
6185 MachineBasicBlock &MBB = *MIB->getParent();
6186 const DebugLoc &DL = MIB->getDebugLoc();
6187 int64_t Imm = MIB->getOperand(1).getImm();
6188 assert(Imm != 0 && "Using push/pop for 0 is not efficient.");
6190
6191 int StackAdjustment;
6192
6193 if (Subtarget.is64Bit()) {
6194 assert(MIB->getOpcode() == X86::MOV64ImmSExti8 ||
6195 MIB->getOpcode() == X86::MOV32ImmSExti8);
6196
6197 // Can't use push/pop lowering if the function might write to the red zone.
6198 X86MachineFunctionInfo *X86FI =
6199 MBB.getParent()->getInfo<X86MachineFunctionInfo>();
6200 if (X86FI->getUsesRedZone()) {
6201 MIB->setDesc(TII.get(MIB->getOpcode() == X86::MOV32ImmSExti8
6202 ? X86::MOV32ri
6203 : X86::MOV64ri));
6204 return true;
6205 }
6206
6207 // 64-bit mode doesn't have 32-bit push/pop, so use 64-bit operations and
6208 // widen the register if necessary.
6209 StackAdjustment = 8;
6210 BuildMI(MBB, I, DL, TII.get(X86::PUSH64i32)).addImm(Imm);
6211 MIB->setDesc(TII.get(X86::POP64r));
6212 MIB->getOperand(0).setReg(getX86SubSuperRegister(MIB.getReg(0), 64));
6213 } else {
6214 assert(MIB->getOpcode() == X86::MOV32ImmSExti8);
6215 StackAdjustment = 4;
6216 BuildMI(MBB, I, DL, TII.get(X86::PUSH32i)).addImm(Imm);
6217 MIB->setDesc(TII.get(X86::POP32r));
6218 }
6219 MIB->removeOperand(1);
6220 MIB->addImplicitDefUseOperands(*MBB.getParent());
6221
6222 // Build CFI if necessary.
6223 MachineFunction &MF = *MBB.getParent();
6224 const X86FrameLowering *TFL = Subtarget.getFrameLowering();
6225 bool IsWin64Prologue = MF.getTarget().getMCAsmInfo().usesWindowsCFI();
6226 bool NeedsDwarfCFI = !IsWin64Prologue && MF.needsFrameMoves();
6227 bool EmitCFI = !TFL->hasFP(MF) && NeedsDwarfCFI;
6228 if (EmitCFI) {
6229 TFL->BuildCFI(
6230 MBB, I, DL,
6231 MCCFIInstruction::createAdjustCfaOffset(nullptr, StackAdjustment));
6232 TFL->BuildCFI(
6233 MBB, std::next(I), DL,
6234 MCCFIInstruction::createAdjustCfaOffset(nullptr, -StackAdjustment));
6235 }
6236
6237 return true;
6238}
6239
6240// LoadStackGuard has so far only been implemented for 64-bit MachO. Different
6241// code sequence is needed for other targets.
6243 const TargetInstrInfo &TII) {
6244 MachineBasicBlock &MBB = *MIB->getParent();
6245 const DebugLoc &DL = MIB->getDebugLoc();
6246 Register Reg = MIB.getReg(0);
6247 const GlobalValue *GV =
6248 cast<GlobalValue>((*MIB->memoperands_begin())->getValue());
6249 auto Flags = MachineMemOperand::MOLoad |
6252 MachineMemOperand *MMO = MBB.getParent()->getMachineMemOperand(
6253 MachinePointerInfo::getGOT(*MBB.getParent()), Flags, 8, Align(8));
6255
6256 BuildMI(MBB, I, DL, TII.get(X86::MOV64rm), Reg)
6257 .addReg(X86::RIP)
6258 .addImm(1)
6259 .addReg(0)
6261 .addReg(0)
6262 .addMemOperand(MMO);
6263 MIB->setDebugLoc(DL);
6264 MIB->setDesc(TII.get(X86::MOV64rm));
6266}
6267
6269 MachineBasicBlock &MBB = *MIB->getParent();
6270 MachineFunction &MF = *MBB.getParent();
6271 const X86Subtarget &Subtarget = MF.getSubtarget<X86Subtarget>();
6272 const X86RegisterInfo *TRI = Subtarget.getRegisterInfo();
6273 unsigned XorOp =
6274 MIB->getOpcode() == X86::XOR64_FP ? X86::XOR64rr : X86::XOR32rr;
6275 MIB->setDesc(TII.get(XorOp));
6276 MIB.addReg(TRI->getFrameRegister(MF), RegState::Undef);
6277 return true;
6278}
6279
6280// This is used to handle spills for 128/256-bit registers when we have AVX512,
6281// but not VLX. If it uses an extended register we need to use an instruction
6282// that loads the lower 128/256-bit, but is available with only AVX512F.
6284 const TargetRegisterInfo *TRI,
6285 const MCInstrDesc &LoadDesc,
6286 const MCInstrDesc &BroadcastDesc, unsigned SubIdx) {
6287 Register DestReg = MIB.getReg(0);
6288 // Check if DestReg is XMM16-31 or YMM16-31.
6289 if (TRI->getEncodingValue(DestReg) < 16) {
6290 // We can use a normal VEX encoded load.
6291 MIB->setDesc(LoadDesc);
6292 } else {
6293 // Use a 128/256-bit VBROADCAST instruction.
6294 MIB->setDesc(BroadcastDesc);
6295 // Change the destination to a 512-bit register.
6296 DestReg = TRI->getMatchingSuperReg(DestReg, SubIdx, &X86::VR512RegClass);
6297 MIB->getOperand(0).setReg(DestReg);
6298 }
6299 return true;
6300}
6301
6302// This is used to handle spills for 128/256-bit registers when we have AVX512,
6303// but not VLX. If it uses an extended register we need to use an instruction
6304// that stores the lower 128/256-bit, but is available with only AVX512F.
6306 const TargetRegisterInfo *TRI,
6307 const MCInstrDesc &StoreDesc,
6308 const MCInstrDesc &ExtractDesc, unsigned SubIdx) {
6309 Register SrcReg = MIB.getReg(X86::AddrNumOperands);
6310 // Check if DestReg is XMM16-31 or YMM16-31.
6311 if (TRI->getEncodingValue(SrcReg) < 16) {
6312 // We can use a normal VEX encoded store.
6313 MIB->setDesc(StoreDesc);
6314 } else {
6315 // Use a VEXTRACTF instruction.
6316 MIB->setDesc(ExtractDesc);
6317 // Change the destination to a 512-bit register.
6318 SrcReg = TRI->getMatchingSuperReg(SrcReg, SubIdx, &X86::VR512RegClass);
6320 MIB.addImm(0x0); // Append immediate to extract from the lower bits.
6321 }
6322
6323 return true;
6324}
6325
6327 MIB->setDesc(Desc);
6328 int64_t ShiftAmt = MIB->getOperand(2).getImm();
6329 // Temporarily remove the immediate so we can add another source register.
6330 MIB->removeOperand(2);
6331 // Add the register. Don't copy the kill flag if there is one.
6332 MIB.addReg(MIB.getReg(1), getUndefRegState(MIB->getOperand(1).isUndef()));
6333 // Add back the immediate.
6334 MIB.addImm(ShiftAmt);
6335 return true;
6336}
6337
6339 const TargetInstrInfo &TII, bool HasAVX) {
6340 unsigned NewOpc;
6341 if (MI.getOpcode() == X86::MOVSHPrm) {
6342 NewOpc = HasAVX ? X86::VMOVSSrm : X86::MOVSSrm;
6343 Register Reg = MI.getOperand(0).getReg();
6344 if (Reg > X86::XMM15)
6345 NewOpc = X86::VMOVSSZrm;
6346 } else {
6347 NewOpc = HasAVX ? X86::VMOVSSmr : X86::MOVSSmr;
6348 Register Reg = MI.getOperand(5).getReg();
6349 if (Reg > X86::XMM15)
6350 NewOpc = X86::VMOVSSZmr;
6351 }
6352
6353 MIB->setDesc(TII.get(NewOpc));
6354 return true;
6355}
6356
6358 bool HasAVX = Subtarget.hasAVX();
6359 MachineInstrBuilder MIB(*MI.getParent()->getParent(), MI);
6360 switch (MI.getOpcode()) {
6361 case X86::MOV32r0:
6362 return Expand2AddrUndef(MIB, get(X86::XOR32rr));
6363 case X86::MOV32r1:
6364 return expandMOV32r1(MIB, *this, /*MinusOne=*/false);
6365 case X86::MOV32r_1:
6366 return expandMOV32r1(MIB, *this, /*MinusOne=*/true);
6367 case X86::MOV32ImmSExti8:
6368 case X86::MOV64ImmSExti8:
6369 return ExpandMOVImmSExti8(MIB, *this, Subtarget);
6370 case X86::SETB_C32r:
6371 return Expand2AddrUndef(MIB, get(X86::SBB32rr));
6372 case X86::SETB_C64r:
6373 return Expand2AddrUndef(MIB, get(X86::SBB64rr));
6374 case X86::MMX_SET0:
6375 return Expand2AddrUndef(MIB, get(X86::MMX_PXORrr));
6376 case X86::V_SET0:
6377 case X86::FsFLD0SS:
6378 case X86::FsFLD0SD:
6379 case X86::FsFLD0SH:
6380 case X86::FsFLD0F128:
6381 return Expand2AddrUndef(MIB, get(HasAVX ? X86::VXORPSrr : X86::XORPSrr));
6382 case X86::AVX512_128_SET0:
6383 case X86::AVX512_FsFLD0SH:
6384 case X86::AVX512_FsFLD0SS:
6385 case X86::AVX512_FsFLD0SD:
6386 case X86::AVX512_FsFLD0F128: {
6387 bool HasVLX = Subtarget.hasVLX();
6388 Register SrcReg = MIB.getReg(0);
6390 if (HasVLX || TRI->getEncodingValue(SrcReg) < 16)
6391 return Expand2AddrUndef(MIB,
6392 get(HasVLX ? X86::VPXORDZ128rr : X86::VXORPSrr));
6393 // Extended register without VLX. Use a larger XOR.
6394 SrcReg =
6395 TRI->getMatchingSuperReg(SrcReg, X86::sub_xmm, &X86::VR512RegClass);
6396 MIB->getOperand(0).setReg(SrcReg);
6397 return Expand2AddrUndef(MIB, get(X86::VPXORDZrr));
6398 }
6399 case X86::MOVSHPmr:
6400 case X86::MOVSHPrm:
6401 return expandMOVSHP(MIB, MI, *this, Subtarget.hasAVX());
6402 case X86::V_SETALLONES:
6403 return Expand2AddrUndef(MIB,
6404 get(HasAVX ? X86::VPCMPEQDrr : X86::PCMPEQDrr));
6405 case X86::AVX2_SETALLONES:
6406 return Expand2AddrUndef(MIB, get(X86::VPCMPEQDYrr));
6407 case X86::AVX1_SETALLONES: {
6408 Register Reg = MIB.getReg(0);
6409 // VCMPPSYrri with an immediate 0xf should produce VCMPTRUEPS.
6410 MIB->setDesc(get(X86::VCMPPSYrri));
6411 MIB.addReg(Reg, RegState::Undef).addReg(Reg, RegState::Undef).addImm(0xf);
6412 return true;
6413 }
6414 case X86::AVX512_128_SETALLONES:
6415 case X86::AVX512_256_SETALLONES:
6416 case X86::AVX512_512_SETALLONES: {
6417 Register Reg = MIB.getReg(0);
6418 unsigned Opc;
6419 switch (MI.getOpcode()) {
6420 case X86::AVX512_128_SETALLONES: {
6421 if (X86::VR128RegClass.contains(Reg))
6422 return Expand2AddrUndef(MIB, get(X86::VPCMPEQDrr));
6423
6424 Opc = X86::VPTERNLOGDZ128rri;
6425 break;
6426 }
6427 case X86::AVX512_256_SETALLONES: {
6428 if (X86::VR256RegClass.contains(Reg))
6429 return Expand2AddrUndef(MIB, get(X86::VPCMPEQDYrr));
6430
6431 Opc = X86::VPTERNLOGDZ256rri;
6432 break;
6433 }
6434 case X86::AVX512_512_SETALLONES:
6435 Opc = X86::VPTERNLOGDZrri;
6436 break;
6437 }
6438 MIB->setDesc(get(Opc));
6439 // VPTERNLOGD needs 3 register inputs and an immediate.
6440 // 0xff will return 1s for any input.
6441 MIB.addReg(Reg, RegState::Undef)
6442 .addReg(Reg, RegState::Undef)
6443 .addReg(Reg, RegState::Undef)
6444 .addImm(0xff);
6445 return true;
6446 }
6447 case X86::AVX512_512_SEXT_MASK_32:
6448 case X86::AVX512_512_SEXT_MASK_64: {
6449 Register Reg = MIB.getReg(0);
6450 Register MaskReg = MIB.getReg(1);
6451 RegState MaskState = getRegState(MIB->getOperand(1));
6452 unsigned Opc = (MI.getOpcode() == X86::AVX512_512_SEXT_MASK_64)
6453 ? X86::VPTERNLOGQZrrikz
6454 : X86::VPTERNLOGDZrrikz;
6455 MI.removeOperand(1);
6456 MIB->setDesc(get(Opc));
6457 // VPTERNLOG needs 3 register inputs and an immediate.
6458 // 0xff will return 1s for any input.
6459 MIB.addReg(Reg, RegState::Undef)
6460 .addReg(MaskReg, MaskState)
6461 .addReg(Reg, RegState::Undef)
6462 .addReg(Reg, RegState::Undef)
6463 .addImm(0xff);
6464 return true;
6465 }
6466 case X86::VMOVAPSZ128rm_NOVLX:
6467 return expandNOVLXLoad(MIB, &getRegisterInfo(), get(X86::VMOVAPSrm),
6468 get(X86::VBROADCASTF32X4Zrm), X86::sub_xmm);
6469 case X86::VMOVUPSZ128rm_NOVLX:
6470 return expandNOVLXLoad(MIB, &getRegisterInfo(), get(X86::VMOVUPSrm),
6471 get(X86::VBROADCASTF32X4Zrm), X86::sub_xmm);
6472 case X86::VMOVAPSZ256rm_NOVLX:
6473 return expandNOVLXLoad(MIB, &getRegisterInfo(), get(X86::VMOVAPSYrm),
6474 get(X86::VBROADCASTF64X4Zrm), X86::sub_ymm);
6475 case X86::VMOVUPSZ256rm_NOVLX:
6476 return expandNOVLXLoad(MIB, &getRegisterInfo(), get(X86::VMOVUPSYrm),
6477 get(X86::VBROADCASTF64X4Zrm), X86::sub_ymm);
6478 case X86::VMOVAPSZ128mr_NOVLX:
6479 return expandNOVLXStore(MIB, &getRegisterInfo(), get(X86::VMOVAPSmr),
6480 get(X86::VEXTRACTF32X4Zmri), X86::sub_xmm);
6481 case X86::VMOVUPSZ128mr_NOVLX:
6482 return expandNOVLXStore(MIB, &getRegisterInfo(), get(X86::VMOVUPSmr),
6483 get(X86::VEXTRACTF32X4Zmri), X86::sub_xmm);
6484 case X86::VMOVAPSZ256mr_NOVLX:
6485 return expandNOVLXStore(MIB, &getRegisterInfo(), get(X86::VMOVAPSYmr),
6486 get(X86::VEXTRACTF64X4Zmri), X86::sub_ymm);
6487 case X86::VMOVUPSZ256mr_NOVLX:
6488 return expandNOVLXStore(MIB, &getRegisterInfo(), get(X86::VMOVUPSYmr),
6489 get(X86::VEXTRACTF64X4Zmri), X86::sub_ymm);
6490 case X86::MOV32ri64: {
6491 Register Reg = MIB.getReg(0);
6492 Register Reg32 = RI.getSubReg(Reg, X86::sub_32bit);
6493 MI.setDesc(get(X86::MOV32ri));
6494 MIB->getOperand(0).setReg(Reg32);
6496 return true;
6497 }
6498
6499 case X86::RDFLAGS32:
6500 case X86::RDFLAGS64: {
6501 unsigned Is64Bit = MI.getOpcode() == X86::RDFLAGS64;
6502 MachineBasicBlock &MBB = *MIB->getParent();
6503
6504 MachineInstr *NewMI = BuildMI(MBB, MI, MIB->getDebugLoc(),
6505 get(Is64Bit ? X86::PUSHF64 : X86::PUSHF32))
6506 .getInstr();
6507
6508 // Permit reads of the EFLAGS and DF registers without them being defined.
6509 // This intrinsic exists to read external processor state in flags, such as
6510 // the trap flag, interrupt flag, and direction flag, none of which are
6511 // modeled by the backend.
6512 assert(NewMI->getOperand(2).getReg() == X86::EFLAGS &&
6513 "Unexpected register in operand! Should be EFLAGS.");
6514 NewMI->getOperand(2).setIsUndef();
6515 assert(NewMI->getOperand(3).getReg() == X86::DF &&
6516 "Unexpected register in operand! Should be DF.");
6517 NewMI->getOperand(3).setIsUndef();
6518
6519 MIB->setDesc(get(Is64Bit ? X86::POP64r : X86::POP32r));
6520 return true;
6521 }
6522
6523 case X86::WRFLAGS32:
6524 case X86::WRFLAGS64: {
6525 unsigned Is64Bit = MI.getOpcode() == X86::WRFLAGS64;
6526 MachineBasicBlock &MBB = *MIB->getParent();
6527
6528 BuildMI(MBB, MI, MIB->getDebugLoc(),
6529 get(Is64Bit ? X86::PUSH64r : X86::PUSH32r))
6530 .addReg(MI.getOperand(0).getReg());
6531 BuildMI(MBB, MI, MIB->getDebugLoc(),
6532 get(Is64Bit ? X86::POPF64 : X86::POPF32));
6533 MI.eraseFromParent();
6534 return true;
6535 }
6536
6537 // KNL does not recognize dependency-breaking idioms for mask registers,
6538 // so kxnor %k1, %k1, %k2 has a RAW dependence on %k1.
6539 // Using %k0 as the undef input register is a performance heuristic based
6540 // on the assumption that %k0 is used less frequently than the other mask
6541 // registers, since it is not usable as a write mask.
6542 // FIXME: A more advanced approach would be to choose the best input mask
6543 // register based on context.
6544 case X86::KSET0B:
6545 return Expand2AddrKreg(MIB, get(X86::KXORBkk), X86::K0);
6546 case X86::KSET0W:
6547 return Expand2AddrKreg(MIB, get(X86::KXORWkk), X86::K0);
6548 case X86::KSET0D:
6549 return Expand2AddrKreg(MIB, get(X86::KXORDkk), X86::K0);
6550 case X86::KSET0Q:
6551 return Expand2AddrKreg(MIB, get(X86::KXORQkk), X86::K0);
6552 case X86::KSET1B:
6553 return Expand2AddrKreg(MIB, get(X86::KXNORBkk), X86::K0);
6554 case X86::KSET1W:
6555 return Expand2AddrKreg(MIB, get(X86::KXNORWkk), X86::K0);
6556 case X86::KSET1D:
6557 return Expand2AddrKreg(MIB, get(X86::KXNORDkk), X86::K0);
6558 case X86::KSET1Q:
6559 return Expand2AddrKreg(MIB, get(X86::KXNORQkk), X86::K0);
6560 case TargetOpcode::LOAD_STACK_GUARD:
6561 expandLoadStackGuard(MIB, *this);
6562 return true;
6563 case X86::XOR64_FP:
6564 case X86::XOR32_FP:
6565 return expandXorFP(MIB, *this);
6566 case X86::SHLDROT32ri:
6567 return expandSHXDROT(MIB, get(X86::SHLD32rri8));
6568 case X86::SHLDROT64ri:
6569 return expandSHXDROT(MIB, get(X86::SHLD64rri8));
6570 case X86::SHRDROT32ri:
6571 return expandSHXDROT(MIB, get(X86::SHRD32rri8));
6572 case X86::SHRDROT64ri:
6573 return expandSHXDROT(MIB, get(X86::SHRD64rri8));
6574 case X86::ADD8rr_DB:
6575 MIB->setDesc(get(X86::OR8rr));
6576 break;
6577 case X86::ADD16rr_DB:
6578 MIB->setDesc(get(X86::OR16rr));
6579 break;
6580 case X86::ADD32rr_DB:
6581 MIB->setDesc(get(X86::OR32rr));
6582 break;
6583 case X86::ADD64rr_DB:
6584 MIB->setDesc(get(X86::OR64rr));
6585 break;
6586 case X86::ADD8ri_DB:
6587 MIB->setDesc(get(X86::OR8ri));
6588 break;
6589 case X86::ADD16ri_DB:
6590 MIB->setDesc(get(X86::OR16ri));
6591 break;
6592 case X86::ADD32ri_DB:
6593 MIB->setDesc(get(X86::OR32ri));
6594 break;
6595 case X86::ADD64ri32_DB:
6596 MIB->setDesc(get(X86::OR64ri32));
6597 break;
6598 }
6599 return false;
6600}
6601
6602/// Return true for all instructions that only update
6603/// the first 32 or 64-bits of the destination register and leave the rest
6604/// unmodified. This can be used to avoid folding loads if the instructions
6605/// only update part of the destination register, and the non-updated part is
6606/// not needed. e.g. cvtss2sd, sqrtss. Unfolding the load from these
6607/// instructions breaks the partial register dependency and it can improve
6608/// performance. e.g.:
6609///
6610/// movss (%rdi), %xmm0
6611/// cvtss2sd %xmm0, %xmm0
6612///
6613/// Instead of
6614/// cvtss2sd (%rdi), %xmm0
6615///
6616/// FIXME: This should be turned into a TSFlags.
6617///
6618static bool hasPartialRegUpdate(unsigned Opcode, const X86Subtarget &Subtarget,
6619 bool ForLoadFold = false) {
6620 switch (Opcode) {
6621 case X86::CVTSI2SSrr:
6622 case X86::CVTSI2SSrm:
6623 case X86::CVTSI642SSrr:
6624 case X86::CVTSI642SSrm:
6625 case X86::CVTSI2SDrr:
6626 case X86::CVTSI2SDrm:
6627 case X86::CVTSI642SDrr:
6628 case X86::CVTSI642SDrm:
6629 // Load folding won't effect the undef register update since the input is
6630 // a GPR.
6631 return !ForLoadFold;
6632 case X86::CVTSD2SSrr:
6633 case X86::CVTSD2SSrm:
6634 case X86::CVTSS2SDrr:
6635 case X86::CVTSS2SDrm:
6636 case X86::MOVHPDrm:
6637 case X86::MOVHPSrm:
6638 case X86::MOVLPDrm:
6639 case X86::MOVLPSrm:
6640 case X86::RCPSSr:
6641 case X86::RCPSSm:
6642 case X86::RCPSSr_Int:
6643 case X86::RCPSSm_Int:
6644 case X86::ROUNDSDri:
6645 case X86::ROUNDSDmi:
6646 case X86::ROUNDSSri:
6647 case X86::ROUNDSSmi:
6648 case X86::RSQRTSSr:
6649 case X86::RSQRTSSm:
6650 case X86::RSQRTSSr_Int:
6651 case X86::RSQRTSSm_Int:
6652 case X86::SQRTSSr:
6653 case X86::SQRTSSm:
6654 case X86::SQRTSSr_Int:
6655 case X86::SQRTSSm_Int:
6656 case X86::SQRTSDr:
6657 case X86::SQRTSDm:
6658 case X86::SQRTSDr_Int:
6659 case X86::SQRTSDm_Int:
6660 return true;
6661 case X86::VFCMULCPHZ128rm:
6662 case X86::VFCMULCPHZ128rmb:
6663 case X86::VFCMULCPHZ128rmbkz:
6664 case X86::VFCMULCPHZ128rmkz:
6665 case X86::VFCMULCPHZ128rr:
6666 case X86::VFCMULCPHZ128rrkz:
6667 case X86::VFCMULCPHZ256rm:
6668 case X86::VFCMULCPHZ256rmb:
6669 case X86::VFCMULCPHZ256rmbkz:
6670 case X86::VFCMULCPHZ256rmkz:
6671 case X86::VFCMULCPHZ256rr:
6672 case X86::VFCMULCPHZ256rrkz:
6673 case X86::VFCMULCPHZrm:
6674 case X86::VFCMULCPHZrmb:
6675 case X86::VFCMULCPHZrmbkz:
6676 case X86::VFCMULCPHZrmkz:
6677 case X86::VFCMULCPHZrr:
6678 case X86::VFCMULCPHZrrb:
6679 case X86::VFCMULCPHZrrbkz:
6680 case X86::VFCMULCPHZrrkz:
6681 case X86::VFMULCPHZ128rm:
6682 case X86::VFMULCPHZ128rmb:
6683 case X86::VFMULCPHZ128rmbkz:
6684 case X86::VFMULCPHZ128rmkz:
6685 case X86::VFMULCPHZ128rr:
6686 case X86::VFMULCPHZ128rrkz:
6687 case X86::VFMULCPHZ256rm:
6688 case X86::VFMULCPHZ256rmb:
6689 case X86::VFMULCPHZ256rmbkz:
6690 case X86::VFMULCPHZ256rmkz:
6691 case X86::VFMULCPHZ256rr:
6692 case X86::VFMULCPHZ256rrkz:
6693 case X86::VFMULCPHZrm:
6694 case X86::VFMULCPHZrmb:
6695 case X86::VFMULCPHZrmbkz:
6696 case X86::VFMULCPHZrmkz:
6697 case X86::VFMULCPHZrr:
6698 case X86::VFMULCPHZrrb:
6699 case X86::VFMULCPHZrrbkz:
6700 case X86::VFMULCPHZrrkz:
6701 case X86::VFCMULCSHZrm:
6702 case X86::VFCMULCSHZrmkz:
6703 case X86::VFCMULCSHZrr:
6704 case X86::VFCMULCSHZrrb:
6705 case X86::VFCMULCSHZrrbkz:
6706 case X86::VFCMULCSHZrrkz:
6707 case X86::VFMULCSHZrm:
6708 case X86::VFMULCSHZrmkz:
6709 case X86::VFMULCSHZrr:
6710 case X86::VFMULCSHZrrb:
6711 case X86::VFMULCSHZrrbkz:
6712 case X86::VFMULCSHZrrkz:
6713 return Subtarget.hasMULCFalseDeps();
6714 case X86::VPERMDYrm:
6715 case X86::VPERMDYrr:
6716 case X86::VPERMQYmi:
6717 case X86::VPERMQYri:
6718 case X86::VPERMPSYrm:
6719 case X86::VPERMPSYrr:
6720 case X86::VPERMPDYmi:
6721 case X86::VPERMPDYri:
6722 case X86::VPERMDZ256rm:
6723 case X86::VPERMDZ256rmb:
6724 case X86::VPERMDZ256rmbkz:
6725 case X86::VPERMDZ256rmkz:
6726 case X86::VPERMDZ256rr:
6727 case X86::VPERMDZ256rrkz:
6728 case X86::VPERMDZrm:
6729 case X86::VPERMDZrmb:
6730 case X86::VPERMDZrmbkz:
6731 case X86::VPERMDZrmkz:
6732 case X86::VPERMDZrr:
6733 case X86::VPERMDZrrkz:
6734 case X86::VPERMQZ256mbi:
6735 case X86::VPERMQZ256mbikz:
6736 case X86::VPERMQZ256mi:
6737 case X86::VPERMQZ256mikz:
6738 case X86::VPERMQZ256ri:
6739 case X86::VPERMQZ256rikz:
6740 case X86::VPERMQZ256rm:
6741 case X86::VPERMQZ256rmb:
6742 case X86::VPERMQZ256rmbkz:
6743 case X86::VPERMQZ256rmkz:
6744 case X86::VPERMQZ256rr:
6745 case X86::VPERMQZ256rrkz:
6746 case X86::VPERMQZmbi:
6747 case X86::VPERMQZmbikz:
6748 case X86::VPERMQZmi:
6749 case X86::VPERMQZmikz:
6750 case X86::VPERMQZri:
6751 case X86::VPERMQZrikz:
6752 case X86::VPERMQZrm:
6753 case X86::VPERMQZrmb:
6754 case X86::VPERMQZrmbkz:
6755 case X86::VPERMQZrmkz:
6756 case X86::VPERMQZrr:
6757 case X86::VPERMQZrrkz:
6758 case X86::VPERMPSZ256rm:
6759 case X86::VPERMPSZ256rmb:
6760 case X86::VPERMPSZ256rmbkz:
6761 case X86::VPERMPSZ256rmkz:
6762 case X86::VPERMPSZ256rr:
6763 case X86::VPERMPSZ256rrkz:
6764 case X86::VPERMPSZrm:
6765 case X86::VPERMPSZrmb:
6766 case X86::VPERMPSZrmbkz:
6767 case X86::VPERMPSZrmkz:
6768 case X86::VPERMPSZrr:
6769 case X86::VPERMPSZrrkz:
6770 case X86::VPERMPDZ256mbi:
6771 case X86::VPERMPDZ256mbikz:
6772 case X86::VPERMPDZ256mi:
6773 case X86::VPERMPDZ256mikz:
6774 case X86::VPERMPDZ256ri:
6775 case X86::VPERMPDZ256rikz:
6776 case X86::VPERMPDZ256rm:
6777 case X86::VPERMPDZ256rmb:
6778 case X86::VPERMPDZ256rmbkz:
6779 case X86::VPERMPDZ256rmkz:
6780 case X86::VPERMPDZ256rr:
6781 case X86::VPERMPDZ256rrkz:
6782 case X86::VPERMPDZmbi:
6783 case X86::VPERMPDZmbikz:
6784 case X86::VPERMPDZmi:
6785 case X86::VPERMPDZmikz:
6786 case X86::VPERMPDZri:
6787 case X86::VPERMPDZrikz:
6788 case X86::VPERMPDZrm:
6789 case X86::VPERMPDZrmb:
6790 case X86::VPERMPDZrmbkz:
6791 case X86::VPERMPDZrmkz:
6792 case X86::VPERMPDZrr:
6793 case X86::VPERMPDZrrkz:
6794 return Subtarget.hasPERMFalseDeps();
6795 case X86::VRANGEPDZ128rmbi:
6796 case X86::VRANGEPDZ128rmbikz:
6797 case X86::VRANGEPDZ128rmi:
6798 case X86::VRANGEPDZ128rmikz:
6799 case X86::VRANGEPDZ128rri:
6800 case X86::VRANGEPDZ128rrikz:
6801 case X86::VRANGEPDZ256rmbi:
6802 case X86::VRANGEPDZ256rmbikz:
6803 case X86::VRANGEPDZ256rmi:
6804 case X86::VRANGEPDZ256rmikz:
6805 case X86::VRANGEPDZ256rri:
6806 case X86::VRANGEPDZ256rrikz:
6807 case X86::VRANGEPDZrmbi:
6808 case X86::VRANGEPDZrmbikz:
6809 case X86::VRANGEPDZrmi:
6810 case X86::VRANGEPDZrmikz:
6811 case X86::VRANGEPDZrri:
6812 case X86::VRANGEPDZrrib:
6813 case X86::VRANGEPDZrribkz:
6814 case X86::VRANGEPDZrrikz:
6815 case X86::VRANGEPSZ128rmbi:
6816 case X86::VRANGEPSZ128rmbikz:
6817 case X86::VRANGEPSZ128rmi:
6818 case X86::VRANGEPSZ128rmikz:
6819 case X86::VRANGEPSZ128rri:
6820 case X86::VRANGEPSZ128rrikz:
6821 case X86::VRANGEPSZ256rmbi:
6822 case X86::VRANGEPSZ256rmbikz:
6823 case X86::VRANGEPSZ256rmi:
6824 case X86::VRANGEPSZ256rmikz:
6825 case X86::VRANGEPSZ256rri:
6826 case X86::VRANGEPSZ256rrikz:
6827 case X86::VRANGEPSZrmbi:
6828 case X86::VRANGEPSZrmbikz:
6829 case X86::VRANGEPSZrmi:
6830 case X86::VRANGEPSZrmikz:
6831 case X86::VRANGEPSZrri:
6832 case X86::VRANGEPSZrrib:
6833 case X86::VRANGEPSZrribkz:
6834 case X86::VRANGEPSZrrikz:
6835 case X86::VRANGESDZrmi:
6836 case X86::VRANGESDZrmikz:
6837 case X86::VRANGESDZrri:
6838 case X86::VRANGESDZrrib:
6839 case X86::VRANGESDZrribkz:
6840 case X86::VRANGESDZrrikz:
6841 case X86::VRANGESSZrmi:
6842 case X86::VRANGESSZrmikz:
6843 case X86::VRANGESSZrri:
6844 case X86::VRANGESSZrrib:
6845 case X86::VRANGESSZrribkz:
6846 case X86::VRANGESSZrrikz:
6847 return Subtarget.hasRANGEFalseDeps();
6848 case X86::VGETMANTSSZrmi:
6849 case X86::VGETMANTSSZrmikz:
6850 case X86::VGETMANTSSZrri:
6851 case X86::VGETMANTSSZrrib:
6852 case X86::VGETMANTSSZrribkz:
6853 case X86::VGETMANTSSZrrikz:
6854 case X86::VGETMANTSDZrmi:
6855 case X86::VGETMANTSDZrmikz:
6856 case X86::VGETMANTSDZrri:
6857 case X86::VGETMANTSDZrrib:
6858 case X86::VGETMANTSDZrribkz:
6859 case X86::VGETMANTSDZrrikz:
6860 case X86::VGETMANTSHZrmi:
6861 case X86::VGETMANTSHZrmikz:
6862 case X86::VGETMANTSHZrri:
6863 case X86::VGETMANTSHZrrib:
6864 case X86::VGETMANTSHZrribkz:
6865 case X86::VGETMANTSHZrrikz:
6866 case X86::VGETMANTPSZ128rmbi:
6867 case X86::VGETMANTPSZ128rmbikz:
6868 case X86::VGETMANTPSZ128rmi:
6869 case X86::VGETMANTPSZ128rmikz:
6870 case X86::VGETMANTPSZ256rmbi:
6871 case X86::VGETMANTPSZ256rmbikz:
6872 case X86::VGETMANTPSZ256rmi:
6873 case X86::VGETMANTPSZ256rmikz:
6874 case X86::VGETMANTPSZrmbi:
6875 case X86::VGETMANTPSZrmbikz:
6876 case X86::VGETMANTPSZrmi:
6877 case X86::VGETMANTPSZrmikz:
6878 case X86::VGETMANTPDZ128rmbi:
6879 case X86::VGETMANTPDZ128rmbikz:
6880 case X86::VGETMANTPDZ128rmi:
6881 case X86::VGETMANTPDZ128rmikz:
6882 case X86::VGETMANTPDZ256rmbi:
6883 case X86::VGETMANTPDZ256rmbikz:
6884 case X86::VGETMANTPDZ256rmi:
6885 case X86::VGETMANTPDZ256rmikz:
6886 case X86::VGETMANTPDZrmbi:
6887 case X86::VGETMANTPDZrmbikz:
6888 case X86::VGETMANTPDZrmi:
6889 case X86::VGETMANTPDZrmikz:
6890 return Subtarget.hasGETMANTFalseDeps();
6891 case X86::VPMULLQZ128rm:
6892 case X86::VPMULLQZ128rmb:
6893 case X86::VPMULLQZ128rmbkz:
6894 case X86::VPMULLQZ128rmkz:
6895 case X86::VPMULLQZ128rr:
6896 case X86::VPMULLQZ128rrkz:
6897 case X86::VPMULLQZ256rm:
6898 case X86::VPMULLQZ256rmb:
6899 case X86::VPMULLQZ256rmbkz:
6900 case X86::VPMULLQZ256rmkz:
6901 case X86::VPMULLQZ256rr:
6902 case X86::VPMULLQZ256rrkz:
6903 case X86::VPMULLQZrm:
6904 case X86::VPMULLQZrmb:
6905 case X86::VPMULLQZrmbkz:
6906 case X86::VPMULLQZrmkz:
6907 case X86::VPMULLQZrr:
6908 case X86::VPMULLQZrrkz:
6909 return Subtarget.hasMULLQFalseDeps();
6910 case X86::VPCOMPRESSBZ128rrkz:
6911 case X86::VPCOMPRESSBZ256rrkz:
6912 case X86::VPCOMPRESSBZrrkz:
6913 case X86::VPCOMPRESSWZ128rrkz:
6914 case X86::VPCOMPRESSWZ256rrkz:
6915 case X86::VPCOMPRESSWZrrkz:
6916 case X86::VPCOMPRESSDZ128rrkz:
6917 case X86::VPCOMPRESSDZ256rrkz:
6918 case X86::VPCOMPRESSDZrrkz:
6919 case X86::VPCOMPRESSQZ128rrkz:
6920 case X86::VPCOMPRESSQZ256rrkz:
6921 case X86::VPCOMPRESSQZrrkz:
6922 case X86::VCOMPRESSPSZ128rrkz:
6923 case X86::VCOMPRESSPSZ256rrkz:
6924 case X86::VCOMPRESSPSZrrkz:
6925 case X86::VCOMPRESSPDZ128rrkz:
6926 case X86::VCOMPRESSPDZ256rrkz:
6927 case X86::VCOMPRESSPDZrrkz:
6928 return Subtarget.hasCOMPRESSFalseDeps();
6929 case X86::VPEXPANDBZ128rmkz:
6930 case X86::VPEXPANDBZ128rrkz:
6931 case X86::VPEXPANDBZ256rmkz:
6932 case X86::VPEXPANDBZ256rrkz:
6933 case X86::VPEXPANDBZrmkz:
6934 case X86::VPEXPANDBZrrkz:
6935 case X86::VPEXPANDWZ128rmkz:
6936 case X86::VPEXPANDWZ128rrkz:
6937 case X86::VPEXPANDWZ256rmkz:
6938 case X86::VPEXPANDWZ256rrkz:
6939 case X86::VPEXPANDWZrmkz:
6940 case X86::VPEXPANDWZrrkz:
6941 case X86::VPEXPANDDZ128rmkz:
6942 case X86::VPEXPANDDZ128rrkz:
6943 case X86::VPEXPANDDZ256rmkz:
6944 case X86::VPEXPANDDZ256rrkz:
6945 case X86::VPEXPANDDZrmkz:
6946 case X86::VPEXPANDDZrrkz:
6947 case X86::VPEXPANDQZ128rmkz:
6948 case X86::VPEXPANDQZ128rrkz:
6949 case X86::VPEXPANDQZ256rmkz:
6950 case X86::VPEXPANDQZ256rrkz:
6951 case X86::VPEXPANDQZrmkz:
6952 case X86::VPEXPANDQZrrkz:
6953 case X86::VEXPANDPSZ128rmkz:
6954 case X86::VEXPANDPSZ128rrkz:
6955 case X86::VEXPANDPSZ256rmkz:
6956 case X86::VEXPANDPSZ256rrkz:
6957 case X86::VEXPANDPSZrmkz:
6958 case X86::VEXPANDPSZrrkz:
6959 case X86::VEXPANDPDZ128rmkz:
6960 case X86::VEXPANDPDZ128rrkz:
6961 case X86::VEXPANDPDZ256rmkz:
6962 case X86::VEXPANDPDZ256rrkz:
6963 case X86::VEXPANDPDZrmkz:
6964 case X86::VEXPANDPDZrrkz:
6965 return Subtarget.hasEXPANDFalseDeps();
6966 // GPR
6967 case X86::POPCNT32rm:
6968 case X86::POPCNT32rr:
6969 case X86::POPCNT64rm:
6970 case X86::POPCNT64rr:
6971 return Subtarget.hasPOPCNTFalseDeps();
6972 case X86::LZCNT32rm:
6973 case X86::LZCNT32rr:
6974 case X86::LZCNT64rm:
6975 case X86::LZCNT64rr:
6976 return Subtarget.hasLZCNTFalseDeps();
6977 case X86::TZCNT32rm:
6978 case X86::TZCNT32rr:
6979 case X86::TZCNT64rm:
6980 case X86::TZCNT64rr:
6981 return Subtarget.hasTZCNTFalseDeps();
6982 case X86::BLSR32rr:
6983 case X86::BLSR32rm:
6984 case X86::BLSR64rr:
6985 case X86::BLSR64rm:
6986 case X86::BLSI32rr:
6987 case X86::BLSI32rm:
6988 case X86::BLSI64rr:
6989 case X86::BLSI64rm:
6990 case X86::BLSMSK32rr:
6991 case X86::BLSMSK32rm:
6992 case X86::BLSMSK64rr:
6993 case X86::BLSMSK64rm:
6994 return Subtarget.hasBLSFalseDeps() && !ForLoadFold; // Preserve load folding
6995 }
6996
6997 return false;
6998}
6999
7000/// Inform the BreakFalseDeps pass how many idle
7001/// instructions we would like before a partial register update.
7003 const MachineInstr &MI, unsigned OpNum,
7004 const TargetRegisterInfo *TRI) const {
7005
7006 if (OpNum != 0)
7007 return 0;
7008
7009 // NDD ops with 8/16b results may appear to be partial register
7010 // updates after register allocation.
7011 bool HasNDDPartialWrite = false;
7012 if (X86II::hasNewDataDest(MI.getDesc().TSFlags)) {
7013 Register Reg = MI.getOperand(0).getReg();
7014 if (!Reg.isVirtual())
7015 HasNDDPartialWrite =
7016 X86::GR8RegClass.contains(Reg) || X86::GR16RegClass.contains(Reg);
7017 }
7018
7019 if (!(HasNDDPartialWrite || hasPartialRegUpdate(MI.getOpcode(), Subtarget)))
7020 return 0;
7021
7022 // Check if the result register is also used as a source.
7023 // For non-NDD ops, this means a partial update is wanted, hence we return 0.
7024 // For NDD ops, this means it is possible to compress the instruction
7025 // to a legacy form in CompressEVEX, which would create an unwanted partial
7026 // update, so we return the clearance.
7027 const MachineOperand &MO = MI.getOperand(0);
7028 Register Reg = MO.getReg();
7029 bool ReadsReg = false;
7030 if (Reg.isVirtual())
7031 ReadsReg = (MO.readsReg() || MI.readsVirtualRegister(Reg));
7032 else
7033 ReadsReg = MI.readsRegister(Reg, TRI);
7034 if (ReadsReg != HasNDDPartialWrite)
7035 return 0;
7036
7037 // If any instructions in the clearance range are reading Reg, insert a
7038 // dependency breaking instruction, which is inexpensive and is likely to
7039 // be hidden in other instruction's cycles.
7041}
7042
7043// Return true for any instruction the copies the high bits of the first source
7044// operand into the unused high bits of the destination operand.
7045// Also returns true for instructions that have two inputs where one may
7046// be undef and we want it to use the same register as the other input.
7047static bool hasUndefRegUpdate(unsigned Opcode, unsigned OpNum,
7048 bool ForLoadFold = false) {
7049 // Set the OpNum parameter to the first source operand.
7050 switch (Opcode) {
7051 case X86::MMX_PUNPCKHBWrr:
7052 case X86::MMX_PUNPCKHWDrr:
7053 case X86::MMX_PUNPCKHDQrr:
7054 case X86::MMX_PUNPCKLBWrr:
7055 case X86::MMX_PUNPCKLWDrr:
7056 case X86::MMX_PUNPCKLDQrr:
7057 case X86::MOVHLPSrr:
7058 case X86::PACKSSWBrr:
7059 case X86::PACKUSWBrr:
7060 case X86::PACKSSDWrr:
7061 case X86::PACKUSDWrr:
7062 case X86::PUNPCKHBWrr:
7063 case X86::PUNPCKLBWrr:
7064 case X86::PUNPCKHWDrr:
7065 case X86::PUNPCKLWDrr:
7066 case X86::PUNPCKHDQrr:
7067 case X86::PUNPCKLDQrr:
7068 case X86::PUNPCKHQDQrr:
7069 case X86::PUNPCKLQDQrr:
7070 case X86::SHUFPDrri:
7071 case X86::SHUFPSrri:
7072 // These instructions are sometimes used with an undef first or second
7073 // source. Return true here so BreakFalseDeps will assign this source to the
7074 // same register as the first source to avoid a false dependency.
7075 // Operand 1 of these instructions is tied so they're separate from their
7076 // VEX counterparts.
7077 return OpNum == 2 && !ForLoadFold;
7078
7079 case X86::VMOVLHPSrr:
7080 case X86::VMOVLHPSZrr:
7081 case X86::VPACKSSWBrr:
7082 case X86::VPACKUSWBrr:
7083 case X86::VPACKSSDWrr:
7084 case X86::VPACKUSDWrr:
7085 case X86::VPACKSSWBZ128rr:
7086 case X86::VPACKUSWBZ128rr:
7087 case X86::VPACKSSDWZ128rr:
7088 case X86::VPACKUSDWZ128rr:
7089 case X86::VPERM2F128rri:
7090 case X86::VPERM2I128rri:
7091 case X86::VSHUFF32X4Z256rri:
7092 case X86::VSHUFF32X4Zrri:
7093 case X86::VSHUFF64X2Z256rri:
7094 case X86::VSHUFF64X2Zrri:
7095 case X86::VSHUFI32X4Z256rri:
7096 case X86::VSHUFI32X4Zrri:
7097 case X86::VSHUFI64X2Z256rri:
7098 case X86::VSHUFI64X2Zrri:
7099 case X86::VPUNPCKHBWrr:
7100 case X86::VPUNPCKLBWrr:
7101 case X86::VPUNPCKHBWYrr:
7102 case X86::VPUNPCKLBWYrr:
7103 case X86::VPUNPCKHBWZ128rr:
7104 case X86::VPUNPCKLBWZ128rr:
7105 case X86::VPUNPCKHBWZ256rr:
7106 case X86::VPUNPCKLBWZ256rr:
7107 case X86::VPUNPCKHBWZrr:
7108 case X86::VPUNPCKLBWZrr:
7109 case X86::VPUNPCKHWDrr:
7110 case X86::VPUNPCKLWDrr:
7111 case X86::VPUNPCKHWDYrr:
7112 case X86::VPUNPCKLWDYrr:
7113 case X86::VPUNPCKHWDZ128rr:
7114 case X86::VPUNPCKLWDZ128rr:
7115 case X86::VPUNPCKHWDZ256rr:
7116 case X86::VPUNPCKLWDZ256rr:
7117 case X86::VPUNPCKHWDZrr:
7118 case X86::VPUNPCKLWDZrr:
7119 case X86::VPUNPCKHDQrr:
7120 case X86::VPUNPCKLDQrr:
7121 case X86::VPUNPCKHDQYrr:
7122 case X86::VPUNPCKLDQYrr:
7123 case X86::VPUNPCKHDQZ128rr:
7124 case X86::VPUNPCKLDQZ128rr:
7125 case X86::VPUNPCKHDQZ256rr:
7126 case X86::VPUNPCKLDQZ256rr:
7127 case X86::VPUNPCKHDQZrr:
7128 case X86::VPUNPCKLDQZrr:
7129 case X86::VPUNPCKHQDQrr:
7130 case X86::VPUNPCKLQDQrr:
7131 case X86::VPUNPCKHQDQYrr:
7132 case X86::VPUNPCKLQDQYrr:
7133 case X86::VPUNPCKHQDQZ128rr:
7134 case X86::VPUNPCKLQDQZ128rr:
7135 case X86::VPUNPCKHQDQZ256rr:
7136 case X86::VPUNPCKLQDQZ256rr:
7137 case X86::VPUNPCKHQDQZrr:
7138 case X86::VPUNPCKLQDQZrr:
7139 // These instructions are sometimes used with an undef first or second
7140 // source. Return true here so BreakFalseDeps will assign this source to the
7141 // same register as the first source to avoid a false dependency.
7142 return (OpNum == 1 || OpNum == 2) && !ForLoadFold;
7143
7144 case X86::VCVTSI2SSrr:
7145 case X86::VCVTSI2SSrm:
7146 case X86::VCVTSI2SSrr_Int:
7147 case X86::VCVTSI2SSrm_Int:
7148 case X86::VCVTSI642SSrr:
7149 case X86::VCVTSI642SSrm:
7150 case X86::VCVTSI642SSrr_Int:
7151 case X86::VCVTSI642SSrm_Int:
7152 case X86::VCVTSI2SDrr:
7153 case X86::VCVTSI2SDrm:
7154 case X86::VCVTSI2SDrr_Int:
7155 case X86::VCVTSI2SDrm_Int:
7156 case X86::VCVTSI642SDrr:
7157 case X86::VCVTSI642SDrm:
7158 case X86::VCVTSI642SDrr_Int:
7159 case X86::VCVTSI642SDrm_Int:
7160 // AVX-512
7161 case X86::VCVTSI2SSZrr:
7162 case X86::VCVTSI2SSZrm:
7163 case X86::VCVTSI2SSZrr_Int:
7164 case X86::VCVTSI2SSZrrb_Int:
7165 case X86::VCVTSI2SSZrm_Int:
7166 case X86::VCVTSI642SSZrr:
7167 case X86::VCVTSI642SSZrm:
7168 case X86::VCVTSI642SSZrr_Int:
7169 case X86::VCVTSI642SSZrrb_Int:
7170 case X86::VCVTSI642SSZrm_Int:
7171 case X86::VCVTSI2SDZrr:
7172 case X86::VCVTSI2SDZrm:
7173 case X86::VCVTSI2SDZrr_Int:
7174 case X86::VCVTSI2SDZrm_Int:
7175 case X86::VCVTSI642SDZrr:
7176 case X86::VCVTSI642SDZrm:
7177 case X86::VCVTSI642SDZrr_Int:
7178 case X86::VCVTSI642SDZrrb_Int:
7179 case X86::VCVTSI642SDZrm_Int:
7180 case X86::VCVTUSI2SSZrr:
7181 case X86::VCVTUSI2SSZrm:
7182 case X86::VCVTUSI2SSZrr_Int:
7183 case X86::VCVTUSI2SSZrrb_Int:
7184 case X86::VCVTUSI2SSZrm_Int:
7185 case X86::VCVTUSI642SSZrr:
7186 case X86::VCVTUSI642SSZrm:
7187 case X86::VCVTUSI642SSZrr_Int:
7188 case X86::VCVTUSI642SSZrrb_Int:
7189 case X86::VCVTUSI642SSZrm_Int:
7190 case X86::VCVTUSI2SDZrr:
7191 case X86::VCVTUSI2SDZrm:
7192 case X86::VCVTUSI2SDZrr_Int:
7193 case X86::VCVTUSI2SDZrm_Int:
7194 case X86::VCVTUSI642SDZrr:
7195 case X86::VCVTUSI642SDZrm:
7196 case X86::VCVTUSI642SDZrr_Int:
7197 case X86::VCVTUSI642SDZrrb_Int:
7198 case X86::VCVTUSI642SDZrm_Int:
7199 case X86::VCVTSI2SHZrr:
7200 case X86::VCVTSI2SHZrm:
7201 case X86::VCVTSI2SHZrr_Int:
7202 case X86::VCVTSI2SHZrrb_Int:
7203 case X86::VCVTSI2SHZrm_Int:
7204 case X86::VCVTSI642SHZrr:
7205 case X86::VCVTSI642SHZrm:
7206 case X86::VCVTSI642SHZrr_Int:
7207 case X86::VCVTSI642SHZrrb_Int:
7208 case X86::VCVTSI642SHZrm_Int:
7209 case X86::VCVTUSI2SHZrr:
7210 case X86::VCVTUSI2SHZrm:
7211 case X86::VCVTUSI2SHZrr_Int:
7212 case X86::VCVTUSI2SHZrrb_Int:
7213 case X86::VCVTUSI2SHZrm_Int:
7214 case X86::VCVTUSI642SHZrr:
7215 case X86::VCVTUSI642SHZrm:
7216 case X86::VCVTUSI642SHZrr_Int:
7217 case X86::VCVTUSI642SHZrrb_Int:
7218 case X86::VCVTUSI642SHZrm_Int:
7219 // Load folding won't effect the undef register update since the input is
7220 // a GPR.
7221 return OpNum == 1 && !ForLoadFold;
7222 case X86::VCVTSD2SSrr:
7223 case X86::VCVTSD2SSrm:
7224 case X86::VCVTSD2SSrr_Int:
7225 case X86::VCVTSD2SSrm_Int:
7226 case X86::VCVTSS2SDrr:
7227 case X86::VCVTSS2SDrm:
7228 case X86::VCVTSS2SDrr_Int:
7229 case X86::VCVTSS2SDrm_Int:
7230 case X86::VRCPSSr:
7231 case X86::VRCPSSr_Int:
7232 case X86::VRCPSSm:
7233 case X86::VRCPSSm_Int:
7234 case X86::VROUNDSDri:
7235 case X86::VROUNDSDmi:
7236 case X86::VROUNDSDri_Int:
7237 case X86::VROUNDSDmi_Int:
7238 case X86::VROUNDSSri:
7239 case X86::VROUNDSSmi:
7240 case X86::VROUNDSSri_Int:
7241 case X86::VROUNDSSmi_Int:
7242 case X86::VRSQRTSSr:
7243 case X86::VRSQRTSSr_Int:
7244 case X86::VRSQRTSSm:
7245 case X86::VRSQRTSSm_Int:
7246 case X86::VSQRTSSr:
7247 case X86::VSQRTSSr_Int:
7248 case X86::VSQRTSSm:
7249 case X86::VSQRTSSm_Int:
7250 case X86::VSQRTSDr:
7251 case X86::VSQRTSDr_Int:
7252 case X86::VSQRTSDm:
7253 case X86::VSQRTSDm_Int:
7254 // AVX-512
7255 case X86::VCVTSD2SSZrr:
7256 case X86::VCVTSD2SSZrr_Int:
7257 case X86::VCVTSD2SSZrrb_Int:
7258 case X86::VCVTSD2SSZrm:
7259 case X86::VCVTSD2SSZrm_Int:
7260 case X86::VCVTSS2SDZrr:
7261 case X86::VCVTSS2SDZrr_Int:
7262 case X86::VCVTSS2SDZrrb_Int:
7263 case X86::VCVTSS2SDZrm:
7264 case X86::VCVTSS2SDZrm_Int:
7265 case X86::VGETEXPSDZr:
7266 case X86::VGETEXPSDZrb:
7267 case X86::VGETEXPSDZm:
7268 case X86::VGETEXPSSZr:
7269 case X86::VGETEXPSSZrb:
7270 case X86::VGETEXPSSZm:
7271 case X86::VGETMANTSDZrri:
7272 case X86::VGETMANTSDZrrib:
7273 case X86::VGETMANTSDZrmi:
7274 case X86::VGETMANTSSZrri:
7275 case X86::VGETMANTSSZrrib:
7276 case X86::VGETMANTSSZrmi:
7277 case X86::VRNDSCALESDZrri:
7278 case X86::VRNDSCALESDZrri_Int:
7279 case X86::VRNDSCALESDZrrib_Int:
7280 case X86::VRNDSCALESDZrmi:
7281 case X86::VRNDSCALESDZrmi_Int:
7282 case X86::VRNDSCALESSZrri:
7283 case X86::VRNDSCALESSZrri_Int:
7284 case X86::VRNDSCALESSZrrib_Int:
7285 case X86::VRNDSCALESSZrmi:
7286 case X86::VRNDSCALESSZrmi_Int:
7287 case X86::VRCP14SDZrr:
7288 case X86::VRCP14SDZrm:
7289 case X86::VRCP14SSZrr:
7290 case X86::VRCP14SSZrm:
7291 case X86::VRCPSHZrr:
7292 case X86::VRCPSHZrm:
7293 case X86::VRSQRTSHZrr:
7294 case X86::VRSQRTSHZrm:
7295 case X86::VREDUCESHZrmi:
7296 case X86::VREDUCESHZrri:
7297 case X86::VREDUCESHZrrib:
7298 case X86::VGETEXPSHZr:
7299 case X86::VGETEXPSHZrb:
7300 case X86::VGETEXPSHZm:
7301 case X86::VGETMANTSHZrri:
7302 case X86::VGETMANTSHZrrib:
7303 case X86::VGETMANTSHZrmi:
7304 case X86::VRNDSCALESHZrri:
7305 case X86::VRNDSCALESHZrri_Int:
7306 case X86::VRNDSCALESHZrrib_Int:
7307 case X86::VRNDSCALESHZrmi:
7308 case X86::VRNDSCALESHZrmi_Int:
7309 case X86::VSQRTSHZr:
7310 case X86::VSQRTSHZr_Int:
7311 case X86::VSQRTSHZrb_Int:
7312 case X86::VSQRTSHZm:
7313 case X86::VSQRTSHZm_Int:
7314 case X86::VRCP28SDZr:
7315 case X86::VRCP28SDZrb:
7316 case X86::VRCP28SDZm:
7317 case X86::VRCP28SSZr:
7318 case X86::VRCP28SSZrb:
7319 case X86::VRCP28SSZm:
7320 case X86::VREDUCESSZrmi:
7321 case X86::VREDUCESSZrri:
7322 case X86::VREDUCESSZrrib:
7323 case X86::VRSQRT14SDZrr:
7324 case X86::VRSQRT14SDZrm:
7325 case X86::VRSQRT14SSZrr:
7326 case X86::VRSQRT14SSZrm:
7327 case X86::VRSQRT28SDZr:
7328 case X86::VRSQRT28SDZrb:
7329 case X86::VRSQRT28SDZm:
7330 case X86::VRSQRT28SSZr:
7331 case X86::VRSQRT28SSZrb:
7332 case X86::VRSQRT28SSZm:
7333 case X86::VSQRTSSZr:
7334 case X86::VSQRTSSZr_Int:
7335 case X86::VSQRTSSZrb_Int:
7336 case X86::VSQRTSSZm:
7337 case X86::VSQRTSSZm_Int:
7338 case X86::VSQRTSDZr:
7339 case X86::VSQRTSDZr_Int:
7340 case X86::VSQRTSDZrb_Int:
7341 case X86::VSQRTSDZm:
7342 case X86::VSQRTSDZm_Int:
7343 case X86::VCVTSD2SHZrr:
7344 case X86::VCVTSD2SHZrr_Int:
7345 case X86::VCVTSD2SHZrrb_Int:
7346 case X86::VCVTSD2SHZrm:
7347 case X86::VCVTSD2SHZrm_Int:
7348 case X86::VCVTSS2SHZrr:
7349 case X86::VCVTSS2SHZrr_Int:
7350 case X86::VCVTSS2SHZrrb_Int:
7351 case X86::VCVTSS2SHZrm:
7352 case X86::VCVTSS2SHZrm_Int:
7353 case X86::VCVTSH2SDZrr:
7354 case X86::VCVTSH2SDZrr_Int:
7355 case X86::VCVTSH2SDZrrb_Int:
7356 case X86::VCVTSH2SDZrm:
7357 case X86::VCVTSH2SDZrm_Int:
7358 case X86::VCVTSH2SSZrr:
7359 case X86::VCVTSH2SSZrr_Int:
7360 case X86::VCVTSH2SSZrrb_Int:
7361 case X86::VCVTSH2SSZrm:
7362 case X86::VCVTSH2SSZrm_Int:
7363 return OpNum == 1;
7364 case X86::VMOVSSZrrk:
7365 case X86::VMOVSDZrrk:
7366 return OpNum == 3 && !ForLoadFold;
7367 case X86::VMOVSSZrrkz:
7368 case X86::VMOVSDZrrkz:
7369 return OpNum == 2 && !ForLoadFold;
7370 }
7371
7372 return false;
7373}
7374
7375/// Inform the BreakFalseDeps pass how many idle instructions we would like
7376/// before certain undef register reads.
7377///
7378/// This catches the VCVTSI2SD family of instructions:
7379///
7380/// vcvtsi2sdq %rax, undef %xmm0, %xmm14
7381///
7382/// We should to be careful *not* to catch VXOR idioms which are presumably
7383/// handled specially in the pipeline:
7384///
7385/// vxorps undef %xmm1, undef %xmm1, %xmm1
7386///
7387/// Like getPartialRegUpdateClearance, this makes a strong assumption that the
7388/// high bits that are passed-through are not live.
7389unsigned
7391 const TargetRegisterInfo *TRI) const {
7392 const MachineOperand &MO = MI.getOperand(OpNum);
7393 if (MO.getReg().isPhysical() && hasUndefRegUpdate(MI.getOpcode(), OpNum))
7394 return UndefRegClearance;
7395
7396 return 0;
7397}
7398
7400 MachineInstr &MI, unsigned OpNum, const TargetRegisterInfo *TRI) const {
7401 Register Reg = MI.getOperand(OpNum).getReg();
7402 // If MI kills this register, the false dependence is already broken.
7403 if (MI.killsRegister(Reg, TRI))
7404 return;
7405
7406 if (X86::VR128RegClass.contains(Reg)) {
7407 // These instructions are all floating point domain, so xorps is the best
7408 // choice.
7409 unsigned Opc = Subtarget.hasAVX() ? X86::VXORPSrr : X86::XORPSrr;
7410 BuildMI(*MI.getParent(), MI, MI.getDebugLoc(), get(Opc), Reg)
7411 .addReg(Reg, RegState::Undef)
7412 .addReg(Reg, RegState::Undef);
7413 MI.addRegisterKilled(Reg, TRI, true);
7414 } else if (X86::VR256RegClass.contains(Reg)) {
7415 // Use vxorps to clear the full ymm register.
7416 // It wants to read and write the xmm sub-register.
7417 Register XReg = TRI->getSubReg(Reg, X86::sub_xmm);
7418 BuildMI(*MI.getParent(), MI, MI.getDebugLoc(), get(X86::VXORPSrr), XReg)
7419 .addReg(XReg, RegState::Undef)
7420 .addReg(XReg, RegState::Undef)
7422 MI.addRegisterKilled(Reg, TRI, true);
7423 } else if (X86::VR128XRegClass.contains(Reg)) {
7424 // Only handle VLX targets.
7425 if (!Subtarget.hasVLX())
7426 return;
7427 // Since vxorps requires AVX512DQ, vpxord should be the best choice.
7428 BuildMI(*MI.getParent(), MI, MI.getDebugLoc(), get(X86::VPXORDZ128rr), Reg)
7429 .addReg(Reg, RegState::Undef)
7430 .addReg(Reg, RegState::Undef);
7431 MI.addRegisterKilled(Reg, TRI, true);
7432 } else if (X86::VR256XRegClass.contains(Reg) ||
7433 X86::VR512RegClass.contains(Reg)) {
7434 // Only handle VLX targets.
7435 if (!Subtarget.hasVLX())
7436 return;
7437 // Use vpxord to clear the full ymm/zmm register.
7438 // It wants to read and write the xmm sub-register.
7439 Register XReg = TRI->getSubReg(Reg, X86::sub_xmm);
7440 BuildMI(*MI.getParent(), MI, MI.getDebugLoc(), get(X86::VPXORDZ128rr), XReg)
7441 .addReg(XReg, RegState::Undef)
7442 .addReg(XReg, RegState::Undef)
7444 MI.addRegisterKilled(Reg, TRI, true);
7445 } else if (X86::GR64RegClass.contains(Reg)) {
7446 // Using XOR32rr because it has shorter encoding and zeros up the upper bits
7447 // as well.
7448 Register XReg = TRI->getSubReg(Reg, X86::sub_32bit);
7449 BuildMI(*MI.getParent(), MI, MI.getDebugLoc(), get(X86::XOR32rr), XReg)
7450 .addReg(XReg, RegState::Undef)
7451 .addReg(XReg, RegState::Undef)
7453 MI.addRegisterKilled(Reg, TRI, true);
7454 } else if (X86::GR32RegClass.contains(Reg)) {
7455 BuildMI(*MI.getParent(), MI, MI.getDebugLoc(), get(X86::XOR32rr), Reg)
7456 .addReg(Reg, RegState::Undef)
7457 .addReg(Reg, RegState::Undef);
7458 MI.addRegisterKilled(Reg, TRI, true);
7459 } else if ((X86::GR16RegClass.contains(Reg) ||
7460 X86::GR8RegClass.contains(Reg)) &&
7461 X86II::hasNewDataDest(MI.getDesc().TSFlags)) {
7462 // This case is only expected for NDD ops which appear to be partial
7463 // writes, but are not due to the zeroing of the upper part. Here
7464 // we add an implicit def of the superegister, which prevents
7465 // CompressEVEX from converting this to a legacy form.
7466 Register SuperReg = getX86SubSuperRegister(Reg, 64);
7467 MachineInstrBuilder BuildMI(*MI.getParent()->getParent(), &MI);
7468 if (!MI.definesRegister(SuperReg, /*TRI=*/nullptr))
7469 BuildMI.addReg(SuperReg, RegState::ImplicitDefine);
7470 }
7471}
7472
7474 int PtrOffset = 0) {
7475 unsigned NumAddrOps = MOs.size();
7476
7477 if (NumAddrOps < 4) {
7478 // FrameIndex only - add an immediate offset (whether its zero or not).
7479 for (unsigned i = 0; i != NumAddrOps; ++i)
7480 MIB.add(MOs[i]);
7481 addOffset(MIB, PtrOffset);
7482 } else {
7483 // General Memory Addressing - we need to add any offset to an existing
7484 // offset.
7485 assert(MOs.size() == 5 && "Unexpected memory operand list length");
7486 for (unsigned i = 0; i != NumAddrOps; ++i) {
7487 const MachineOperand &MO = MOs[i];
7488 if (i == 3 && PtrOffset != 0) {
7489 MIB.addDisp(MO, PtrOffset);
7490 } else {
7491 MIB.add(MO);
7492 }
7493 }
7494 }
7495}
7496
7498 MachineInstr &NewMI,
7499 const TargetInstrInfo &TII) {
7500 MachineRegisterInfo &MRI = MF.getRegInfo();
7501
7502 for (int Idx : llvm::seq<int>(0, NewMI.getNumOperands())) {
7503 MachineOperand &MO = NewMI.getOperand(Idx);
7504 // We only need to update constraints on virtual register operands.
7505 if (!MO.isReg())
7506 continue;
7507 Register Reg = MO.getReg();
7508 if (!Reg.isVirtual())
7509 continue;
7510
7511 auto *NewRC =
7512 MRI.constrainRegClass(Reg, TII.getRegClass(NewMI.getDesc(), Idx));
7513 if (!NewRC) {
7514 LLVM_DEBUG(
7515 dbgs() << "WARNING: Unable to update register constraint for operand "
7516 << Idx << " of instruction:\n";
7517 NewMI.dump(); dbgs() << "\n");
7518 }
7519 }
7520}
7521
7522static MachineInstr *fuseTwoAddrInst(MachineFunction &MF, unsigned Opcode,
7526 const TargetInstrInfo &TII) {
7527 // Create the base instruction with the memory operand as the first part.
7528 // Omit the implicit operands, something BuildMI can't do.
7529 MachineInstr *NewMI =
7530 MF.CreateMachineInstr(TII.get(Opcode), MI.getDebugLoc(), true);
7531 MachineInstrBuilder MIB(MF, NewMI);
7532 addOperands(MIB, MOs);
7533
7534 // Loop over the rest of the ri operands, converting them over.
7535 unsigned NumOps = MI.getDesc().getNumOperands() - 2;
7536 for (unsigned i = 0; i != NumOps; ++i) {
7537 MachineOperand &MO = MI.getOperand(i + 2);
7538 MIB.add(MO);
7539 }
7540 for (const MachineOperand &MO : llvm::drop_begin(MI.operands(), NumOps + 2))
7541 MIB.add(MO);
7542
7543 updateOperandRegConstraints(MF, *NewMI, TII);
7544
7545 MachineBasicBlock *MBB = InsertPt->getParent();
7546 MBB->insert(InsertPt, NewMI);
7547
7548 return MIB;
7549}
7550
7551static MachineInstr *fuseInst(MachineFunction &MF, unsigned Opcode,
7552 unsigned OpNo, ArrayRef<MachineOperand> MOs,
7555 int PtrOffset = 0) {
7556 // Omit the implicit operands, something BuildMI can't do.
7557 MachineInstr *NewMI =
7558 MF.CreateMachineInstr(TII.get(Opcode), MI.getDebugLoc(), true);
7559 MachineInstrBuilder MIB(MF, NewMI);
7560
7561 for (unsigned i = 0, e = MI.getNumOperands(); i != e; ++i) {
7562 MachineOperand &MO = MI.getOperand(i);
7563 if (i == OpNo) {
7564 assert(MO.isReg() && "Expected to fold into reg operand!");
7565 addOperands(MIB, MOs, PtrOffset);
7566 } else {
7567 MIB.add(MO);
7568 }
7569 }
7570
7571 updateOperandRegConstraints(MF, *NewMI, TII);
7572
7573 // Copy the NoFPExcept flag from the instruction we're fusing.
7576
7577 MachineBasicBlock *MBB = InsertPt->getParent();
7578 MBB->insert(InsertPt, NewMI);
7579
7580 return MIB;
7581}
7582
7583static MachineInstr *makeM0Inst(const TargetInstrInfo &TII, unsigned Opcode,
7586 MachineInstr &MI) {
7587 MachineInstrBuilder MIB = BuildMI(*InsertPt->getParent(), InsertPt,
7588 MI.getDebugLoc(), TII.get(Opcode));
7589 addOperands(MIB, MOs);
7590 return MIB.addImm(0);
7591}
7592
7593MachineInstr *X86InstrInfo::foldMemoryOperandCustom(
7594 MachineFunction &MF, MachineInstr &MI, unsigned OpNum,
7596 unsigned Size, Align Alignment) const {
7597 switch (MI.getOpcode()) {
7598 case X86::INSERTPSrri:
7599 case X86::VINSERTPSrri:
7600 case X86::VINSERTPSZrri:
7601 // Attempt to convert the load of inserted vector into a fold load
7602 // of a single float.
7603 if (OpNum == 2) {
7604 unsigned Imm = MI.getOperand(MI.getNumOperands() - 1).getImm();
7605 unsigned ZMask = Imm & 15;
7606 unsigned DstIdx = (Imm >> 4) & 3;
7607 unsigned SrcIdx = (Imm >> 6) & 3;
7608
7609 const TargetRegisterInfo &TRI = *MF.getSubtarget().getRegisterInfo();
7610 const TargetRegisterClass *RC = getRegClass(MI.getDesc(), OpNum);
7611 unsigned RCSize = TRI.getRegSizeInBits(*RC) / 8;
7612 if ((Size == 0 || Size >= 16) && RCSize >= 16 &&
7613 (MI.getOpcode() != X86::INSERTPSrri || Alignment >= Align(4))) {
7614 int PtrOffset = SrcIdx * 4;
7615 unsigned NewImm = (DstIdx << 4) | ZMask;
7616 unsigned NewOpCode =
7617 (MI.getOpcode() == X86::VINSERTPSZrri) ? X86::VINSERTPSZrmi
7618 : (MI.getOpcode() == X86::VINSERTPSrri) ? X86::VINSERTPSrmi
7619 : X86::INSERTPSrmi;
7620 MachineInstr *NewMI =
7621 fuseInst(MF, NewOpCode, OpNum, MOs, InsertPt, MI, *this, PtrOffset);
7622 NewMI->getOperand(NewMI->getNumOperands() - 1).setImm(NewImm);
7623 return NewMI;
7624 }
7625 }
7626 break;
7627 case X86::MOVHLPSrr:
7628 case X86::VMOVHLPSrr:
7629 case X86::VMOVHLPSZrr:
7630 // Move the upper 64-bits of the second operand to the lower 64-bits.
7631 // To fold the load, adjust the pointer to the upper and use (V)MOVLPS.
7632 // TODO: In most cases AVX doesn't have a 8-byte alignment requirement.
7633 if (OpNum == 2) {
7634 const TargetRegisterInfo &TRI = *MF.getSubtarget().getRegisterInfo();
7635 const TargetRegisterClass *RC = getRegClass(MI.getDesc(), OpNum);
7636 unsigned RCSize = TRI.getRegSizeInBits(*RC) / 8;
7637 if ((Size == 0 || Size >= 16) && RCSize >= 16 && Alignment >= Align(8)) {
7638 unsigned NewOpCode =
7639 (MI.getOpcode() == X86::VMOVHLPSZrr) ? X86::VMOVLPSZ128rm
7640 : (MI.getOpcode() == X86::VMOVHLPSrr) ? X86::VMOVLPSrm
7641 : X86::MOVLPSrm;
7642 MachineInstr *NewMI =
7643 fuseInst(MF, NewOpCode, OpNum, MOs, InsertPt, MI, *this, 8);
7644 return NewMI;
7645 }
7646 }
7647 break;
7648 case X86::UNPCKLPDrr:
7649 // If we won't be able to fold this to the memory form of UNPCKL, use
7650 // MOVHPD instead. Done as custom because we can't have this in the load
7651 // table twice.
7652 if (OpNum == 2) {
7653 const TargetRegisterInfo &TRI = *MF.getSubtarget().getRegisterInfo();
7654 const TargetRegisterClass *RC = getRegClass(MI.getDesc(), OpNum);
7655 unsigned RCSize = TRI.getRegSizeInBits(*RC) / 8;
7656 if ((Size == 0 || Size >= 16) && RCSize >= 16 && Alignment < Align(16)) {
7657 MachineInstr *NewMI =
7658 fuseInst(MF, X86::MOVHPDrm, OpNum, MOs, InsertPt, MI, *this);
7659 return NewMI;
7660 }
7661 }
7662 break;
7663 case X86::MOV32r0:
7664 if (auto *NewMI =
7665 makeM0Inst(*this, (Size == 4) ? X86::MOV32mi : X86::MOV64mi32, MOs,
7666 InsertPt, MI))
7667 return NewMI;
7668 break;
7669 }
7670
7671 return nullptr;
7672}
7673
7675 MachineInstr &MI) {
7676 if (!hasUndefRegUpdate(MI.getOpcode(), 1, /*ForLoadFold*/ true) ||
7677 !MI.getOperand(1).isReg())
7678 return false;
7679
7680 // The are two cases we need to handle depending on where in the pipeline
7681 // the folding attempt is being made.
7682 // -Register has the undef flag set.
7683 // -Register is produced by the IMPLICIT_DEF instruction.
7684
7685 if (MI.getOperand(1).isUndef())
7686 return true;
7687
7689 MachineInstr *VRegDef = RegInfo.getUniqueVRegDef(MI.getOperand(1).getReg());
7690 return VRegDef && VRegDef->isImplicitDef();
7691}
7692
7693unsigned X86InstrInfo::commuteOperandsForFold(MachineInstr &MI,
7694 unsigned Idx1) const {
7695 unsigned Idx2 = CommuteAnyOperandIndex;
7696 if (!findCommutedOpIndices(MI, Idx1, Idx2))
7697 return Idx1;
7698
7699 bool HasDef = MI.getDesc().getNumDefs();
7700 Register Reg0 = HasDef ? MI.getOperand(0).getReg() : Register();
7701 Register Reg1 = MI.getOperand(Idx1).getReg();
7702 Register Reg2 = MI.getOperand(Idx2).getReg();
7703 bool Tied1 = 0 == MI.getDesc().getOperandConstraint(Idx1, MCOI::TIED_TO);
7704 bool Tied2 = 0 == MI.getDesc().getOperandConstraint(Idx2, MCOI::TIED_TO);
7705
7706 // If either of the commutable operands are tied to the destination
7707 // then we can not commute + fold.
7708 if ((HasDef && Reg0 == Reg1 && Tied1) || (HasDef && Reg0 == Reg2 && Tied2))
7709 return Idx1;
7710
7711 return commuteInstruction(MI, false, Idx1, Idx2) ? Idx2 : Idx1;
7712}
7713
7714static void printFailMsgforFold(const MachineInstr &MI, unsigned Idx) {
7715 if (PrintFailedFusing && !MI.isCopy())
7716 dbgs() << "We failed to fuse operand " << Idx << " in " << MI;
7717}
7718
7720 MachineFunction &MF, MachineInstr &MI, unsigned OpNum,
7722 unsigned Size, Align Alignment, bool AllowCommute, MachineInstr *&CopyMI,
7723 VirtRegMap *VRM) const {
7724 bool isSlowTwoMemOps = Subtarget.slowTwoMemOps();
7725 bool isSlowIndirectCall = Subtarget.slowIndirectCall();
7726 unsigned Opc = MI.getOpcode();
7727
7728 // For CPUs that favor the register form of a call,
7729 // do not fold loads into calls, unless optimizing for size aggressively.
7730 if ((isSlowTwoMemOps || isSlowIndirectCall) &&
7731 !MF.getFunction().hasMinSize() &&
7732 (Opc == X86::CALL32r || Opc == X86::CALL64r ||
7733 Opc == X86::CALL64r_ImpCall))
7734 return nullptr;
7735
7736 // For CPUs that favor the register form of a push,
7737 // do not fold loads into pushes, unless optimizing for size aggressively.
7738 if (isSlowTwoMemOps && !MF.getFunction().hasMinSize() &&
7739 (Opc == X86::PUSH16r || Opc == X86::PUSH32r || Opc == X86::PUSH64r))
7740 return nullptr;
7741
7742 // Avoid partial and undef register update stalls unless optimizing for size.
7743 if (!MF.getFunction().hasOptSize() &&
7744 (hasPartialRegUpdate(Opc, Subtarget, /*ForLoadFold*/ true) ||
7746 return nullptr;
7747
7748 unsigned NumOps = MI.getDesc().getNumOperands();
7749 bool IsTwoAddr = NumOps > 1 && OpNum < 2 && MI.getOperand(0).isReg() &&
7750 MI.getOperand(1).isReg() &&
7751 MI.getOperand(0).getReg() == MI.getOperand(1).getReg();
7752
7753 // FIXME: AsmPrinter doesn't know how to handle
7754 // X86II::MO_GOT_ABSOLUTE_ADDRESS after folding.
7755 if (Opc == X86::ADD32ri &&
7756 MI.getOperand(2).getTargetFlags() == X86II::MO_GOT_ABSOLUTE_ADDRESS)
7757 return nullptr;
7758
7759 // GOTTPOFF relocation loads can only be folded into add instructions.
7760 // FIXME: Need to exclude other relocations that only support specific
7761 // instructions.
7762 if (MOs.size() == X86::AddrNumOperands &&
7763 MOs[X86::AddrDisp].getTargetFlags() == X86II::MO_GOTTPOFF &&
7764 Opc != X86::ADD64rr)
7765 return nullptr;
7766
7767 // Don't fold loads into indirect calls that need a KCFI check as we'll
7768 // have to unfold these in X86TargetLowering::EmitKCFICheck anyway.
7769 if (MI.isCall() && MI.getCFIType())
7770 return nullptr;
7771
7772 // Attempt to fold any custom cases we have.
7773 if (auto *CustomMI = foldMemoryOperandCustom(MF, MI, OpNum, MOs, InsertPt,
7774 Size, Alignment))
7775 return CustomMI;
7776
7777 // Folding a memory location into the two-address part of a two-address
7778 // instruction is different than folding it other places. It requires
7779 // replacing the *two* registers with the memory location.
7780 //
7781 // Utilize the mapping NonNDD -> RMW for the NDD variant.
7782 unsigned NonNDOpc = Subtarget.hasNDD() ? X86::getNonNDVariant(Opc) : 0U;
7783 // Utilize the mapping NonNDD if NDD memory variant is not preferred.
7784 bool NoNDDM = NonNDOpc && !Subtarget.hasNDDM();
7785
7786 MachineRegisterInfo &MRI = MF.getRegInfo();
7787 if (NoNDDM && !IsTwoAddr && !MRI.isSSA()) {
7788 // Bail out if dst has subreg. It happens during register-coalescer from
7789 // 704B %19:gr32 = SUB32rr_ND killed %0:gr32, killed %7:gr32, ...
7790 // 752B undef %23.sub_32bit:gr64 = COPY killed %19:gr32
7791 // 768B %25:gr32 = LEA64_32r killed %23:gr64, 1, killed %21:gr64_nosp, ...
7792 // to
7793 // 704B undef %23.sub_32bit:gr64_with_sub_8bit = SUB32rr_ND %0:gr32, ...
7794 // 768B %25:gr32 = LEA64_32r %23:gr64_with_sub_8bit, 1, %21:gr64_nosp, ...
7795 // Machine verifier fails if we try to tie %23 to the source.
7796 if (MI.getOperand(0).getSubReg())
7797 return nullptr;
7798
7799 // Bail out if dst has been assigned a physical register. Otherwise, we
7800 // cannot update LiveRegMatrix properly.
7801 Register Dst = MI.getOperand(0).getReg();
7802 if (VRM && Dst != MI.getOperand(1).getReg() &&
7803 (!Dst.isVirtual() || VRM->getPhys(Dst)))
7804 return nullptr;
7805 }
7806
7807 const X86FoldTableEntry *I =
7808 IsTwoAddr ? lookupTwoAddrFoldTable(NonNDOpc ? NonNDOpc : Opc)
7809 : lookupFoldTable(NoNDDM ? NonNDOpc : Opc, OpNum);
7810
7811 MachineInstr *NewMI = nullptr;
7812 if (I) {
7813 unsigned Opcode = I->DstOp;
7814 if (Alignment <
7815 Align(1ULL << ((I->Flags & TB_ALIGN_MASK) >> TB_ALIGN_SHIFT)))
7816 return nullptr;
7817 bool NarrowToMOV32rm = false;
7818 if (Size) {
7820 const TargetRegisterClass *RC = getRegClass(MI.getDesc(), OpNum);
7821 unsigned RCSize = TRI.getRegSizeInBits(*RC) / 8;
7822 // Check if it's safe to fold the load. If the size of the object is
7823 // narrower than the load width, then it's not.
7824 // FIXME: Allow scalar intrinsic instructions like ADDSSrm_Int.
7825 if ((I->Flags & TB_FOLDED_LOAD) && Size < RCSize) {
7826 // If this is a 64-bit load, but the spill slot is 32, then we can do
7827 // a 32-bit load which is implicitly zero-extended. This likely is
7828 // due to live interval analysis remat'ing a load from stack slot.
7829 if (Opcode != X86::MOV64rm || RCSize != 8 || Size != 4)
7830 return nullptr;
7831 if (MI.getOperand(0).getSubReg() || MI.getOperand(1).getSubReg())
7832 return nullptr;
7833 Opcode = X86::MOV32rm;
7834 NarrowToMOV32rm = true;
7835 }
7836 // For stores, make sure the size of the object is equal to the size of
7837 // the store. If the object is larger, the extra bits would be garbage. If
7838 // the object is smaller we might overwrite another object or fault.
7839 if ((I->Flags & TB_FOLDED_STORE) && Size != RCSize)
7840 return nullptr;
7841 }
7842
7843 NewMI = IsTwoAddr ? fuseTwoAddrInst(MF, Opcode, MOs, InsertPt, MI, *this)
7844 : fuseInst(MF, Opcode, OpNum, MOs, InsertPt, MI, *this);
7845
7846 if (NarrowToMOV32rm) {
7847 // If this is the special case where we use a MOV32rm to load a 32-bit
7848 // value and zero-extend the top bits. Change the destination register
7849 // to a 32-bit one.
7850 Register DstReg = NewMI->getOperand(0).getReg();
7851 if (DstReg.isPhysical())
7852 NewMI->getOperand(0).setReg(RI.getSubReg(DstReg, X86::sub_32bit));
7853 else
7854 NewMI->getOperand(0).setSubReg(X86::sub_32bit);
7855 }
7856
7857 if (NoNDDM && !IsTwoAddr) {
7858 Register SrcReg = MI.getOperand(1).getReg();
7859 unsigned SrcSub = MI.getOperand(1).getSubReg();
7860 if (MI.killsRegister(SrcReg, /*TRI=*/nullptr) ||
7861 MI.getOperand(0).getReg() == SrcReg)
7862 return NewMI;
7863
7864 Register NewSrc = MI.getOperand(0).getReg();
7865 if (MRI.isSSA())
7866 NewSrc = MRI.createVirtualRegister(getRegClass(NewMI->getDesc(), 1));
7867
7868 CopyMI = BuildMI(*NewMI->getParent(), *NewMI, MI.getDebugLoc(),
7869 get(TargetOpcode::COPY))
7870 .addDef(NewSrc)
7871 .addReg(SrcReg, {}, SrcSub);
7872 NewMI->getOperand(1).setReg(NewSrc);
7873 NewMI->getOperand(1).setSubReg(0);
7874 }
7875 return NewMI;
7876 }
7877
7878 if (AllowCommute) {
7879 // If the instruction and target operand are commutable, commute the
7880 // instruction and try again.
7881 unsigned CommuteOpIdx2 = commuteOperandsForFold(MI, OpNum);
7882 if (CommuteOpIdx2 == OpNum) {
7883 printFailMsgforFold(MI, OpNum);
7884 return nullptr;
7885 }
7886 // Attempt to fold with the commuted version of the instruction.
7887 NewMI = foldMemoryOperandImpl(MF, MI, CommuteOpIdx2, MOs, InsertPt, Size,
7888 Alignment, /*AllowCommute=*/false, CopyMI);
7889 if (NewMI)
7890 return NewMI;
7891 // Folding failed again - undo the commute before returning.
7892 commuteInstruction(MI, false, OpNum, CommuteOpIdx2);
7893 }
7894
7895 printFailMsgforFold(MI, OpNum);
7896 return nullptr;
7897}
7898
7901 ArrayRef<unsigned> Ops, int FrameIndex,
7902 MachineInstr *&CopyMI, LiveIntervals *LIS,
7903 VirtRegMap *VRM) const {
7905 // Check switch flag
7906 if (NoFusing)
7907 return nullptr;
7908
7909 // Avoid partial and undef register update stalls unless optimizing for size.
7910 if (!MF.getFunction().hasOptSize() &&
7911 (hasPartialRegUpdate(MI.getOpcode(), Subtarget, /*ForLoadFold*/ true) ||
7913 return nullptr;
7914
7915 // Don't fold subreg spills, or reloads that use a high subreg.
7916 for (auto Op : Ops) {
7917 MachineOperand &MO = MI.getOperand(Op);
7918 auto SubReg = MO.getSubReg();
7919 // MOV32r0 is special b/c it's used to clear a 64-bit register too.
7920 // (See patterns for MOV32r0 in TD files).
7921 if (MI.getOpcode() == X86::MOV32r0 && SubReg == X86::sub_32bit)
7922 continue;
7923 if (SubReg && (MO.isDef() || SubReg == X86::sub_8bit_hi))
7924 return nullptr;
7925 }
7926
7927 const MachineFrameInfo &MFI = MF.getFrameInfo();
7928 unsigned Size = MFI.getObjectSize(FrameIndex);
7929 Align Alignment = MFI.getObjectAlign(FrameIndex);
7930 // If the function stack isn't realigned we don't want to fold instructions
7931 // that need increased alignment.
7932 if (!RI.hasStackRealignment(MF))
7933 Alignment =
7934 std::min(Alignment, Subtarget.getFrameLowering()->getStackAlign());
7935
7936 auto Impl = [&]() {
7937 return foldMemoryOperandImpl(
7938 MF, MI, Ops[0], MachineOperand::CreateFI(FrameIndex), InsertPt, Size,
7939 Alignment, /*AllowCommute=*/true, CopyMI, VRM);
7940 };
7941 if (Ops.size() == 2 && Ops[0] == 0 && Ops[1] == 1) {
7942 unsigned NewOpc = 0;
7943 unsigned RCSize = 0;
7944 unsigned Opc = MI.getOpcode();
7945 switch (Opc) {
7946 default:
7947 // NDD can be folded into RMW though its Op0 and Op1 are not tied.
7948 return (Subtarget.hasNDD() ? X86::getNonNDVariant(Opc) : 0U) ? Impl()
7949 : nullptr;
7950 case X86::TEST8rr:
7951 NewOpc = X86::CMP8ri;
7952 RCSize = 1;
7953 break;
7954 case X86::TEST16rr:
7955 NewOpc = X86::CMP16ri;
7956 RCSize = 2;
7957 break;
7958 case X86::TEST32rr:
7959 NewOpc = X86::CMP32ri;
7960 RCSize = 4;
7961 break;
7962 case X86::TEST64rr:
7963 NewOpc = X86::CMP64ri32;
7964 RCSize = 8;
7965 break;
7966 }
7967 // Check if it's safe to fold the load. If the size of the object is
7968 // narrower than the load width, then it's not.
7969 if (Size < RCSize)
7970 return nullptr;
7971 // Change to CMPXXri r, 0 first.
7972 MI.setDesc(get(NewOpc));
7973 MI.getOperand(1).ChangeToImmediate(0);
7974 } else if (Ops.size() != 1)
7975 return nullptr;
7976
7977 return Impl();
7978}
7979
7980/// Check if \p LoadMI is a partial register load that we can't fold into \p MI
7981/// because the latter uses contents that wouldn't be defined in the folded
7982/// version. For instance, this transformation isn't legal:
7983/// movss (%rdi), %xmm0
7984/// addps %xmm0, %xmm0
7985/// ->
7986/// addps (%rdi), %xmm0
7987///
7988/// But this one is:
7989/// movss (%rdi), %xmm0
7990/// addss %xmm0, %xmm0
7991/// ->
7992/// addss (%rdi), %xmm0
7993///
7995 const MachineInstr &UserMI,
7996 const MachineFunction &MF) {
7997 unsigned Opc = LoadMI.getOpcode();
7998 unsigned UserOpc = UserMI.getOpcode();
8000 const TargetRegisterClass *RC =
8001 MF.getRegInfo().getRegClass(LoadMI.getOperand(0).getReg());
8002 unsigned RegSize = TRI.getRegSizeInBits(*RC);
8003
8004 if ((Opc == X86::MOVSSrm || Opc == X86::VMOVSSrm || Opc == X86::VMOVSSZrm ||
8005 Opc == X86::MOVSSrm_alt || Opc == X86::VMOVSSrm_alt ||
8006 Opc == X86::VMOVSSZrm_alt) &&
8007 RegSize > 32) {
8008 // These instructions only load 32 bits, we can't fold them if the
8009 // destination register is wider than 32 bits (4 bytes), and its user
8010 // instruction isn't scalar (SS).
8011 switch (UserOpc) {
8012 case X86::CVTSS2SDrr_Int:
8013 case X86::VCVTSS2SDrr_Int:
8014 case X86::VCVTSS2SDZrr_Int:
8015 case X86::VCVTSS2SDZrrk_Int:
8016 case X86::VCVTSS2SDZrrkz_Int:
8017 case X86::CVTSS2SIrr_Int:
8018 case X86::CVTSS2SI64rr_Int:
8019 case X86::VCVTSS2SIrr_Int:
8020 case X86::VCVTSS2SI64rr_Int:
8021 case X86::VCVTSS2SIZrr_Int:
8022 case X86::VCVTSS2SI64Zrr_Int:
8023 case X86::CVTTSS2SIrr_Int:
8024 case X86::CVTTSS2SI64rr_Int:
8025 case X86::VCVTTSS2SIrr_Int:
8026 case X86::VCVTTSS2SI64rr_Int:
8027 case X86::VCVTTSS2SIZrr_Int:
8028 case X86::VCVTTSS2SI64Zrr_Int:
8029 case X86::VCVTSS2USIZrr_Int:
8030 case X86::VCVTSS2USI64Zrr_Int:
8031 case X86::VCVTTSS2USIZrr_Int:
8032 case X86::VCVTTSS2USI64Zrr_Int:
8033 case X86::RCPSSr_Int:
8034 case X86::VRCPSSr_Int:
8035 case X86::RSQRTSSr_Int:
8036 case X86::VRSQRTSSr_Int:
8037 case X86::ROUNDSSri_Int:
8038 case X86::VROUNDSSri_Int:
8039 case X86::COMISSrr_Int:
8040 case X86::VCOMISSrr_Int:
8041 case X86::VCOMISSZrr_Int:
8042 case X86::UCOMISSrr_Int:
8043 case X86::VUCOMISSrr_Int:
8044 case X86::VUCOMISSZrr_Int:
8045 case X86::ADDSSrr_Int:
8046 case X86::VADDSSrr_Int:
8047 case X86::VADDSSZrr_Int:
8048 case X86::CMPSSrri_Int:
8049 case X86::VCMPSSrri_Int:
8050 case X86::VCMPSSZrri_Int:
8051 case X86::DIVSSrr_Int:
8052 case X86::VDIVSSrr_Int:
8053 case X86::VDIVSSZrr_Int:
8054 case X86::MAXSSrr_Int:
8055 case X86::VMAXSSrr_Int:
8056 case X86::VMAXSSZrr_Int:
8057 case X86::MINSSrr_Int:
8058 case X86::VMINSSrr_Int:
8059 case X86::VMINSSZrr_Int:
8060 case X86::MULSSrr_Int:
8061 case X86::VMULSSrr_Int:
8062 case X86::VMULSSZrr_Int:
8063 case X86::SQRTSSr_Int:
8064 case X86::VSQRTSSr_Int:
8065 case X86::VSQRTSSZr_Int:
8066 case X86::SUBSSrr_Int:
8067 case X86::VSUBSSrr_Int:
8068 case X86::VSUBSSZrr_Int:
8069 case X86::VADDSSZrrk_Int:
8070 case X86::VADDSSZrrkz_Int:
8071 case X86::VCMPSSZrrik_Int:
8072 case X86::VDIVSSZrrk_Int:
8073 case X86::VDIVSSZrrkz_Int:
8074 case X86::VMAXSSZrrk_Int:
8075 case X86::VMAXSSZrrkz_Int:
8076 case X86::VMINSSZrrk_Int:
8077 case X86::VMINSSZrrkz_Int:
8078 case X86::VMULSSZrrk_Int:
8079 case X86::VMULSSZrrkz_Int:
8080 case X86::VSQRTSSZrk_Int:
8081 case X86::VSQRTSSZrkz_Int:
8082 case X86::VSUBSSZrrk_Int:
8083 case X86::VSUBSSZrrkz_Int:
8084 case X86::VFMADDSS4rr_Int:
8085 case X86::VFNMADDSS4rr_Int:
8086 case X86::VFMSUBSS4rr_Int:
8087 case X86::VFNMSUBSS4rr_Int:
8088 case X86::VFMADD132SSr_Int:
8089 case X86::VFNMADD132SSr_Int:
8090 case X86::VFMADD213SSr_Int:
8091 case X86::VFNMADD213SSr_Int:
8092 case X86::VFMADD231SSr_Int:
8093 case X86::VFNMADD231SSr_Int:
8094 case X86::VFMSUB132SSr_Int:
8095 case X86::VFNMSUB132SSr_Int:
8096 case X86::VFMSUB213SSr_Int:
8097 case X86::VFNMSUB213SSr_Int:
8098 case X86::VFMSUB231SSr_Int:
8099 case X86::VFNMSUB231SSr_Int:
8100 case X86::VFMADD132SSZr_Int:
8101 case X86::VFNMADD132SSZr_Int:
8102 case X86::VFMADD213SSZr_Int:
8103 case X86::VFNMADD213SSZr_Int:
8104 case X86::VFMADD231SSZr_Int:
8105 case X86::VFNMADD231SSZr_Int:
8106 case X86::VFMSUB132SSZr_Int:
8107 case X86::VFNMSUB132SSZr_Int:
8108 case X86::VFMSUB213SSZr_Int:
8109 case X86::VFNMSUB213SSZr_Int:
8110 case X86::VFMSUB231SSZr_Int:
8111 case X86::VFNMSUB231SSZr_Int:
8112 case X86::VFMADD132SSZrk_Int:
8113 case X86::VFNMADD132SSZrk_Int:
8114 case X86::VFMADD213SSZrk_Int:
8115 case X86::VFNMADD213SSZrk_Int:
8116 case X86::VFMADD231SSZrk_Int:
8117 case X86::VFNMADD231SSZrk_Int:
8118 case X86::VFMSUB132SSZrk_Int:
8119 case X86::VFNMSUB132SSZrk_Int:
8120 case X86::VFMSUB213SSZrk_Int:
8121 case X86::VFNMSUB213SSZrk_Int:
8122 case X86::VFMSUB231SSZrk_Int:
8123 case X86::VFNMSUB231SSZrk_Int:
8124 case X86::VFMADD132SSZrkz_Int:
8125 case X86::VFNMADD132SSZrkz_Int:
8126 case X86::VFMADD213SSZrkz_Int:
8127 case X86::VFNMADD213SSZrkz_Int:
8128 case X86::VFMADD231SSZrkz_Int:
8129 case X86::VFNMADD231SSZrkz_Int:
8130 case X86::VFMSUB132SSZrkz_Int:
8131 case X86::VFNMSUB132SSZrkz_Int:
8132 case X86::VFMSUB213SSZrkz_Int:
8133 case X86::VFNMSUB213SSZrkz_Int:
8134 case X86::VFMSUB231SSZrkz_Int:
8135 case X86::VFNMSUB231SSZrkz_Int:
8136 case X86::VFIXUPIMMSSZrri:
8137 case X86::VFIXUPIMMSSZrrik:
8138 case X86::VFIXUPIMMSSZrrikz:
8139 case X86::VFPCLASSSSZri:
8140 case X86::VFPCLASSSSZrik:
8141 case X86::VGETEXPSSZr:
8142 case X86::VGETEXPSSZrk:
8143 case X86::VGETEXPSSZrkz:
8144 case X86::VGETMANTSSZrri:
8145 case X86::VGETMANTSSZrrik:
8146 case X86::VGETMANTSSZrrikz:
8147 case X86::VRANGESSZrri:
8148 case X86::VRANGESSZrrik:
8149 case X86::VRANGESSZrrikz:
8150 case X86::VRCP14SSZrr:
8151 case X86::VRCP14SSZrrk:
8152 case X86::VRCP14SSZrrkz:
8153 case X86::VRCP28SSZr:
8154 case X86::VRCP28SSZrk:
8155 case X86::VRCP28SSZrkz:
8156 case X86::VREDUCESSZrri:
8157 case X86::VREDUCESSZrrik:
8158 case X86::VREDUCESSZrrikz:
8159 case X86::VRNDSCALESSZrri_Int:
8160 case X86::VRNDSCALESSZrrik_Int:
8161 case X86::VRNDSCALESSZrrikz_Int:
8162 case X86::VRSQRT14SSZrr:
8163 case X86::VRSQRT14SSZrrk:
8164 case X86::VRSQRT14SSZrrkz:
8165 case X86::VRSQRT28SSZr:
8166 case X86::VRSQRT28SSZrk:
8167 case X86::VRSQRT28SSZrkz:
8168 case X86::VSCALEFSSZrr:
8169 case X86::VSCALEFSSZrrk:
8170 case X86::VSCALEFSSZrrkz:
8171 return false;
8172 default:
8173 return true;
8174 }
8175 }
8176
8177 if ((Opc == X86::MOVSDrm || Opc == X86::VMOVSDrm || Opc == X86::VMOVSDZrm ||
8178 Opc == X86::MOVSDrm_alt || Opc == X86::VMOVSDrm_alt ||
8179 Opc == X86::VMOVSDZrm_alt) &&
8180 RegSize > 64) {
8181 // These instructions only load 64 bits, we can't fold them if the
8182 // destination register is wider than 64 bits (8 bytes), and its user
8183 // instruction isn't scalar (SD).
8184 switch (UserOpc) {
8185 case X86::CVTSD2SSrr_Int:
8186 case X86::VCVTSD2SSrr_Int:
8187 case X86::VCVTSD2SSZrr_Int:
8188 case X86::VCVTSD2SSZrrk_Int:
8189 case X86::VCVTSD2SSZrrkz_Int:
8190 case X86::CVTSD2SIrr_Int:
8191 case X86::CVTSD2SI64rr_Int:
8192 case X86::VCVTSD2SIrr_Int:
8193 case X86::VCVTSD2SI64rr_Int:
8194 case X86::VCVTSD2SIZrr_Int:
8195 case X86::VCVTSD2SI64Zrr_Int:
8196 case X86::CVTTSD2SIrr_Int:
8197 case X86::CVTTSD2SI64rr_Int:
8198 case X86::VCVTTSD2SIrr_Int:
8199 case X86::VCVTTSD2SI64rr_Int:
8200 case X86::VCVTTSD2SIZrr_Int:
8201 case X86::VCVTTSD2SI64Zrr_Int:
8202 case X86::VCVTSD2USIZrr_Int:
8203 case X86::VCVTSD2USI64Zrr_Int:
8204 case X86::VCVTTSD2USIZrr_Int:
8205 case X86::VCVTTSD2USI64Zrr_Int:
8206 case X86::ROUNDSDri_Int:
8207 case X86::VROUNDSDri_Int:
8208 case X86::COMISDrr_Int:
8209 case X86::VCOMISDrr_Int:
8210 case X86::VCOMISDZrr_Int:
8211 case X86::UCOMISDrr_Int:
8212 case X86::VUCOMISDrr_Int:
8213 case X86::VUCOMISDZrr_Int:
8214 case X86::ADDSDrr_Int:
8215 case X86::VADDSDrr_Int:
8216 case X86::VADDSDZrr_Int:
8217 case X86::CMPSDrri_Int:
8218 case X86::VCMPSDrri_Int:
8219 case X86::VCMPSDZrri_Int:
8220 case X86::DIVSDrr_Int:
8221 case X86::VDIVSDrr_Int:
8222 case X86::VDIVSDZrr_Int:
8223 case X86::MAXSDrr_Int:
8224 case X86::VMAXSDrr_Int:
8225 case X86::VMAXSDZrr_Int:
8226 case X86::MINSDrr_Int:
8227 case X86::VMINSDrr_Int:
8228 case X86::VMINSDZrr_Int:
8229 case X86::MULSDrr_Int:
8230 case X86::VMULSDrr_Int:
8231 case X86::VMULSDZrr_Int:
8232 case X86::SQRTSDr_Int:
8233 case X86::VSQRTSDr_Int:
8234 case X86::VSQRTSDZr_Int:
8235 case X86::SUBSDrr_Int:
8236 case X86::VSUBSDrr_Int:
8237 case X86::VSUBSDZrr_Int:
8238 case X86::VADDSDZrrk_Int:
8239 case X86::VADDSDZrrkz_Int:
8240 case X86::VCMPSDZrrik_Int:
8241 case X86::VDIVSDZrrk_Int:
8242 case X86::VDIVSDZrrkz_Int:
8243 case X86::VMAXSDZrrk_Int:
8244 case X86::VMAXSDZrrkz_Int:
8245 case X86::VMINSDZrrk_Int:
8246 case X86::VMINSDZrrkz_Int:
8247 case X86::VMULSDZrrk_Int:
8248 case X86::VMULSDZrrkz_Int:
8249 case X86::VSQRTSDZrk_Int:
8250 case X86::VSQRTSDZrkz_Int:
8251 case X86::VSUBSDZrrk_Int:
8252 case X86::VSUBSDZrrkz_Int:
8253 case X86::VFMADDSD4rr_Int:
8254 case X86::VFNMADDSD4rr_Int:
8255 case X86::VFMSUBSD4rr_Int:
8256 case X86::VFNMSUBSD4rr_Int:
8257 case X86::VFMADD132SDr_Int:
8258 case X86::VFNMADD132SDr_Int:
8259 case X86::VFMADD213SDr_Int:
8260 case X86::VFNMADD213SDr_Int:
8261 case X86::VFMADD231SDr_Int:
8262 case X86::VFNMADD231SDr_Int:
8263 case X86::VFMSUB132SDr_Int:
8264 case X86::VFNMSUB132SDr_Int:
8265 case X86::VFMSUB213SDr_Int:
8266 case X86::VFNMSUB213SDr_Int:
8267 case X86::VFMSUB231SDr_Int:
8268 case X86::VFNMSUB231SDr_Int:
8269 case X86::VFMADD132SDZr_Int:
8270 case X86::VFNMADD132SDZr_Int:
8271 case X86::VFMADD213SDZr_Int:
8272 case X86::VFNMADD213SDZr_Int:
8273 case X86::VFMADD231SDZr_Int:
8274 case X86::VFNMADD231SDZr_Int:
8275 case X86::VFMSUB132SDZr_Int:
8276 case X86::VFNMSUB132SDZr_Int:
8277 case X86::VFMSUB213SDZr_Int:
8278 case X86::VFNMSUB213SDZr_Int:
8279 case X86::VFMSUB231SDZr_Int:
8280 case X86::VFNMSUB231SDZr_Int:
8281 case X86::VFMADD132SDZrk_Int:
8282 case X86::VFNMADD132SDZrk_Int:
8283 case X86::VFMADD213SDZrk_Int:
8284 case X86::VFNMADD213SDZrk_Int:
8285 case X86::VFMADD231SDZrk_Int:
8286 case X86::VFNMADD231SDZrk_Int:
8287 case X86::VFMSUB132SDZrk_Int:
8288 case X86::VFNMSUB132SDZrk_Int:
8289 case X86::VFMSUB213SDZrk_Int:
8290 case X86::VFNMSUB213SDZrk_Int:
8291 case X86::VFMSUB231SDZrk_Int:
8292 case X86::VFNMSUB231SDZrk_Int:
8293 case X86::VFMADD132SDZrkz_Int:
8294 case X86::VFNMADD132SDZrkz_Int:
8295 case X86::VFMADD213SDZrkz_Int:
8296 case X86::VFNMADD213SDZrkz_Int:
8297 case X86::VFMADD231SDZrkz_Int:
8298 case X86::VFNMADD231SDZrkz_Int:
8299 case X86::VFMSUB132SDZrkz_Int:
8300 case X86::VFNMSUB132SDZrkz_Int:
8301 case X86::VFMSUB213SDZrkz_Int:
8302 case X86::VFNMSUB213SDZrkz_Int:
8303 case X86::VFMSUB231SDZrkz_Int:
8304 case X86::VFNMSUB231SDZrkz_Int:
8305 case X86::VFIXUPIMMSDZrri:
8306 case X86::VFIXUPIMMSDZrrik:
8307 case X86::VFIXUPIMMSDZrrikz:
8308 case X86::VFPCLASSSDZri:
8309 case X86::VFPCLASSSDZrik:
8310 case X86::VGETEXPSDZr:
8311 case X86::VGETEXPSDZrk:
8312 case X86::VGETEXPSDZrkz:
8313 case X86::VGETMANTSDZrri:
8314 case X86::VGETMANTSDZrrik:
8315 case X86::VGETMANTSDZrrikz:
8316 case X86::VRANGESDZrri:
8317 case X86::VRANGESDZrrik:
8318 case X86::VRANGESDZrrikz:
8319 case X86::VRCP14SDZrr:
8320 case X86::VRCP14SDZrrk:
8321 case X86::VRCP14SDZrrkz:
8322 case X86::VRCP28SDZr:
8323 case X86::VRCP28SDZrk:
8324 case X86::VRCP28SDZrkz:
8325 case X86::VREDUCESDZrri:
8326 case X86::VREDUCESDZrrik:
8327 case X86::VREDUCESDZrrikz:
8328 case X86::VRNDSCALESDZrri_Int:
8329 case X86::VRNDSCALESDZrrik_Int:
8330 case X86::VRNDSCALESDZrrikz_Int:
8331 case X86::VRSQRT14SDZrr:
8332 case X86::VRSQRT14SDZrrk:
8333 case X86::VRSQRT14SDZrrkz:
8334 case X86::VRSQRT28SDZr:
8335 case X86::VRSQRT28SDZrk:
8336 case X86::VRSQRT28SDZrkz:
8337 case X86::VSCALEFSDZrr:
8338 case X86::VSCALEFSDZrrk:
8339 case X86::VSCALEFSDZrrkz:
8340 return false;
8341 default:
8342 return true;
8343 }
8344 }
8345
8346 if ((Opc == X86::VMOVSHZrm || Opc == X86::VMOVSHZrm_alt) && RegSize > 16) {
8347 // These instructions only load 16 bits, we can't fold them if the
8348 // destination register is wider than 16 bits (2 bytes), and its user
8349 // instruction isn't scalar (SH).
8350 switch (UserOpc) {
8351 case X86::VADDSHZrr_Int:
8352 case X86::VCMPSHZrri_Int:
8353 case X86::VDIVSHZrr_Int:
8354 case X86::VMAXSHZrr_Int:
8355 case X86::VMINSHZrr_Int:
8356 case X86::VMULSHZrr_Int:
8357 case X86::VSUBSHZrr_Int:
8358 case X86::VADDSHZrrk_Int:
8359 case X86::VADDSHZrrkz_Int:
8360 case X86::VCMPSHZrrik_Int:
8361 case X86::VDIVSHZrrk_Int:
8362 case X86::VDIVSHZrrkz_Int:
8363 case X86::VMAXSHZrrk_Int:
8364 case X86::VMAXSHZrrkz_Int:
8365 case X86::VMINSHZrrk_Int:
8366 case X86::VMINSHZrrkz_Int:
8367 case X86::VMULSHZrrk_Int:
8368 case X86::VMULSHZrrkz_Int:
8369 case X86::VSUBSHZrrk_Int:
8370 case X86::VSUBSHZrrkz_Int:
8371 case X86::VFMADD132SHZr_Int:
8372 case X86::VFNMADD132SHZr_Int:
8373 case X86::VFMADD213SHZr_Int:
8374 case X86::VFNMADD213SHZr_Int:
8375 case X86::VFMADD231SHZr_Int:
8376 case X86::VFNMADD231SHZr_Int:
8377 case X86::VFMSUB132SHZr_Int:
8378 case X86::VFNMSUB132SHZr_Int:
8379 case X86::VFMSUB213SHZr_Int:
8380 case X86::VFNMSUB213SHZr_Int:
8381 case X86::VFMSUB231SHZr_Int:
8382 case X86::VFNMSUB231SHZr_Int:
8383 case X86::VFMADD132SHZrk_Int:
8384 case X86::VFNMADD132SHZrk_Int:
8385 case X86::VFMADD213SHZrk_Int:
8386 case X86::VFNMADD213SHZrk_Int:
8387 case X86::VFMADD231SHZrk_Int:
8388 case X86::VFNMADD231SHZrk_Int:
8389 case X86::VFMSUB132SHZrk_Int:
8390 case X86::VFNMSUB132SHZrk_Int:
8391 case X86::VFMSUB213SHZrk_Int:
8392 case X86::VFNMSUB213SHZrk_Int:
8393 case X86::VFMSUB231SHZrk_Int:
8394 case X86::VFNMSUB231SHZrk_Int:
8395 case X86::VFMADD132SHZrkz_Int:
8396 case X86::VFNMADD132SHZrkz_Int:
8397 case X86::VFMADD213SHZrkz_Int:
8398 case X86::VFNMADD213SHZrkz_Int:
8399 case X86::VFMADD231SHZrkz_Int:
8400 case X86::VFNMADD231SHZrkz_Int:
8401 case X86::VFMSUB132SHZrkz_Int:
8402 case X86::VFNMSUB132SHZrkz_Int:
8403 case X86::VFMSUB213SHZrkz_Int:
8404 case X86::VFNMSUB213SHZrkz_Int:
8405 case X86::VFMSUB231SHZrkz_Int:
8406 case X86::VFNMSUB231SHZrkz_Int:
8407 return false;
8408 default:
8409 return true;
8410 }
8411 }
8412
8413 return false;
8414}
8415
8419 MachineInstr &LoadMI, MachineInstr *&CopyMI,
8420 LiveIntervals *LIS, VirtRegMap *VRM) const {
8422
8423 // If LoadMI is a masked load, check MI having the same mask.
8424 const MCInstrDesc &MCID = get(LoadMI.getOpcode());
8425 unsigned NumOps = MCID.getNumOperands();
8426 if (NumOps >= 3) {
8427 Register MaskReg;
8428 const MachineOperand &Op1 = LoadMI.getOperand(1);
8429 const MachineOperand &Op2 = LoadMI.getOperand(2);
8430
8431 auto IsVKWMClass = [](const TargetRegisterClass *RC) {
8432 return RC == &X86::VK2WMRegClass || RC == &X86::VK4WMRegClass ||
8433 RC == &X86::VK8WMRegClass || RC == &X86::VK16WMRegClass ||
8434 RC == &X86::VK32WMRegClass || RC == &X86::VK64WMRegClass;
8435 };
8436
8437 if (Op1.isReg() && IsVKWMClass(getRegClass(MCID, 1)))
8438 MaskReg = Op1.getReg();
8439 else if (Op2.isReg() && IsVKWMClass(getRegClass(MCID, 2)))
8440 MaskReg = Op2.getReg();
8441
8442 if (MaskReg) {
8443 // Some instructions are invalid to fold into even with the same mask.
8444 // Folding is unsafe if an active destination element may read from a
8445 // source element that is masked off.
8446 if (isNonFoldableWithSameMask(MI.getOpcode()))
8447 return nullptr;
8448 bool HasSameMask = false;
8449 for (unsigned I = 1, E = MI.getDesc().getNumOperands(); I < E; ++I) {
8450 const MachineOperand &Op = MI.getOperand(I);
8451 if (Op.isReg() && Op.getReg() == MaskReg) {
8452 HasSameMask = true;
8453 break;
8454 }
8455 }
8456 if (!HasSameMask)
8457 return nullptr;
8458 }
8459 }
8460
8461 // TODO: Support the case where LoadMI loads a wide register, but MI
8462 // only uses a subreg.
8463 for (auto Op : Ops) {
8464 if (MI.getOperand(Op).getSubReg())
8465 return nullptr;
8466 }
8467
8468 // If loading from a FrameIndex, fold directly from the FrameIndex.
8469 int FrameIndex;
8470 if (isLoadFromStackSlot(LoadMI, FrameIndex)) {
8471 if (isNonFoldablePartialRegisterLoad(LoadMI, MI, MF))
8472 return nullptr;
8473 return foldMemoryOperandImpl(MF, MI, Ops, FrameIndex, CopyMI, LIS, VRM);
8474 }
8475
8476 // Check switch flag
8477 if (NoFusing)
8478 return nullptr;
8479
8480 // Avoid partial and undef register update stalls unless optimizing for size.
8481 if (!MF.getFunction().hasOptSize() &&
8482 (hasPartialRegUpdate(MI.getOpcode(), Subtarget, /*ForLoadFold*/ true) ||
8484 return nullptr;
8485
8486 // Do not fold a NDD instruction and a memory instruction with relocation to
8487 // avoid emit APX relocation when the flag is disabled for backward
8488 // compatibility.
8489 uint64_t TSFlags = MI.getDesc().TSFlags;
8491 X86II::hasNewDataDest(TSFlags))
8492 return nullptr;
8493
8494 // Determine the alignment of the load.
8495 Align Alignment;
8496 unsigned LoadOpc = LoadMI.getOpcode();
8497 if (LoadMI.hasOneMemOperand())
8498 Alignment = (*LoadMI.memoperands_begin())->getAlign();
8499 else
8500 switch (LoadOpc) {
8501 case X86::AVX512_512_SETALLONES:
8502 Alignment = Align(64);
8503 break;
8504 case X86::AVX2_SETALLONES:
8505 case X86::AVX1_SETALLONES:
8506 case X86::AVX512_256_SETALLONES:
8507 Alignment = Align(32);
8508 break;
8509 case X86::V_SET0:
8510 case X86::V_SETALLONES:
8511 case X86::AVX512_128_SET0:
8512 case X86::FsFLD0F128:
8513 case X86::AVX512_FsFLD0F128:
8514 case X86::AVX512_128_SETALLONES:
8515 Alignment = Align(16);
8516 break;
8517 case X86::MMX_SET0:
8518 case X86::FsFLD0SD:
8519 case X86::AVX512_FsFLD0SD:
8520 Alignment = Align(8);
8521 break;
8522 case X86::FsFLD0SS:
8523 case X86::AVX512_FsFLD0SS:
8524 Alignment = Align(4);
8525 break;
8526 case X86::FsFLD0SH:
8527 case X86::AVX512_FsFLD0SH:
8528 Alignment = Align(2);
8529 break;
8530 default:
8531 return nullptr;
8532 }
8533 if (Ops.size() == 2 && Ops[0] == 0 && Ops[1] == 1) {
8534 unsigned NewOpc = 0;
8535 switch (MI.getOpcode()) {
8536 default:
8537 return nullptr;
8538 case X86::TEST8rr:
8539 NewOpc = X86::CMP8ri;
8540 break;
8541 case X86::TEST16rr:
8542 NewOpc = X86::CMP16ri;
8543 break;
8544 case X86::TEST32rr:
8545 NewOpc = X86::CMP32ri;
8546 break;
8547 case X86::TEST64rr:
8548 NewOpc = X86::CMP64ri32;
8549 break;
8550 }
8551 // Change to CMPXXri r, 0 first.
8552 MI.setDesc(get(NewOpc));
8553 MI.getOperand(1).ChangeToImmediate(0);
8554 } else if (Ops.size() != 1)
8555 return nullptr;
8556
8557 // Make sure the subregisters match.
8558 // Otherwise we risk changing the size of the load.
8559 if (LoadMI.getOperand(0).getSubReg() != MI.getOperand(Ops[0]).getSubReg())
8560 return nullptr;
8561
8563 switch (LoadOpc) {
8564 case X86::MMX_SET0:
8565 case X86::V_SET0:
8566 case X86::V_SETALLONES:
8567 case X86::AVX2_SETALLONES:
8568 case X86::AVX1_SETALLONES:
8569 case X86::AVX512_128_SET0:
8570 case X86::AVX512_128_SETALLONES:
8571 case X86::AVX512_256_SETALLONES:
8572 case X86::AVX512_512_SETALLONES:
8573 case X86::FsFLD0SH:
8574 case X86::AVX512_FsFLD0SH:
8575 case X86::FsFLD0SD:
8576 case X86::AVX512_FsFLD0SD:
8577 case X86::FsFLD0SS:
8578 case X86::AVX512_FsFLD0SS:
8579 case X86::FsFLD0F128:
8580 case X86::AVX512_FsFLD0F128: {
8581 // Folding a V_SET0 or V_SETALLONES as a load, to ease register pressure.
8582 // Create a constant-pool entry and operands to load from it.
8583
8584 // Large code model can't fold loads this way.
8586 return nullptr;
8587
8588 // x86-32 PIC requires a PIC base register for constant pools.
8589 unsigned PICBase = 0;
8590 // Since we're using Small or Kernel code model, we can always use
8591 // RIP-relative addressing for a smaller encoding.
8592 if (Subtarget.is64Bit()) {
8593 PICBase = X86::RIP;
8594 } else if (MF.getTarget().isPositionIndependent()) {
8595 // FIXME: PICBase = getGlobalBaseReg(&MF);
8596 // This doesn't work for several reasons.
8597 // 1. GlobalBaseReg may have been spilled.
8598 // 2. It may not be live at MI.
8599 return nullptr;
8600 }
8601
8602 // Create a constant-pool entry.
8604 Type *Ty;
8605 bool IsAllOnes = false;
8606 switch (LoadOpc) {
8607 case X86::FsFLD0SS:
8608 case X86::AVX512_FsFLD0SS:
8610 break;
8611 case X86::FsFLD0SD:
8612 case X86::AVX512_FsFLD0SD:
8614 break;
8615 case X86::FsFLD0F128:
8616 case X86::AVX512_FsFLD0F128:
8618 break;
8619 case X86::FsFLD0SH:
8620 case X86::AVX512_FsFLD0SH:
8622 break;
8623 case X86::AVX512_512_SETALLONES:
8624 IsAllOnes = true;
8626 16);
8627 break;
8628 case X86::AVX1_SETALLONES:
8629 case X86::AVX2_SETALLONES:
8630 case X86::AVX512_256_SETALLONES:
8631 IsAllOnes = true;
8633 8);
8634
8635 break;
8636 case X86::MMX_SET0:
8638 2);
8639 break;
8640 case X86::V_SETALLONES:
8641 case X86::AVX512_128_SETALLONES:
8642 IsAllOnes = true;
8643 [[fallthrough]];
8644 case X86::V_SET0:
8645 case X86::AVX512_128_SET0:
8647 4);
8648 break;
8649 }
8650
8651 const Constant *C =
8653 unsigned CPI = MCP.getConstantPoolIndex(C, Alignment);
8654
8655 // Create operands to load from the constant pool entry.
8656 MOs.push_back(MachineOperand::CreateReg(PICBase, false));
8658 MOs.push_back(MachineOperand::CreateReg(0, false));
8660 MOs.push_back(MachineOperand::CreateReg(0, false));
8661 break;
8662 }
8663 case X86::VPBROADCASTBZ128rm:
8664 case X86::VPBROADCASTBZ256rm:
8665 case X86::VPBROADCASTBZrm:
8666 case X86::VBROADCASTF32X2Z256rm:
8667 case X86::VBROADCASTF32X2Zrm:
8668 case X86::VBROADCASTI32X2Z128rm:
8669 case X86::VBROADCASTI32X2Z256rm:
8670 case X86::VBROADCASTI32X2Zrm:
8671 // No instructions currently fuse with 8bits or 32bits x 2.
8672 return nullptr;
8673
8674#define FOLD_BROADCAST(SIZE) \
8675 MOs.append(LoadMI.operands_begin() + NumOps - X86::AddrNumOperands, \
8676 LoadMI.operands_begin() + NumOps); \
8677 return foldMemoryBroadcast(MF, MI, Ops[0], MOs, InsertPt, /*Size=*/SIZE, \
8678 /*AllowCommute=*/true);
8679 case X86::VPBROADCASTWZ128rm:
8680 case X86::VPBROADCASTWZ256rm:
8681 case X86::VPBROADCASTWZrm:
8682 FOLD_BROADCAST(16);
8683 case X86::VPBROADCASTDZ128rm:
8684 case X86::VPBROADCASTDZ256rm:
8685 case X86::VPBROADCASTDZrm:
8686 case X86::VBROADCASTSSZ128rm:
8687 case X86::VBROADCASTSSZ256rm:
8688 case X86::VBROADCASTSSZrm:
8689 FOLD_BROADCAST(32);
8690 case X86::VPBROADCASTQZ128rm:
8691 case X86::VPBROADCASTQZ256rm:
8692 case X86::VPBROADCASTQZrm:
8693 case X86::VBROADCASTSDZ256rm:
8694 case X86::VBROADCASTSDZrm:
8695 FOLD_BROADCAST(64);
8696 default: {
8697 if (isNonFoldablePartialRegisterLoad(LoadMI, MI, MF))
8698 return nullptr;
8699
8700 // Folding a normal load. Just copy the load's address operands.
8702 LoadMI.operands_begin() + NumOps);
8703 break;
8704 }
8705 }
8706 return foldMemoryOperandImpl(MF, MI, Ops[0], MOs, InsertPt,
8707 /*Size=*/0, Alignment, /*AllowCommute=*/true,
8708 CopyMI, VRM);
8709}
8710
8712X86InstrInfo::foldMemoryBroadcast(MachineFunction &MF, MachineInstr &MI,
8713 unsigned OpNum, ArrayRef<MachineOperand> MOs,
8715 unsigned BitsSize, bool AllowCommute) const {
8716
8717 if (auto *I = lookupBroadcastFoldTable(MI.getOpcode(), OpNum))
8718 return matchBroadcastSize(*I, BitsSize)
8719 ? fuseInst(MF, I->DstOp, OpNum, MOs, InsertPt, MI, *this)
8720 : nullptr;
8721
8722 if (AllowCommute) {
8723 // If the instruction and target operand are commutable, commute the
8724 // instruction and try again.
8725 unsigned CommuteOpIdx2 = commuteOperandsForFold(MI, OpNum);
8726 if (CommuteOpIdx2 == OpNum) {
8727 printFailMsgforFold(MI, OpNum);
8728 return nullptr;
8729 }
8730 MachineInstr *NewMI =
8731 foldMemoryBroadcast(MF, MI, CommuteOpIdx2, MOs, InsertPt, BitsSize,
8732 /*AllowCommute=*/false);
8733 if (NewMI)
8734 return NewMI;
8735 // Folding failed again - undo the commute before returning.
8736 commuteInstruction(MI, false, OpNum, CommuteOpIdx2);
8737 }
8738
8739 printFailMsgforFold(MI, OpNum);
8740 return nullptr;
8741}
8742
8746
8747 for (MachineMemOperand *MMO : MMOs) {
8748 if (!MMO->isLoad())
8749 continue;
8750
8751 if (!MMO->isStore()) {
8752 // Reuse the MMO.
8753 LoadMMOs.push_back(MMO);
8754 } else {
8755 // Clone the MMO and unset the store flag.
8756 LoadMMOs.push_back(MF.getMachineMemOperand(
8757 MMO, MMO->getFlags() & ~MachineMemOperand::MOStore));
8758 }
8759 }
8760
8761 return LoadMMOs;
8762}
8763
8767
8768 for (MachineMemOperand *MMO : MMOs) {
8769 if (!MMO->isStore())
8770 continue;
8771
8772 if (!MMO->isLoad()) {
8773 // Reuse the MMO.
8774 StoreMMOs.push_back(MMO);
8775 } else {
8776 // Clone the MMO and unset the load flag.
8777 StoreMMOs.push_back(MF.getMachineMemOperand(
8778 MMO, MMO->getFlags() & ~MachineMemOperand::MOLoad));
8779 }
8780 }
8781
8782 return StoreMMOs;
8783}
8784
8786 const TargetRegisterClass *RC,
8787 const X86Subtarget &STI) {
8788 assert(STI.hasAVX512() && "Expected at least AVX512!");
8789 unsigned SpillSize = STI.getRegisterInfo()->getSpillSize(*RC);
8790 assert((SpillSize == 64 || STI.hasVLX()) &&
8791 "Can't broadcast less than 64 bytes without AVX512VL!");
8792
8793#define CASE_BCAST_TYPE_OPC(TYPE, OP16, OP32, OP64) \
8794 case TYPE: \
8795 switch (SpillSize) { \
8796 default: \
8797 llvm_unreachable("Unknown spill size"); \
8798 case 16: \
8799 return X86::OP16; \
8800 case 32: \
8801 return X86::OP32; \
8802 case 64: \
8803 return X86::OP64; \
8804 } \
8805 break;
8806
8807 switch (I->Flags & TB_BCAST_MASK) {
8808 default:
8809 llvm_unreachable("Unexpected broadcast type!");
8810 CASE_BCAST_TYPE_OPC(TB_BCAST_W, VPBROADCASTWZ128rm, VPBROADCASTWZ256rm,
8811 VPBROADCASTWZrm)
8812 CASE_BCAST_TYPE_OPC(TB_BCAST_D, VPBROADCASTDZ128rm, VPBROADCASTDZ256rm,
8813 VPBROADCASTDZrm)
8814 CASE_BCAST_TYPE_OPC(TB_BCAST_Q, VPBROADCASTQZ128rm, VPBROADCASTQZ256rm,
8815 VPBROADCASTQZrm)
8816 CASE_BCAST_TYPE_OPC(TB_BCAST_SH, VPBROADCASTWZ128rm, VPBROADCASTWZ256rm,
8817 VPBROADCASTWZrm)
8818 CASE_BCAST_TYPE_OPC(TB_BCAST_SS, VBROADCASTSSZ128rm, VBROADCASTSSZ256rm,
8819 VBROADCASTSSZrm)
8820 CASE_BCAST_TYPE_OPC(TB_BCAST_SD, VMOVDDUPZ128rm, VBROADCASTSDZ256rm,
8821 VBROADCASTSDZrm)
8822 }
8823}
8824
8826 MachineFunction &MF, MachineInstr &MI, Register Reg, bool UnfoldLoad,
8827 bool UnfoldStore, SmallVectorImpl<MachineInstr *> &NewMIs) const {
8828 const X86FoldTableEntry *I = lookupUnfoldTable(MI.getOpcode());
8829 if (I == nullptr)
8830 return false;
8831 unsigned Opc = I->DstOp;
8832 unsigned Index = I->Flags & TB_INDEX_MASK;
8833 bool FoldedLoad = I->Flags & TB_FOLDED_LOAD;
8834 bool FoldedStore = I->Flags & TB_FOLDED_STORE;
8835 if (UnfoldLoad && !FoldedLoad)
8836 return false;
8837 UnfoldLoad &= FoldedLoad;
8838 if (UnfoldStore && !FoldedStore)
8839 return false;
8840 UnfoldStore &= FoldedStore;
8841
8842 const MCInstrDesc &MCID = get(Opc);
8843
8844 const TargetRegisterClass *RC = getRegClass(MCID, Index);
8846 // TODO: Check if 32-byte or greater accesses are slow too?
8847 if (!MI.hasOneMemOperand() && RC == &X86::VR128RegClass &&
8848 Subtarget.isUnalignedMem16Slow())
8849 // Without memoperands, loadRegFromAddr and storeRegToStackSlot will
8850 // conservatively assume the address is unaligned. That's bad for
8851 // performance.
8852 return false;
8857 for (unsigned i = 0, e = MI.getNumOperands(); i != e; ++i) {
8858 MachineOperand &Op = MI.getOperand(i);
8859 if (i >= Index && i < Index + X86::AddrNumOperands)
8860 AddrOps.push_back(Op);
8861 else if (Op.isReg() && Op.isImplicit())
8862 ImpOps.push_back(Op);
8863 else if (i < Index)
8864 BeforeOps.push_back(Op);
8865 else if (i > Index)
8866 AfterOps.push_back(Op);
8867 }
8868
8869 // Emit the load or broadcast instruction.
8870 if (UnfoldLoad) {
8871 auto MMOs = extractLoadMMOs(MI.memoperands(), MF);
8872
8873 unsigned Opc;
8874 if (I->Flags & TB_BCAST_MASK) {
8875 Opc = getBroadcastOpcode(I, RC, Subtarget);
8876 } else {
8877 unsigned Alignment = std::max<uint32_t>(TRI.getSpillSize(*RC), 16);
8878 bool isAligned = !MMOs.empty() && MMOs.front()->getAlign() >= Alignment;
8879 Opc = getLoadRegOpcode(Reg, RC, isAligned, Subtarget);
8880 }
8881
8882 DebugLoc DL;
8883 MachineInstrBuilder MIB = BuildMI(MF, DL, get(Opc), Reg);
8884 for (const MachineOperand &AddrOp : AddrOps)
8885 MIB.add(AddrOp);
8886 MIB.setMemRefs(MMOs);
8887 NewMIs.push_back(MIB);
8888
8889 if (UnfoldStore) {
8890 // Address operands cannot be marked isKill.
8891 for (unsigned i = 1; i != 1 + X86::AddrNumOperands; ++i) {
8892 MachineOperand &MO = NewMIs[0]->getOperand(i);
8893 if (MO.isReg())
8894 MO.setIsKill(false);
8895 }
8896 }
8897 }
8898
8899 // Emit the data processing instruction.
8900 MachineInstr *DataMI = MF.CreateMachineInstr(MCID, MI.getDebugLoc(), true);
8901 MachineInstrBuilder MIB(MF, DataMI);
8902
8903 if (FoldedStore)
8904 MIB.addReg(Reg, RegState::Define);
8905 for (MachineOperand &BeforeOp : BeforeOps)
8906 MIB.add(BeforeOp);
8907 if (FoldedLoad)
8908 MIB.addReg(Reg);
8909 for (MachineOperand &AfterOp : AfterOps)
8910 MIB.add(AfterOp);
8911 for (MachineOperand &ImpOp : ImpOps) {
8912 MIB.addReg(ImpOp.getReg(), getDefRegState(ImpOp.isDef()) |
8914 getKillRegState(ImpOp.isKill()) |
8915 getDeadRegState(ImpOp.isDead()) |
8916 getUndefRegState(ImpOp.isUndef()));
8917 }
8918 // Change CMP32ri r, 0 back to TEST32rr r, r, etc.
8919 switch (DataMI->getOpcode()) {
8920 default:
8921 break;
8922 case X86::CMP64ri32:
8923 case X86::CMP32ri:
8924 case X86::CMP16ri:
8925 case X86::CMP8ri: {
8926 MachineOperand &MO0 = DataMI->getOperand(0);
8927 MachineOperand &MO1 = DataMI->getOperand(1);
8928 if (MO1.isImm() && MO1.getImm() == 0) {
8929 unsigned NewOpc;
8930 switch (DataMI->getOpcode()) {
8931 default:
8932 llvm_unreachable("Unreachable!");
8933 case X86::CMP64ri32:
8934 NewOpc = X86::TEST64rr;
8935 break;
8936 case X86::CMP32ri:
8937 NewOpc = X86::TEST32rr;
8938 break;
8939 case X86::CMP16ri:
8940 NewOpc = X86::TEST16rr;
8941 break;
8942 case X86::CMP8ri:
8943 NewOpc = X86::TEST8rr;
8944 break;
8945 }
8946 DataMI->setDesc(get(NewOpc));
8947 MO1.ChangeToRegister(MO0.getReg(), false);
8948 }
8949 }
8950 }
8951 NewMIs.push_back(DataMI);
8952
8953 // Emit the store instruction.
8954 if (UnfoldStore) {
8955 const TargetRegisterClass *DstRC = getRegClass(MCID, 0);
8956 auto MMOs = extractStoreMMOs(MI.memoperands(), MF);
8957 unsigned Alignment = std::max<uint32_t>(TRI.getSpillSize(*DstRC), 16);
8958 bool isAligned = !MMOs.empty() && MMOs.front()->getAlign() >= Alignment;
8959 unsigned Opc = getStoreRegOpcode(Reg, DstRC, isAligned, Subtarget);
8960 DebugLoc DL;
8961 MachineInstrBuilder MIB = BuildMI(MF, DL, get(Opc));
8962 for (const MachineOperand &AddrOp : AddrOps)
8963 MIB.add(AddrOp);
8964 MIB.addReg(Reg, RegState::Kill);
8965 MIB.setMemRefs(MMOs);
8966 NewMIs.push_back(MIB);
8967 }
8968
8969 return true;
8970}
8971
8973 SelectionDAG &DAG, SDNode *N, SmallVectorImpl<SDNode *> &NewNodes) const {
8974 if (!N->isMachineOpcode())
8975 return false;
8976
8977 const X86FoldTableEntry *I = lookupUnfoldTable(N->getMachineOpcode());
8978 if (I == nullptr)
8979 return false;
8980 unsigned Opc = I->DstOp;
8981 unsigned Index = I->Flags & TB_INDEX_MASK;
8982 bool FoldedLoad = I->Flags & TB_FOLDED_LOAD;
8983 bool FoldedStore = I->Flags & TB_FOLDED_STORE;
8984 const MCInstrDesc &MCID = get(Opc);
8987 const TargetRegisterClass *RC = getRegClass(MCID, Index);
8988 unsigned NumDefs = MCID.NumDefs;
8989 std::vector<SDValue> AddrOps;
8990 std::vector<SDValue> BeforeOps;
8991 std::vector<SDValue> AfterOps;
8992 SDLoc dl(N);
8993 unsigned NumOps = N->getNumOperands();
8994 for (unsigned i = 0; i != NumOps - 1; ++i) {
8995 SDValue Op = N->getOperand(i);
8996 if (i >= Index - NumDefs && i < Index - NumDefs + X86::AddrNumOperands)
8997 AddrOps.push_back(Op);
8998 else if (i < Index - NumDefs)
8999 BeforeOps.push_back(Op);
9000 else if (i > Index - NumDefs)
9001 AfterOps.push_back(Op);
9002 }
9003 SDValue Chain = N->getOperand(NumOps - 1);
9004 AddrOps.push_back(Chain);
9005
9006 // Emit the load instruction.
9007 SDNode *Load = nullptr;
9008 if (FoldedLoad) {
9009 EVT VT = *TRI.legalclasstypes_begin(*RC);
9010 auto MMOs = extractLoadMMOs(cast<MachineSDNode>(N)->memoperands(), MF);
9011 if (MMOs.empty() && RC == &X86::VR128RegClass &&
9012 Subtarget.isUnalignedMem16Slow())
9013 // Do not introduce a slow unaligned load.
9014 return false;
9015 // FIXME: If a VR128 can have size 32, we should be checking if a 32-byte
9016 // memory access is slow above.
9017
9018 unsigned Opc;
9019 if (I->Flags & TB_BCAST_MASK) {
9020 Opc = getBroadcastOpcode(I, RC, Subtarget);
9021 } else {
9022 unsigned Alignment = std::max<uint32_t>(TRI.getSpillSize(*RC), 16);
9023 bool isAligned = !MMOs.empty() && MMOs.front()->getAlign() >= Alignment;
9024 Opc = getLoadRegOpcode(0, RC, isAligned, Subtarget);
9025 }
9026
9027 Load = DAG.getMachineNode(Opc, dl, VT, MVT::Other, AddrOps);
9028 NewNodes.push_back(Load);
9029
9030 // Preserve memory reference information.
9032 }
9033
9034 // Emit the data processing instruction.
9035 std::vector<EVT> VTs;
9036 const TargetRegisterClass *DstRC = nullptr;
9037 if (MCID.getNumDefs() > 0) {
9038 DstRC = getRegClass(MCID, 0);
9039 VTs.push_back(*TRI.legalclasstypes_begin(*DstRC));
9040 }
9041 for (unsigned i = 0, e = N->getNumValues(); i != e; ++i) {
9042 EVT VT = N->getValueType(i);
9043 if (VT != MVT::Other && i >= (unsigned)MCID.getNumDefs())
9044 VTs.push_back(VT);
9045 }
9046 if (Load)
9047 BeforeOps.push_back(SDValue(Load, 0));
9048 llvm::append_range(BeforeOps, AfterOps);
9049 // Change CMP32ri r, 0 back to TEST32rr r, r, etc.
9050 switch (Opc) {
9051 default:
9052 break;
9053 case X86::CMP64ri32:
9054 case X86::CMP32ri:
9055 case X86::CMP16ri:
9056 case X86::CMP8ri:
9057 if (isNullConstant(BeforeOps[1])) {
9058 switch (Opc) {
9059 default:
9060 llvm_unreachable("Unreachable!");
9061 case X86::CMP64ri32:
9062 Opc = X86::TEST64rr;
9063 break;
9064 case X86::CMP32ri:
9065 Opc = X86::TEST32rr;
9066 break;
9067 case X86::CMP16ri:
9068 Opc = X86::TEST16rr;
9069 break;
9070 case X86::CMP8ri:
9071 Opc = X86::TEST8rr;
9072 break;
9073 }
9074 BeforeOps[1] = BeforeOps[0];
9075 }
9076 }
9077 SDNode *NewNode = DAG.getMachineNode(Opc, dl, VTs, BeforeOps);
9078 NewNodes.push_back(NewNode);
9079
9080 // Emit the store instruction.
9081 if (FoldedStore) {
9082 AddrOps.pop_back();
9083 AddrOps.push_back(SDValue(NewNode, 0));
9084 AddrOps.push_back(Chain);
9085 auto MMOs = extractStoreMMOs(cast<MachineSDNode>(N)->memoperands(), MF);
9086 if (MMOs.empty() && RC == &X86::VR128RegClass &&
9087 Subtarget.isUnalignedMem16Slow())
9088 // Do not introduce a slow unaligned store.
9089 return false;
9090 // FIXME: If a VR128 can have size 32, we should be checking if a 32-byte
9091 // memory access is slow above.
9092 unsigned Alignment = std::max<uint32_t>(TRI.getSpillSize(*RC), 16);
9093 bool isAligned = !MMOs.empty() && MMOs.front()->getAlign() >= Alignment;
9094 SDNode *Store =
9095 DAG.getMachineNode(getStoreRegOpcode(0, DstRC, isAligned, Subtarget),
9096 dl, MVT::Other, AddrOps);
9097 NewNodes.push_back(Store);
9098
9099 // Preserve memory reference information.
9101 }
9102
9103 return true;
9104}
9105
9106unsigned
9108 bool UnfoldStore,
9109 unsigned *LoadRegIndex) const {
9111 if (I == nullptr)
9112 return 0;
9113 bool FoldedLoad = I->Flags & TB_FOLDED_LOAD;
9114 bool FoldedStore = I->Flags & TB_FOLDED_STORE;
9115 if (UnfoldLoad && !FoldedLoad)
9116 return 0;
9117 if (UnfoldStore && !FoldedStore)
9118 return 0;
9119 if (LoadRegIndex)
9120 *LoadRegIndex = I->Flags & TB_INDEX_MASK;
9121 return I->DstOp;
9122}
9123
9125 int64_t &Offset1,
9126 int64_t &Offset2) const {
9127 if (!Load1->isMachineOpcode() || !Load2->isMachineOpcode())
9128 return false;
9129
9130 auto IsLoadOpcode = [&](unsigned Opcode) {
9131 switch (Opcode) {
9132 default:
9133 return false;
9134 case X86::MOV8rm:
9135 case X86::MOV16rm:
9136 case X86::MOV32rm:
9137 case X86::MOV64rm:
9138 case X86::LD_Fp32m:
9139 case X86::LD_Fp64m:
9140 case X86::LD_Fp80m:
9141 case X86::MOVSSrm:
9142 case X86::MOVSSrm_alt:
9143 case X86::MOVSDrm:
9144 case X86::MOVSDrm_alt:
9145 case X86::MMX_MOVD64rm:
9146 case X86::MMX_MOVQ64rm:
9147 case X86::MOVAPSrm:
9148 case X86::MOVUPSrm:
9149 case X86::MOVAPDrm:
9150 case X86::MOVUPDrm:
9151 case X86::MOVDQArm:
9152 case X86::MOVDQUrm:
9153 // AVX load instructions
9154 case X86::VMOVSSrm:
9155 case X86::VMOVSSrm_alt:
9156 case X86::VMOVSDrm:
9157 case X86::VMOVSDrm_alt:
9158 case X86::VMOVAPSrm:
9159 case X86::VMOVUPSrm:
9160 case X86::VMOVAPDrm:
9161 case X86::VMOVUPDrm:
9162 case X86::VMOVDQArm:
9163 case X86::VMOVDQUrm:
9164 case X86::VMOVAPSYrm:
9165 case X86::VMOVUPSYrm:
9166 case X86::VMOVAPDYrm:
9167 case X86::VMOVUPDYrm:
9168 case X86::VMOVDQAYrm:
9169 case X86::VMOVDQUYrm:
9170 // AVX512 load instructions
9171 case X86::VMOVSSZrm:
9172 case X86::VMOVSSZrm_alt:
9173 case X86::VMOVSDZrm:
9174 case X86::VMOVSDZrm_alt:
9175 case X86::VMOVAPSZ128rm:
9176 case X86::VMOVUPSZ128rm:
9177 case X86::VMOVAPSZ128rm_NOVLX:
9178 case X86::VMOVUPSZ128rm_NOVLX:
9179 case X86::VMOVAPDZ128rm:
9180 case X86::VMOVUPDZ128rm:
9181 case X86::VMOVDQU8Z128rm:
9182 case X86::VMOVDQU16Z128rm:
9183 case X86::VMOVDQA32Z128rm:
9184 case X86::VMOVDQU32Z128rm:
9185 case X86::VMOVDQA64Z128rm:
9186 case X86::VMOVDQU64Z128rm:
9187 case X86::VMOVAPSZ256rm:
9188 case X86::VMOVUPSZ256rm:
9189 case X86::VMOVAPSZ256rm_NOVLX:
9190 case X86::VMOVUPSZ256rm_NOVLX:
9191 case X86::VMOVAPDZ256rm:
9192 case X86::VMOVUPDZ256rm:
9193 case X86::VMOVDQU8Z256rm:
9194 case X86::VMOVDQU16Z256rm:
9195 case X86::VMOVDQA32Z256rm:
9196 case X86::VMOVDQU32Z256rm:
9197 case X86::VMOVDQA64Z256rm:
9198 case X86::VMOVDQU64Z256rm:
9199 case X86::VMOVAPSZrm:
9200 case X86::VMOVUPSZrm:
9201 case X86::VMOVAPDZrm:
9202 case X86::VMOVUPDZrm:
9203 case X86::VMOVDQU8Zrm:
9204 case X86::VMOVDQU16Zrm:
9205 case X86::VMOVDQA32Zrm:
9206 case X86::VMOVDQU32Zrm:
9207 case X86::VMOVDQA64Zrm:
9208 case X86::VMOVDQU64Zrm:
9209 case X86::KMOVBkm:
9210 case X86::KMOVBkm_EVEX:
9211 case X86::KMOVWkm:
9212 case X86::KMOVWkm_EVEX:
9213 case X86::KMOVDkm:
9214 case X86::KMOVDkm_EVEX:
9215 case X86::KMOVQkm:
9216 case X86::KMOVQkm_EVEX:
9217 return true;
9218 }
9219 };
9220
9221 if (!IsLoadOpcode(Load1->getMachineOpcode()) ||
9222 !IsLoadOpcode(Load2->getMachineOpcode()))
9223 return false;
9224
9225 // Lambda to check if both the loads have the same value for an operand index.
9226 auto HasSameOp = [&](int I) {
9227 return Load1->getOperand(I) == Load2->getOperand(I);
9228 };
9229
9230 // All operands except the displacement should match.
9231 if (!HasSameOp(X86::AddrBaseReg) || !HasSameOp(X86::AddrScaleAmt) ||
9232 !HasSameOp(X86::AddrIndexReg) || !HasSameOp(X86::AddrSegmentReg))
9233 return false;
9234
9235 // Chain Operand must be the same.
9236 if (!HasSameOp(5))
9237 return false;
9238
9239 // Now let's examine if the displacements are constants.
9242 if (!Disp1 || !Disp2)
9243 return false;
9244
9245 Offset1 = Disp1->getSExtValue();
9246 Offset2 = Disp2->getSExtValue();
9247 return true;
9248}
9249
9251 int64_t Offset1, int64_t Offset2,
9252 unsigned NumLoads) const {
9253 assert(Offset2 > Offset1);
9254 if ((Offset2 - Offset1) / 8 > 64)
9255 return false;
9256
9257 unsigned Opc1 = Load1->getMachineOpcode();
9258 unsigned Opc2 = Load2->getMachineOpcode();
9259 if (Opc1 != Opc2)
9260 return false; // FIXME: overly conservative?
9261
9262 switch (Opc1) {
9263 default:
9264 break;
9265 case X86::LD_Fp32m:
9266 case X86::LD_Fp64m:
9267 case X86::LD_Fp80m:
9268 case X86::MMX_MOVD64rm:
9269 case X86::MMX_MOVQ64rm:
9270 return false;
9271 }
9272
9273 EVT VT = Load1->getValueType(0);
9274 switch (VT.getSimpleVT().SimpleTy) {
9275 default:
9276 // XMM registers. In 64-bit mode we can be a bit more aggressive since we
9277 // have 16 of them to play with.
9278 if (Subtarget.is64Bit()) {
9279 if (NumLoads >= 3)
9280 return false;
9281 } else if (NumLoads) {
9282 return false;
9283 }
9284 break;
9285 case MVT::i8:
9286 case MVT::i16:
9287 case MVT::i32:
9288 case MVT::i64:
9289 case MVT::f32:
9290 case MVT::f64:
9291 if (NumLoads)
9292 return false;
9293 break;
9294 }
9295
9296 return true;
9297}
9298
9300 const MachineBasicBlock *MBB,
9301 const MachineFunction &MF) const {
9302
9303 // ENDBR instructions should not be scheduled around.
9304 unsigned Opcode = MI.getOpcode();
9305 if (Opcode == X86::ENDBR64 || Opcode == X86::ENDBR32 ||
9306 Opcode == X86::PLDTILECFGV)
9307 return true;
9308
9309 // Frame setup and destroy can't be scheduled around.
9310 if (MI.getFlag(MachineInstr::FrameSetup) ||
9312 return true;
9313
9315}
9316
9319 assert(Cond.size() == 1 && "Invalid X86 branch condition!");
9320 X86::CondCode CC = static_cast<X86::CondCode>(Cond[0].getImm());
9321 Cond[0].setImm(GetOppositeBranchCondition(CC));
9322 return false;
9323}
9324
9326 const TargetRegisterClass *RC) const {
9327 // FIXME: Return false for x87 stack register classes for now. We can't
9328 // allow any loads of these registers before FpGet_ST0_80.
9329 return !(RC == &X86::CCRRegClass || RC == &X86::DFCCRRegClass ||
9330 RC == &X86::RFP32RegClass || RC == &X86::RFP64RegClass ||
9331 RC == &X86::RFP80RegClass);
9332}
9333
9334/// Return a virtual register initialized with the
9335/// the global base register value. Output instructions required to
9336/// initialize the register in the function entry block, if necessary.
9337///
9338/// TODO: Eliminate this and move the code to X86MachineFunctionInfo.
9339///
9342 Register GlobalBaseReg = X86FI->getGlobalBaseReg();
9343 if (GlobalBaseReg)
9344 return GlobalBaseReg;
9345
9346 // Create the register. The code to initialize it is inserted
9347 // later, by the CGBR pass (below).
9348 MachineRegisterInfo &RegInfo = MF->getRegInfo();
9349 GlobalBaseReg = RegInfo.createVirtualRegister(
9350 Subtarget.is64Bit() ? &X86::GR64_NOSPRegClass : &X86::GR32_NOSPRegClass);
9351 X86FI->setGlobalBaseReg(GlobalBaseReg);
9352 return GlobalBaseReg;
9353}
9354
9355// FIXME: Some shuffle and unpack instructions have equivalents in different
9356// domains, but they require a bit more work than just switching opcodes.
9357
9358static const uint16_t *lookup(unsigned opcode, unsigned domain,
9359 ArrayRef<uint16_t[3]> Table) {
9360 for (const uint16_t(&Row)[3] : Table)
9361 if (Row[domain - 1] == opcode)
9362 return Row;
9363 return nullptr;
9364}
9365
9366static const uint16_t *lookupAVX512(unsigned opcode, unsigned domain,
9367 ArrayRef<uint16_t[4]> Table) {
9368 // If this is the integer domain make sure to check both integer columns.
9369 for (const uint16_t(&Row)[4] : Table)
9370 if (Row[domain - 1] == opcode || (domain == 3 && Row[3] == opcode))
9371 return Row;
9372 return nullptr;
9373}
9374
9375// Helper to attempt to widen/narrow blend masks.
9376static bool AdjustBlendMask(unsigned OldMask, unsigned OldWidth,
9377 unsigned NewWidth, unsigned *pNewMask = nullptr) {
9378 assert(((OldWidth % NewWidth) == 0 || (NewWidth % OldWidth) == 0) &&
9379 "Illegal blend mask scale");
9380 unsigned NewMask = 0;
9381
9382 if ((OldWidth % NewWidth) == 0) {
9383 unsigned Scale = OldWidth / NewWidth;
9384 unsigned SubMask = (1u << Scale) - 1;
9385 for (unsigned i = 0; i != NewWidth; ++i) {
9386 unsigned Sub = (OldMask >> (i * Scale)) & SubMask;
9387 if (Sub == SubMask)
9388 NewMask |= (1u << i);
9389 else if (Sub != 0x0)
9390 return false;
9391 }
9392 } else {
9393 unsigned Scale = NewWidth / OldWidth;
9394 unsigned SubMask = (1u << Scale) - 1;
9395 for (unsigned i = 0; i != OldWidth; ++i) {
9396 if (OldMask & (1 << i)) {
9397 NewMask |= (SubMask << (i * Scale));
9398 }
9399 }
9400 }
9401
9402 if (pNewMask)
9403 *pNewMask = NewMask;
9404 return true;
9405}
9406
9408 unsigned Opcode = MI.getOpcode();
9409 unsigned NumOperands = MI.getDesc().getNumOperands();
9410
9411 auto GetBlendDomains = [&](unsigned ImmWidth, bool Is256) {
9412 uint16_t validDomains = 0;
9413 if (MI.getOperand(NumOperands - 1).isImm()) {
9414 unsigned Imm = MI.getOperand(NumOperands - 1).getImm();
9415 if (AdjustBlendMask(Imm, ImmWidth, Is256 ? 8 : 4))
9416 validDomains |= 0x2; // PackedSingle
9417 if (AdjustBlendMask(Imm, ImmWidth, Is256 ? 4 : 2))
9418 validDomains |= 0x4; // PackedDouble
9419 if (!Is256 || Subtarget.hasAVX2())
9420 validDomains |= 0x8; // PackedInt
9421 }
9422 return validDomains;
9423 };
9424
9425 switch (Opcode) {
9426 case X86::BLENDPDrmi:
9427 case X86::BLENDPDrri:
9428 case X86::VBLENDPDrmi:
9429 case X86::VBLENDPDrri:
9430 return GetBlendDomains(2, false);
9431 case X86::VBLENDPDYrmi:
9432 case X86::VBLENDPDYrri:
9433 return GetBlendDomains(4, true);
9434 case X86::BLENDPSrmi:
9435 case X86::BLENDPSrri:
9436 case X86::VBLENDPSrmi:
9437 case X86::VBLENDPSrri:
9438 case X86::VPBLENDDrmi:
9439 case X86::VPBLENDDrri:
9440 return GetBlendDomains(4, false);
9441 case X86::VBLENDPSYrmi:
9442 case X86::VBLENDPSYrri:
9443 case X86::VPBLENDDYrmi:
9444 case X86::VPBLENDDYrri:
9445 return GetBlendDomains(8, true);
9446 case X86::PBLENDWrmi:
9447 case X86::PBLENDWrri:
9448 case X86::VPBLENDWrmi:
9449 case X86::VPBLENDWrri:
9450 // Treat VPBLENDWY as a 128-bit vector as it repeats the lo/hi masks.
9451 case X86::VPBLENDWYrmi:
9452 case X86::VPBLENDWYrri:
9453 return GetBlendDomains(8, false);
9454 case X86::VPANDDZ128rr:
9455 case X86::VPANDDZ128rm:
9456 case X86::VPANDDZ256rr:
9457 case X86::VPANDDZ256rm:
9458 case X86::VPANDQZ128rr:
9459 case X86::VPANDQZ128rm:
9460 case X86::VPANDQZ256rr:
9461 case X86::VPANDQZ256rm:
9462 case X86::VPANDNDZ128rr:
9463 case X86::VPANDNDZ128rm:
9464 case X86::VPANDNDZ256rr:
9465 case X86::VPANDNDZ256rm:
9466 case X86::VPANDNQZ128rr:
9467 case X86::VPANDNQZ128rm:
9468 case X86::VPANDNQZ256rr:
9469 case X86::VPANDNQZ256rm:
9470 case X86::VPORDZ128rr:
9471 case X86::VPORDZ128rm:
9472 case X86::VPORDZ256rr:
9473 case X86::VPORDZ256rm:
9474 case X86::VPORQZ128rr:
9475 case X86::VPORQZ128rm:
9476 case X86::VPORQZ256rr:
9477 case X86::VPORQZ256rm:
9478 case X86::VPXORDZ128rr:
9479 case X86::VPXORDZ128rm:
9480 case X86::VPXORDZ256rr:
9481 case X86::VPXORDZ256rm:
9482 case X86::VPXORQZ128rr:
9483 case X86::VPXORQZ128rm:
9484 case X86::VPXORQZ256rr:
9485 case X86::VPXORQZ256rm:
9486 // If we don't have DQI see if we can still switch from an EVEX integer
9487 // instruction to a VEX floating point instruction.
9488 if (Subtarget.hasDQI())
9489 return 0;
9490
9491 if (RI.getEncodingValue(MI.getOperand(0).getReg()) >= 16)
9492 return 0;
9493 if (RI.getEncodingValue(MI.getOperand(1).getReg()) >= 16)
9494 return 0;
9495 // Register forms will have 3 operands. Memory form will have more.
9496 if (NumOperands == 3 &&
9497 RI.getEncodingValue(MI.getOperand(2).getReg()) >= 16)
9498 return 0;
9499
9500 // All domains are valid.
9501 return 0xe;
9502 case X86::MOVHLPSrr:
9503 // We can swap domains when both inputs are the same register.
9504 // FIXME: This doesn't catch all the cases we would like. If the input
9505 // register isn't KILLed by the instruction, the two address instruction
9506 // pass puts a COPY on one input. The other input uses the original
9507 // register. This prevents the same physical register from being used by
9508 // both inputs.
9509 if (MI.getOperand(1).getReg() == MI.getOperand(2).getReg() &&
9510 MI.getOperand(0).getSubReg() == 0 &&
9511 MI.getOperand(1).getSubReg() == 0 && MI.getOperand(2).getSubReg() == 0)
9512 return 0x6;
9513 return 0;
9514 case X86::SHUFPDrri:
9515 return 0x6;
9516 }
9517 return 0;
9518}
9519
9520#include "X86ReplaceableInstrs.def"
9521
9523 unsigned Domain) const {
9524 assert(Domain > 0 && Domain < 4 && "Invalid execution domain");
9525 uint16_t dom = (MI.getDesc().TSFlags >> X86II::SSEDomainShift) & 3;
9526 assert(dom && "Not an SSE instruction");
9527
9528 unsigned Opcode = MI.getOpcode();
9529 unsigned NumOperands = MI.getDesc().getNumOperands();
9530
9531 auto SetBlendDomain = [&](unsigned ImmWidth, bool Is256) {
9532 if (MI.getOperand(NumOperands - 1).isImm()) {
9533 unsigned Imm = MI.getOperand(NumOperands - 1).getImm() & 255;
9534 Imm = (ImmWidth == 16 ? ((Imm << 8) | Imm) : Imm);
9535 unsigned NewImm = Imm;
9536
9537 const uint16_t *table = lookup(Opcode, dom, ReplaceableBlendInstrs);
9538 if (!table)
9539 table = lookup(Opcode, dom, ReplaceableBlendAVX2Instrs);
9540
9541 if (Domain == 1) { // PackedSingle
9542 AdjustBlendMask(Imm, ImmWidth, Is256 ? 8 : 4, &NewImm);
9543 } else if (Domain == 2) { // PackedDouble
9544 AdjustBlendMask(Imm, ImmWidth, Is256 ? 4 : 2, &NewImm);
9545 } else if (Domain == 3) { // PackedInt
9546 if (Subtarget.hasAVX2()) {
9547 // If we are already VPBLENDW use that, else use VPBLENDD.
9548 if ((ImmWidth / (Is256 ? 2 : 1)) != 8) {
9549 table = lookup(Opcode, dom, ReplaceableBlendAVX2Instrs);
9550 AdjustBlendMask(Imm, ImmWidth, Is256 ? 8 : 4, &NewImm);
9551 }
9552 } else {
9553 assert(!Is256 && "128-bit vector expected");
9554 AdjustBlendMask(Imm, ImmWidth, 8, &NewImm);
9555 }
9556 }
9557
9558 assert(table && table[Domain - 1] && "Unknown domain op");
9559 MI.setDesc(get(table[Domain - 1]));
9560 MI.getOperand(NumOperands - 1).setImm(NewImm & 255);
9561 }
9562 return true;
9563 };
9564
9565 switch (Opcode) {
9566 case X86::BLENDPDrmi:
9567 case X86::BLENDPDrri:
9568 case X86::VBLENDPDrmi:
9569 case X86::VBLENDPDrri:
9570 return SetBlendDomain(2, false);
9571 case X86::VBLENDPDYrmi:
9572 case X86::VBLENDPDYrri:
9573 return SetBlendDomain(4, true);
9574 case X86::BLENDPSrmi:
9575 case X86::BLENDPSrri:
9576 case X86::VBLENDPSrmi:
9577 case X86::VBLENDPSrri:
9578 case X86::VPBLENDDrmi:
9579 case X86::VPBLENDDrri:
9580 return SetBlendDomain(4, false);
9581 case X86::VBLENDPSYrmi:
9582 case X86::VBLENDPSYrri:
9583 case X86::VPBLENDDYrmi:
9584 case X86::VPBLENDDYrri:
9585 return SetBlendDomain(8, true);
9586 case X86::PBLENDWrmi:
9587 case X86::PBLENDWrri:
9588 case X86::VPBLENDWrmi:
9589 case X86::VPBLENDWrri:
9590 return SetBlendDomain(8, false);
9591 case X86::VPBLENDWYrmi:
9592 case X86::VPBLENDWYrri:
9593 return SetBlendDomain(16, true);
9594 case X86::VPANDDZ128rr:
9595 case X86::VPANDDZ128rm:
9596 case X86::VPANDDZ256rr:
9597 case X86::VPANDDZ256rm:
9598 case X86::VPANDQZ128rr:
9599 case X86::VPANDQZ128rm:
9600 case X86::VPANDQZ256rr:
9601 case X86::VPANDQZ256rm:
9602 case X86::VPANDNDZ128rr:
9603 case X86::VPANDNDZ128rm:
9604 case X86::VPANDNDZ256rr:
9605 case X86::VPANDNDZ256rm:
9606 case X86::VPANDNQZ128rr:
9607 case X86::VPANDNQZ128rm:
9608 case X86::VPANDNQZ256rr:
9609 case X86::VPANDNQZ256rm:
9610 case X86::VPORDZ128rr:
9611 case X86::VPORDZ128rm:
9612 case X86::VPORDZ256rr:
9613 case X86::VPORDZ256rm:
9614 case X86::VPORQZ128rr:
9615 case X86::VPORQZ128rm:
9616 case X86::VPORQZ256rr:
9617 case X86::VPORQZ256rm:
9618 case X86::VPXORDZ128rr:
9619 case X86::VPXORDZ128rm:
9620 case X86::VPXORDZ256rr:
9621 case X86::VPXORDZ256rm:
9622 case X86::VPXORQZ128rr:
9623 case X86::VPXORQZ128rm:
9624 case X86::VPXORQZ256rr:
9625 case X86::VPXORQZ256rm: {
9626 // Without DQI, convert EVEX instructions to VEX instructions.
9627 if (Subtarget.hasDQI())
9628 return false;
9629
9630 const uint16_t *table =
9631 lookupAVX512(MI.getOpcode(), dom, ReplaceableCustomAVX512LogicInstrs);
9632 assert(table && "Instruction not found in table?");
9633 // Don't change integer Q instructions to D instructions and
9634 // use D intructions if we started with a PS instruction.
9635 if (Domain == 3 && (dom == 1 || table[3] == MI.getOpcode()))
9636 Domain = 4;
9637 MI.setDesc(get(table[Domain - 1]));
9638 return true;
9639 }
9640 case X86::UNPCKHPDrr:
9641 case X86::MOVHLPSrr:
9642 // We just need to commute the instruction which will switch the domains.
9643 if (Domain != dom && Domain != 3 &&
9644 MI.getOperand(1).getReg() == MI.getOperand(2).getReg() &&
9645 MI.getOperand(0).getSubReg() == 0 &&
9646 MI.getOperand(1).getSubReg() == 0 &&
9647 MI.getOperand(2).getSubReg() == 0) {
9648 commuteInstruction(MI, false);
9649 return true;
9650 }
9651 // We must always return true for MOVHLPSrr.
9652 if (Opcode == X86::MOVHLPSrr)
9653 return true;
9654 break;
9655 case X86::SHUFPDrri: {
9656 if (Domain == 1) {
9657 unsigned Imm = MI.getOperand(3).getImm();
9658 unsigned NewImm = 0x44;
9659 if (Imm & 1)
9660 NewImm |= 0x0a;
9661 if (Imm & 2)
9662 NewImm |= 0xa0;
9663 MI.getOperand(3).setImm(NewImm);
9664 MI.setDesc(get(X86::SHUFPSrri));
9665 }
9666 return true;
9667 }
9668 }
9669 return false;
9670}
9671
9672std::pair<uint16_t, uint16_t>
9674 uint16_t domain = (MI.getDesc().TSFlags >> X86II::SSEDomainShift) & 3;
9675 unsigned opcode = MI.getOpcode();
9676 uint16_t validDomains = 0;
9677 if (domain) {
9678 // Attempt to match for custom instructions.
9679 validDomains = getExecutionDomainCustom(MI);
9680 if (validDomains)
9681 return std::make_pair(domain, validDomains);
9682
9683 if (lookup(opcode, domain, ReplaceableInstrs)) {
9684 validDomains = 0xe;
9685 } else if (lookup(opcode, domain, ReplaceableInstrsAVX2)) {
9686 validDomains = Subtarget.hasAVX2() ? 0xe : 0x6;
9687 } else if (lookup(opcode, domain, ReplaceableInstrsFP)) {
9688 validDomains = 0x6;
9689 } else if (lookup(opcode, domain, ReplaceableInstrsAVX2InsertExtract)) {
9690 // Insert/extract instructions should only effect domain if AVX2
9691 // is enabled.
9692 if (!Subtarget.hasAVX2())
9693 return std::make_pair(0, 0);
9694 validDomains = 0xe;
9695 } else if (lookupAVX512(opcode, domain, ReplaceableInstrsAVX512)) {
9696 validDomains = 0xe;
9697 } else if (Subtarget.hasDQI() &&
9698 lookupAVX512(opcode, domain, ReplaceableInstrsAVX512DQ)) {
9699 validDomains = 0xe;
9700 } else if (Subtarget.hasDQI()) {
9701 if (const uint16_t *table =
9702 lookupAVX512(opcode, domain, ReplaceableInstrsAVX512DQMasked)) {
9703 if (domain == 1 || (domain == 3 && table[3] == opcode))
9704 validDomains = 0xa;
9705 else
9706 validDomains = 0xc;
9707 }
9708 }
9709 }
9710 return std::make_pair(domain, validDomains);
9711}
9712
9714 assert(Domain > 0 && Domain < 4 && "Invalid execution domain");
9715 uint16_t dom = (MI.getDesc().TSFlags >> X86II::SSEDomainShift) & 3;
9716 assert(dom && "Not an SSE instruction");
9717
9718 // Attempt to match for custom instructions.
9720 return;
9721
9722 const uint16_t *table = lookup(MI.getOpcode(), dom, ReplaceableInstrs);
9723 if (!table) { // try the other table
9724 assert((Subtarget.hasAVX2() || Domain < 3) &&
9725 "256-bit vector operations only available in AVX2");
9726 table = lookup(MI.getOpcode(), dom, ReplaceableInstrsAVX2);
9727 }
9728 if (!table) { // try the FP table
9729 table = lookup(MI.getOpcode(), dom, ReplaceableInstrsFP);
9730 assert((!table || Domain < 3) &&
9731 "Can only select PackedSingle or PackedDouble");
9732 }
9733 if (!table) { // try the other table
9734 assert(Subtarget.hasAVX2() &&
9735 "256-bit insert/extract only available in AVX2");
9736 table = lookup(MI.getOpcode(), dom, ReplaceableInstrsAVX2InsertExtract);
9737 }
9738 if (!table) { // try the AVX512 table
9739 assert(Subtarget.hasAVX512() && "Requires AVX-512");
9740 table = lookupAVX512(MI.getOpcode(), dom, ReplaceableInstrsAVX512);
9741 // Don't change integer Q instructions to D instructions.
9742 if (table && Domain == 3 && table[3] == MI.getOpcode())
9743 Domain = 4;
9744 }
9745 if (!table) { // try the AVX512DQ table
9746 assert((Subtarget.hasDQI() || Domain >= 3) && "Requires AVX-512DQ");
9747 table = lookupAVX512(MI.getOpcode(), dom, ReplaceableInstrsAVX512DQ);
9748 // Don't change integer Q instructions to D instructions and
9749 // use D instructions if we started with a PS instruction.
9750 if (table && Domain == 3 && (dom == 1 || table[3] == MI.getOpcode()))
9751 Domain = 4;
9752 }
9753 if (!table) { // try the AVX512DQMasked table
9754 assert((Subtarget.hasDQI() || Domain >= 3) && "Requires AVX-512DQ");
9755 table = lookupAVX512(MI.getOpcode(), dom, ReplaceableInstrsAVX512DQMasked);
9756 if (table && Domain == 3 && (dom == 1 || table[3] == MI.getOpcode()))
9757 Domain = 4;
9758 }
9759 assert(table && "Cannot change domain");
9760 MI.setDesc(get(table[Domain - 1]));
9761}
9762
9768
9769/// Return the noop instruction to use for a noop.
9771 MCInst Nop;
9772 Nop.setOpcode(X86::NOOP);
9773 return Nop;
9774}
9775
9777 switch (opc) {
9778 default:
9779 return false;
9780 case X86::DIVPDrm:
9781 case X86::DIVPDrr:
9782 case X86::DIVPSrm:
9783 case X86::DIVPSrr:
9784 case X86::DIVSDrm:
9785 case X86::DIVSDrm_Int:
9786 case X86::DIVSDrr:
9787 case X86::DIVSDrr_Int:
9788 case X86::DIVSSrm:
9789 case X86::DIVSSrm_Int:
9790 case X86::DIVSSrr:
9791 case X86::DIVSSrr_Int:
9792 case X86::SQRTPDm:
9793 case X86::SQRTPDr:
9794 case X86::SQRTPSm:
9795 case X86::SQRTPSr:
9796 case X86::SQRTSDm:
9797 case X86::SQRTSDm_Int:
9798 case X86::SQRTSDr:
9799 case X86::SQRTSDr_Int:
9800 case X86::SQRTSSm:
9801 case X86::SQRTSSm_Int:
9802 case X86::SQRTSSr:
9803 case X86::SQRTSSr_Int:
9804 // AVX instructions with high latency
9805 case X86::VDIVPDrm:
9806 case X86::VDIVPDrr:
9807 case X86::VDIVPDYrm:
9808 case X86::VDIVPDYrr:
9809 case X86::VDIVPSrm:
9810 case X86::VDIVPSrr:
9811 case X86::VDIVPSYrm:
9812 case X86::VDIVPSYrr:
9813 case X86::VDIVSDrm:
9814 case X86::VDIVSDrm_Int:
9815 case X86::VDIVSDrr:
9816 case X86::VDIVSDrr_Int:
9817 case X86::VDIVSSrm:
9818 case X86::VDIVSSrm_Int:
9819 case X86::VDIVSSrr:
9820 case X86::VDIVSSrr_Int:
9821 case X86::VSQRTPDm:
9822 case X86::VSQRTPDr:
9823 case X86::VSQRTPDYm:
9824 case X86::VSQRTPDYr:
9825 case X86::VSQRTPSm:
9826 case X86::VSQRTPSr:
9827 case X86::VSQRTPSYm:
9828 case X86::VSQRTPSYr:
9829 case X86::VSQRTSDm:
9830 case X86::VSQRTSDm_Int:
9831 case X86::VSQRTSDr:
9832 case X86::VSQRTSDr_Int:
9833 case X86::VSQRTSSm:
9834 case X86::VSQRTSSm_Int:
9835 case X86::VSQRTSSr:
9836 case X86::VSQRTSSr_Int:
9837 // AVX512 instructions with high latency
9838 case X86::VDIVPDZ128rm:
9839 case X86::VDIVPDZ128rmb:
9840 case X86::VDIVPDZ128rmbk:
9841 case X86::VDIVPDZ128rmbkz:
9842 case X86::VDIVPDZ128rmk:
9843 case X86::VDIVPDZ128rmkz:
9844 case X86::VDIVPDZ128rr:
9845 case X86::VDIVPDZ128rrk:
9846 case X86::VDIVPDZ128rrkz:
9847 case X86::VDIVPDZ256rm:
9848 case X86::VDIVPDZ256rmb:
9849 case X86::VDIVPDZ256rmbk:
9850 case X86::VDIVPDZ256rmbkz:
9851 case X86::VDIVPDZ256rmk:
9852 case X86::VDIVPDZ256rmkz:
9853 case X86::VDIVPDZ256rr:
9854 case X86::VDIVPDZ256rrk:
9855 case X86::VDIVPDZ256rrkz:
9856 case X86::VDIVPDZrrb:
9857 case X86::VDIVPDZrrbk:
9858 case X86::VDIVPDZrrbkz:
9859 case X86::VDIVPDZrm:
9860 case X86::VDIVPDZrmb:
9861 case X86::VDIVPDZrmbk:
9862 case X86::VDIVPDZrmbkz:
9863 case X86::VDIVPDZrmk:
9864 case X86::VDIVPDZrmkz:
9865 case X86::VDIVPDZrr:
9866 case X86::VDIVPDZrrk:
9867 case X86::VDIVPDZrrkz:
9868 case X86::VDIVPSZ128rm:
9869 case X86::VDIVPSZ128rmb:
9870 case X86::VDIVPSZ128rmbk:
9871 case X86::VDIVPSZ128rmbkz:
9872 case X86::VDIVPSZ128rmk:
9873 case X86::VDIVPSZ128rmkz:
9874 case X86::VDIVPSZ128rr:
9875 case X86::VDIVPSZ128rrk:
9876 case X86::VDIVPSZ128rrkz:
9877 case X86::VDIVPSZ256rm:
9878 case X86::VDIVPSZ256rmb:
9879 case X86::VDIVPSZ256rmbk:
9880 case X86::VDIVPSZ256rmbkz:
9881 case X86::VDIVPSZ256rmk:
9882 case X86::VDIVPSZ256rmkz:
9883 case X86::VDIVPSZ256rr:
9884 case X86::VDIVPSZ256rrk:
9885 case X86::VDIVPSZ256rrkz:
9886 case X86::VDIVPSZrrb:
9887 case X86::VDIVPSZrrbk:
9888 case X86::VDIVPSZrrbkz:
9889 case X86::VDIVPSZrm:
9890 case X86::VDIVPSZrmb:
9891 case X86::VDIVPSZrmbk:
9892 case X86::VDIVPSZrmbkz:
9893 case X86::VDIVPSZrmk:
9894 case X86::VDIVPSZrmkz:
9895 case X86::VDIVPSZrr:
9896 case X86::VDIVPSZrrk:
9897 case X86::VDIVPSZrrkz:
9898 case X86::VDIVSDZrm:
9899 case X86::VDIVSDZrr:
9900 case X86::VDIVSDZrm_Int:
9901 case X86::VDIVSDZrmk_Int:
9902 case X86::VDIVSDZrmkz_Int:
9903 case X86::VDIVSDZrr_Int:
9904 case X86::VDIVSDZrrk_Int:
9905 case X86::VDIVSDZrrkz_Int:
9906 case X86::VDIVSDZrrb_Int:
9907 case X86::VDIVSDZrrbk_Int:
9908 case X86::VDIVSDZrrbkz_Int:
9909 case X86::VDIVSSZrm:
9910 case X86::VDIVSSZrr:
9911 case X86::VDIVSSZrm_Int:
9912 case X86::VDIVSSZrmk_Int:
9913 case X86::VDIVSSZrmkz_Int:
9914 case X86::VDIVSSZrr_Int:
9915 case X86::VDIVSSZrrk_Int:
9916 case X86::VDIVSSZrrkz_Int:
9917 case X86::VDIVSSZrrb_Int:
9918 case X86::VDIVSSZrrbk_Int:
9919 case X86::VDIVSSZrrbkz_Int:
9920 case X86::VSQRTPDZ128m:
9921 case X86::VSQRTPDZ128mb:
9922 case X86::VSQRTPDZ128mbk:
9923 case X86::VSQRTPDZ128mbkz:
9924 case X86::VSQRTPDZ128mk:
9925 case X86::VSQRTPDZ128mkz:
9926 case X86::VSQRTPDZ128r:
9927 case X86::VSQRTPDZ128rk:
9928 case X86::VSQRTPDZ128rkz:
9929 case X86::VSQRTPDZ256m:
9930 case X86::VSQRTPDZ256mb:
9931 case X86::VSQRTPDZ256mbk:
9932 case X86::VSQRTPDZ256mbkz:
9933 case X86::VSQRTPDZ256mk:
9934 case X86::VSQRTPDZ256mkz:
9935 case X86::VSQRTPDZ256r:
9936 case X86::VSQRTPDZ256rk:
9937 case X86::VSQRTPDZ256rkz:
9938 case X86::VSQRTPDZm:
9939 case X86::VSQRTPDZmb:
9940 case X86::VSQRTPDZmbk:
9941 case X86::VSQRTPDZmbkz:
9942 case X86::VSQRTPDZmk:
9943 case X86::VSQRTPDZmkz:
9944 case X86::VSQRTPDZr:
9945 case X86::VSQRTPDZrb:
9946 case X86::VSQRTPDZrbk:
9947 case X86::VSQRTPDZrbkz:
9948 case X86::VSQRTPDZrk:
9949 case X86::VSQRTPDZrkz:
9950 case X86::VSQRTPSZ128m:
9951 case X86::VSQRTPSZ128mb:
9952 case X86::VSQRTPSZ128mbk:
9953 case X86::VSQRTPSZ128mbkz:
9954 case X86::VSQRTPSZ128mk:
9955 case X86::VSQRTPSZ128mkz:
9956 case X86::VSQRTPSZ128r:
9957 case X86::VSQRTPSZ128rk:
9958 case X86::VSQRTPSZ128rkz:
9959 case X86::VSQRTPSZ256m:
9960 case X86::VSQRTPSZ256mb:
9961 case X86::VSQRTPSZ256mbk:
9962 case X86::VSQRTPSZ256mbkz:
9963 case X86::VSQRTPSZ256mk:
9964 case X86::VSQRTPSZ256mkz:
9965 case X86::VSQRTPSZ256r:
9966 case X86::VSQRTPSZ256rk:
9967 case X86::VSQRTPSZ256rkz:
9968 case X86::VSQRTPSZm:
9969 case X86::VSQRTPSZmb:
9970 case X86::VSQRTPSZmbk:
9971 case X86::VSQRTPSZmbkz:
9972 case X86::VSQRTPSZmk:
9973 case X86::VSQRTPSZmkz:
9974 case X86::VSQRTPSZr:
9975 case X86::VSQRTPSZrb:
9976 case X86::VSQRTPSZrbk:
9977 case X86::VSQRTPSZrbkz:
9978 case X86::VSQRTPSZrk:
9979 case X86::VSQRTPSZrkz:
9980 case X86::VSQRTSDZm:
9981 case X86::VSQRTSDZm_Int:
9982 case X86::VSQRTSDZmk_Int:
9983 case X86::VSQRTSDZmkz_Int:
9984 case X86::VSQRTSDZr:
9985 case X86::VSQRTSDZr_Int:
9986 case X86::VSQRTSDZrk_Int:
9987 case X86::VSQRTSDZrkz_Int:
9988 case X86::VSQRTSDZrb_Int:
9989 case X86::VSQRTSDZrbk_Int:
9990 case X86::VSQRTSDZrbkz_Int:
9991 case X86::VSQRTSSZm:
9992 case X86::VSQRTSSZm_Int:
9993 case X86::VSQRTSSZmk_Int:
9994 case X86::VSQRTSSZmkz_Int:
9995 case X86::VSQRTSSZr:
9996 case X86::VSQRTSSZr_Int:
9997 case X86::VSQRTSSZrk_Int:
9998 case X86::VSQRTSSZrkz_Int:
9999 case X86::VSQRTSSZrb_Int:
10000 case X86::VSQRTSSZrbk_Int:
10001 case X86::VSQRTSSZrbkz_Int:
10002
10003 case X86::VGATHERDPDYrm:
10004 case X86::VGATHERDPDZ128rm:
10005 case X86::VGATHERDPDZ256rm:
10006 case X86::VGATHERDPDZrm:
10007 case X86::VGATHERDPDrm:
10008 case X86::VGATHERDPSYrm:
10009 case X86::VGATHERDPSZ128rm:
10010 case X86::VGATHERDPSZ256rm:
10011 case X86::VGATHERDPSZrm:
10012 case X86::VGATHERDPSrm:
10013 case X86::VGATHERPF0DPDm:
10014 case X86::VGATHERPF0DPSm:
10015 case X86::VGATHERPF0QPDm:
10016 case X86::VGATHERPF0QPSm:
10017 case X86::VGATHERPF1DPDm:
10018 case X86::VGATHERPF1DPSm:
10019 case X86::VGATHERPF1QPDm:
10020 case X86::VGATHERPF1QPSm:
10021 case X86::VGATHERQPDYrm:
10022 case X86::VGATHERQPDZ128rm:
10023 case X86::VGATHERQPDZ256rm:
10024 case X86::VGATHERQPDZrm:
10025 case X86::VGATHERQPDrm:
10026 case X86::VGATHERQPSYrm:
10027 case X86::VGATHERQPSZ128rm:
10028 case X86::VGATHERQPSZ256rm:
10029 case X86::VGATHERQPSZrm:
10030 case X86::VGATHERQPSrm:
10031 case X86::VPGATHERDDYrm:
10032 case X86::VPGATHERDDZ128rm:
10033 case X86::VPGATHERDDZ256rm:
10034 case X86::VPGATHERDDZrm:
10035 case X86::VPGATHERDDrm:
10036 case X86::VPGATHERDQYrm:
10037 case X86::VPGATHERDQZ128rm:
10038 case X86::VPGATHERDQZ256rm:
10039 case X86::VPGATHERDQZrm:
10040 case X86::VPGATHERDQrm:
10041 case X86::VPGATHERQDYrm:
10042 case X86::VPGATHERQDZ128rm:
10043 case X86::VPGATHERQDZ256rm:
10044 case X86::VPGATHERQDZrm:
10045 case X86::VPGATHERQDrm:
10046 case X86::VPGATHERQQYrm:
10047 case X86::VPGATHERQQZ128rm:
10048 case X86::VPGATHERQQZ256rm:
10049 case X86::VPGATHERQQZrm:
10050 case X86::VPGATHERQQrm:
10051 case X86::VSCATTERDPDZ128mr:
10052 case X86::VSCATTERDPDZ256mr:
10053 case X86::VSCATTERDPDZmr:
10054 case X86::VSCATTERDPSZ128mr:
10055 case X86::VSCATTERDPSZ256mr:
10056 case X86::VSCATTERDPSZmr:
10057 case X86::VSCATTERPF0DPDm:
10058 case X86::VSCATTERPF0DPSm:
10059 case X86::VSCATTERPF0QPDm:
10060 case X86::VSCATTERPF0QPSm:
10061 case X86::VSCATTERPF1DPDm:
10062 case X86::VSCATTERPF1DPSm:
10063 case X86::VSCATTERPF1QPDm:
10064 case X86::VSCATTERPF1QPSm:
10065 case X86::VSCATTERQPDZ128mr:
10066 case X86::VSCATTERQPDZ256mr:
10067 case X86::VSCATTERQPDZmr:
10068 case X86::VSCATTERQPSZ128mr:
10069 case X86::VSCATTERQPSZ256mr:
10070 case X86::VSCATTERQPSZmr:
10071 case X86::VPSCATTERDDZ128mr:
10072 case X86::VPSCATTERDDZ256mr:
10073 case X86::VPSCATTERDDZmr:
10074 case X86::VPSCATTERDQZ128mr:
10075 case X86::VPSCATTERDQZ256mr:
10076 case X86::VPSCATTERDQZmr:
10077 case X86::VPSCATTERQDZ128mr:
10078 case X86::VPSCATTERQDZ256mr:
10079 case X86::VPSCATTERQDZmr:
10080 case X86::VPSCATTERQQZ128mr:
10081 case X86::VPSCATTERQQZ256mr:
10082 case X86::VPSCATTERQQZmr:
10083 return true;
10084 }
10085}
10086
10088 const MachineRegisterInfo *MRI,
10089 const MachineInstr &DefMI,
10090 unsigned DefIdx,
10091 const MachineInstr &UseMI,
10092 unsigned UseIdx) const {
10093 return isHighLatencyDef(DefMI.getOpcode());
10094}
10095
10097 const MachineBasicBlock *MBB) const {
10098 assert(Inst.getNumExplicitOperands() == 3 && Inst.getNumExplicitDefs() == 1 &&
10099 Inst.getNumDefs() <= 2 && "Reassociation needs binary operators");
10100
10101 // Integer binary math/logic instructions have a third source operand:
10102 // the EFLAGS register. That operand must be both defined here and never
10103 // used; ie, it must be dead. If the EFLAGS operand is live, then we can
10104 // not change anything because rearranging the operands could affect other
10105 // instructions that depend on the exact status flags (zero, sign, etc.)
10106 // that are set by using these particular operands with this operation.
10107 const MachineOperand *FlagDef =
10108 Inst.findRegisterDefOperand(X86::EFLAGS, /*TRI=*/nullptr);
10109 assert((Inst.getNumDefs() == 1 || FlagDef) && "Implicit def isn't flags?");
10110 if (FlagDef && !FlagDef->isDead())
10111 return false;
10112
10114}
10115
10116// TODO: There are many more machine instruction opcodes to match:
10117// 1. Other data types (integer, vectors)
10118// 2. Other math / logic operations (xor, or)
10119// 3. Other forms of the same operation (intrinsics and other variants)
10121 bool Invert) const {
10122 if (Invert)
10123 return false;
10124 switch (Inst.getOpcode()) {
10125 CASE_ND(ADD8rr)
10126 CASE_ND(ADD16rr)
10127 CASE_ND(ADD32rr)
10128 CASE_ND(ADD64rr)
10129 CASE_ND(AND8rr)
10130 CASE_ND(AND16rr)
10131 CASE_ND(AND32rr)
10132 CASE_ND(AND64rr)
10133 CASE_ND(OR8rr)
10134 CASE_ND(OR16rr)
10135 CASE_ND(OR32rr)
10136 CASE_ND(OR64rr)
10137 CASE_ND(XOR8rr)
10138 CASE_ND(XOR16rr)
10139 CASE_ND(XOR32rr)
10140 CASE_ND(XOR64rr)
10141 CASE_ND(IMUL16rr)
10142 CASE_ND(IMUL32rr)
10143 CASE_ND(IMUL64rr)
10144 case X86::PANDrr:
10145 case X86::PORrr:
10146 case X86::PXORrr:
10147 case X86::ANDPDrr:
10148 case X86::ANDPSrr:
10149 case X86::ORPDrr:
10150 case X86::ORPSrr:
10151 case X86::XORPDrr:
10152 case X86::XORPSrr:
10153 case X86::PADDBrr:
10154 case X86::PADDWrr:
10155 case X86::PADDDrr:
10156 case X86::PADDQrr:
10157 case X86::PMULLWrr:
10158 case X86::PMULLDrr:
10159 case X86::PMAXSBrr:
10160 case X86::PMAXSDrr:
10161 case X86::PMAXSWrr:
10162 case X86::PMAXUBrr:
10163 case X86::PMAXUDrr:
10164 case X86::PMAXUWrr:
10165 case X86::PMINSBrr:
10166 case X86::PMINSDrr:
10167 case X86::PMINSWrr:
10168 case X86::PMINUBrr:
10169 case X86::PMINUDrr:
10170 case X86::PMINUWrr:
10171 case X86::VPANDrr:
10172 case X86::VPANDYrr:
10173 case X86::VPANDDZ128rr:
10174 case X86::VPANDDZ256rr:
10175 case X86::VPANDDZrr:
10176 case X86::VPANDQZ128rr:
10177 case X86::VPANDQZ256rr:
10178 case X86::VPANDQZrr:
10179 case X86::VPORrr:
10180 case X86::VPORYrr:
10181 case X86::VPORDZ128rr:
10182 case X86::VPORDZ256rr:
10183 case X86::VPORDZrr:
10184 case X86::VPORQZ128rr:
10185 case X86::VPORQZ256rr:
10186 case X86::VPORQZrr:
10187 case X86::VPXORrr:
10188 case X86::VPXORYrr:
10189 case X86::VPXORDZ128rr:
10190 case X86::VPXORDZ256rr:
10191 case X86::VPXORDZrr:
10192 case X86::VPXORQZ128rr:
10193 case X86::VPXORQZ256rr:
10194 case X86::VPXORQZrr:
10195 case X86::VANDPDrr:
10196 case X86::VANDPSrr:
10197 case X86::VANDPDYrr:
10198 case X86::VANDPSYrr:
10199 case X86::VANDPDZ128rr:
10200 case X86::VANDPSZ128rr:
10201 case X86::VANDPDZ256rr:
10202 case X86::VANDPSZ256rr:
10203 case X86::VANDPDZrr:
10204 case X86::VANDPSZrr:
10205 case X86::VORPDrr:
10206 case X86::VORPSrr:
10207 case X86::VORPDYrr:
10208 case X86::VORPSYrr:
10209 case X86::VORPDZ128rr:
10210 case X86::VORPSZ128rr:
10211 case X86::VORPDZ256rr:
10212 case X86::VORPSZ256rr:
10213 case X86::VORPDZrr:
10214 case X86::VORPSZrr:
10215 case X86::VXORPDrr:
10216 case X86::VXORPSrr:
10217 case X86::VXORPDYrr:
10218 case X86::VXORPSYrr:
10219 case X86::VXORPDZ128rr:
10220 case X86::VXORPSZ128rr:
10221 case X86::VXORPDZ256rr:
10222 case X86::VXORPSZ256rr:
10223 case X86::VXORPDZrr:
10224 case X86::VXORPSZrr:
10225 case X86::KADDBkk:
10226 case X86::KADDWkk:
10227 case X86::KADDDkk:
10228 case X86::KADDQkk:
10229 case X86::KANDBkk:
10230 case X86::KANDWkk:
10231 case X86::KANDDkk:
10232 case X86::KANDQkk:
10233 case X86::KORBkk:
10234 case X86::KORWkk:
10235 case X86::KORDkk:
10236 case X86::KORQkk:
10237 case X86::KXORBkk:
10238 case X86::KXORWkk:
10239 case X86::KXORDkk:
10240 case X86::KXORQkk:
10241 case X86::VPADDBrr:
10242 case X86::VPADDWrr:
10243 case X86::VPADDDrr:
10244 case X86::VPADDQrr:
10245 case X86::VPADDBYrr:
10246 case X86::VPADDWYrr:
10247 case X86::VPADDDYrr:
10248 case X86::VPADDQYrr:
10249 case X86::VPADDBZ128rr:
10250 case X86::VPADDWZ128rr:
10251 case X86::VPADDDZ128rr:
10252 case X86::VPADDQZ128rr:
10253 case X86::VPADDBZ256rr:
10254 case X86::VPADDWZ256rr:
10255 case X86::VPADDDZ256rr:
10256 case X86::VPADDQZ256rr:
10257 case X86::VPADDBZrr:
10258 case X86::VPADDWZrr:
10259 case X86::VPADDDZrr:
10260 case X86::VPADDQZrr:
10261 case X86::VPMULLWrr:
10262 case X86::VPMULLWYrr:
10263 case X86::VPMULLWZ128rr:
10264 case X86::VPMULLWZ256rr:
10265 case X86::VPMULLWZrr:
10266 case X86::VPMULLDrr:
10267 case X86::VPMULLDYrr:
10268 case X86::VPMULLDZ128rr:
10269 case X86::VPMULLDZ256rr:
10270 case X86::VPMULLDZrr:
10271 case X86::VPMULLQZ128rr:
10272 case X86::VPMULLQZ256rr:
10273 case X86::VPMULLQZrr:
10274 case X86::VPMAXSBrr:
10275 case X86::VPMAXSBYrr:
10276 case X86::VPMAXSBZ128rr:
10277 case X86::VPMAXSBZ256rr:
10278 case X86::VPMAXSBZrr:
10279 case X86::VPMAXSDrr:
10280 case X86::VPMAXSDYrr:
10281 case X86::VPMAXSDZ128rr:
10282 case X86::VPMAXSDZ256rr:
10283 case X86::VPMAXSDZrr:
10284 case X86::VPMAXSQZ128rr:
10285 case X86::VPMAXSQZ256rr:
10286 case X86::VPMAXSQZrr:
10287 case X86::VPMAXSWrr:
10288 case X86::VPMAXSWYrr:
10289 case X86::VPMAXSWZ128rr:
10290 case X86::VPMAXSWZ256rr:
10291 case X86::VPMAXSWZrr:
10292 case X86::VPMAXUBrr:
10293 case X86::VPMAXUBYrr:
10294 case X86::VPMAXUBZ128rr:
10295 case X86::VPMAXUBZ256rr:
10296 case X86::VPMAXUBZrr:
10297 case X86::VPMAXUDrr:
10298 case X86::VPMAXUDYrr:
10299 case X86::VPMAXUDZ128rr:
10300 case X86::VPMAXUDZ256rr:
10301 case X86::VPMAXUDZrr:
10302 case X86::VPMAXUQZ128rr:
10303 case X86::VPMAXUQZ256rr:
10304 case X86::VPMAXUQZrr:
10305 case X86::VPMAXUWrr:
10306 case X86::VPMAXUWYrr:
10307 case X86::VPMAXUWZ128rr:
10308 case X86::VPMAXUWZ256rr:
10309 case X86::VPMAXUWZrr:
10310 case X86::VPMINSBrr:
10311 case X86::VPMINSBYrr:
10312 case X86::VPMINSBZ128rr:
10313 case X86::VPMINSBZ256rr:
10314 case X86::VPMINSBZrr:
10315 case X86::VPMINSDrr:
10316 case X86::VPMINSDYrr:
10317 case X86::VPMINSDZ128rr:
10318 case X86::VPMINSDZ256rr:
10319 case X86::VPMINSDZrr:
10320 case X86::VPMINSQZ128rr:
10321 case X86::VPMINSQZ256rr:
10322 case X86::VPMINSQZrr:
10323 case X86::VPMINSWrr:
10324 case X86::VPMINSWYrr:
10325 case X86::VPMINSWZ128rr:
10326 case X86::VPMINSWZ256rr:
10327 case X86::VPMINSWZrr:
10328 case X86::VPMINUBrr:
10329 case X86::VPMINUBYrr:
10330 case X86::VPMINUBZ128rr:
10331 case X86::VPMINUBZ256rr:
10332 case X86::VPMINUBZrr:
10333 case X86::VPMINUDrr:
10334 case X86::VPMINUDYrr:
10335 case X86::VPMINUDZ128rr:
10336 case X86::VPMINUDZ256rr:
10337 case X86::VPMINUDZrr:
10338 case X86::VPMINUQZ128rr:
10339 case X86::VPMINUQZ256rr:
10340 case X86::VPMINUQZrr:
10341 case X86::VPMINUWrr:
10342 case X86::VPMINUWYrr:
10343 case X86::VPMINUWZ128rr:
10344 case X86::VPMINUWZ256rr:
10345 case X86::VPMINUWZrr:
10346 // Normal min/max instructions are not commutative because of NaN and signed
10347 // zero semantics, but these are. Thus, there's no need to check for global
10348 // relaxed math; the instructions themselves have the properties we need.
10349 case X86::MAXCPDrr:
10350 case X86::MAXCPSrr:
10351 case X86::MAXCSDrr:
10352 case X86::MAXCSSrr:
10353 case X86::MINCPDrr:
10354 case X86::MINCPSrr:
10355 case X86::MINCSDrr:
10356 case X86::MINCSSrr:
10357 case X86::VMAXCPDrr:
10358 case X86::VMAXCPSrr:
10359 case X86::VMAXCPDYrr:
10360 case X86::VMAXCPSYrr:
10361 case X86::VMAXCPDZ128rr:
10362 case X86::VMAXCPSZ128rr:
10363 case X86::VMAXCPDZ256rr:
10364 case X86::VMAXCPSZ256rr:
10365 case X86::VMAXCPDZrr:
10366 case X86::VMAXCPSZrr:
10367 case X86::VMAXCSDrr:
10368 case X86::VMAXCSSrr:
10369 case X86::VMAXCSDZrr:
10370 case X86::VMAXCSSZrr:
10371 case X86::VMINCPDrr:
10372 case X86::VMINCPSrr:
10373 case X86::VMINCPDYrr:
10374 case X86::VMINCPSYrr:
10375 case X86::VMINCPDZ128rr:
10376 case X86::VMINCPSZ128rr:
10377 case X86::VMINCPDZ256rr:
10378 case X86::VMINCPSZ256rr:
10379 case X86::VMINCPDZrr:
10380 case X86::VMINCPSZrr:
10381 case X86::VMINCSDrr:
10382 case X86::VMINCSSrr:
10383 case X86::VMINCSDZrr:
10384 case X86::VMINCSSZrr:
10385 case X86::VMAXCPHZ128rr:
10386 case X86::VMAXCPHZ256rr:
10387 case X86::VMAXCPHZrr:
10388 case X86::VMAXCSHZrr:
10389 case X86::VMINCPHZ128rr:
10390 case X86::VMINCPHZ256rr:
10391 case X86::VMINCPHZrr:
10392 case X86::VMINCSHZrr:
10393 return true;
10394 case X86::ADDPDrr:
10395 case X86::ADDPSrr:
10396 case X86::ADDSDrr:
10397 case X86::ADDSSrr:
10398 case X86::MULPDrr:
10399 case X86::MULPSrr:
10400 case X86::MULSDrr:
10401 case X86::MULSSrr:
10402 case X86::VADDPDrr:
10403 case X86::VADDPSrr:
10404 case X86::VADDPDYrr:
10405 case X86::VADDPSYrr:
10406 case X86::VADDPDZ128rr:
10407 case X86::VADDPSZ128rr:
10408 case X86::VADDPDZ256rr:
10409 case X86::VADDPSZ256rr:
10410 case X86::VADDPDZrr:
10411 case X86::VADDPSZrr:
10412 case X86::VADDSDrr:
10413 case X86::VADDSSrr:
10414 case X86::VADDSDZrr:
10415 case X86::VADDSSZrr:
10416 case X86::VMULPDrr:
10417 case X86::VMULPSrr:
10418 case X86::VMULPDYrr:
10419 case X86::VMULPSYrr:
10420 case X86::VMULPDZ128rr:
10421 case X86::VMULPSZ128rr:
10422 case X86::VMULPDZ256rr:
10423 case X86::VMULPSZ256rr:
10424 case X86::VMULPDZrr:
10425 case X86::VMULPSZrr:
10426 case X86::VMULSDrr:
10427 case X86::VMULSSrr:
10428 case X86::VMULSDZrr:
10429 case X86::VMULSSZrr:
10430 case X86::VADDPHZ128rr:
10431 case X86::VADDPHZ256rr:
10432 case X86::VADDPHZrr:
10433 case X86::VADDSHZrr:
10434 case X86::VMULPHZ128rr:
10435 case X86::VMULPHZ256rr:
10436 case X86::VMULPHZrr:
10437 case X86::VMULSHZrr:
10440 default:
10441 return false;
10442 }
10443}
10444
10445/// If \p DescribedReg overlaps with the MOVrr instruction's destination
10446/// register then, if possible, describe the value in terms of the source
10447/// register.
10448static std::optional<ParamLoadedValue>
10450 const TargetRegisterInfo *TRI) {
10451 Register DestReg = MI.getOperand(0).getReg();
10452 Register SrcReg = MI.getOperand(1).getReg();
10453
10454 auto Expr = DIExpression::get(MI.getMF()->getFunction().getContext(), {});
10455
10456 // If the described register is the destination, just return the source.
10457 if (DestReg == DescribedReg)
10458 return ParamLoadedValue(MachineOperand::CreateReg(SrcReg, false), Expr);
10459
10460 // If the described register is a sub-register of the destination register,
10461 // then pick out the source register's corresponding sub-register.
10462 if (unsigned SubRegIdx = TRI->getSubRegIndex(DestReg, DescribedReg)) {
10463 Register SrcSubReg = TRI->getSubReg(SrcReg, SubRegIdx);
10464 return ParamLoadedValue(MachineOperand::CreateReg(SrcSubReg, false), Expr);
10465 }
10466
10467 // The remaining case to consider is when the described register is a
10468 // super-register of the destination register. MOV8rr and MOV16rr does not
10469 // write to any of the other bytes in the register, meaning that we'd have to
10470 // describe the value using a combination of the source register and the
10471 // non-overlapping bits in the described register, which is not currently
10472 // possible.
10473 if (MI.getOpcode() == X86::MOV8rr || MI.getOpcode() == X86::MOV16rr ||
10474 !TRI->isSuperRegister(DestReg, DescribedReg))
10475 return std::nullopt;
10476
10477 assert(MI.getOpcode() == X86::MOV32rr && "Unexpected super-register case");
10478 return ParamLoadedValue(MachineOperand::CreateReg(SrcReg, false), Expr);
10479}
10480
10481std::optional<ParamLoadedValue>
10483 const MachineOperand *Op = nullptr;
10484 DIExpression *Expr = nullptr;
10485
10487
10488 switch (MI.getOpcode()) {
10489 case X86::LEA32r:
10490 case X86::LEA64r:
10491 case X86::LEA64_32r: {
10492 // We may need to describe a 64-bit parameter with a 32-bit LEA.
10493 if (!TRI->isSuperRegisterEq(MI.getOperand(0).getReg(), Reg))
10494 return std::nullopt;
10495
10496 // Operand 4 could be global address. For now we do not support
10497 // such situation.
10498 if (!MI.getOperand(4).isImm() || !MI.getOperand(2).isImm())
10499 return std::nullopt;
10500
10501 const MachineOperand &Op1 = MI.getOperand(1);
10502 const MachineOperand &Op2 = MI.getOperand(3);
10503 assert(Op2.isReg() &&
10504 (Op2.getReg() == X86::NoRegister || Op2.getReg().isPhysical()));
10505
10506 // Omit situations like:
10507 // %rsi = lea %rsi, 4, ...
10508 if ((Op1.isReg() && Op1.getReg() == MI.getOperand(0).getReg()) ||
10509 Op2.getReg() == MI.getOperand(0).getReg())
10510 return std::nullopt;
10511 else if ((Op1.isReg() && Op1.getReg() != X86::NoRegister &&
10512 TRI->regsOverlap(Op1.getReg(), MI.getOperand(0).getReg())) ||
10513 (Op2.getReg() != X86::NoRegister &&
10514 TRI->regsOverlap(Op2.getReg(), MI.getOperand(0).getReg())))
10515 return std::nullopt;
10516
10517 int64_t Coef = MI.getOperand(2).getImm();
10518 int64_t Offset = MI.getOperand(4).getImm();
10520
10521 if ((Op1.isReg() && Op1.getReg() != X86::NoRegister)) {
10522 Op = &Op1;
10523 } else if (Op1.isFI())
10524 Op = &Op1;
10525
10526 if (Op && Op->isReg() && Op->getReg() == Op2.getReg() && Coef > 0) {
10527 Ops.push_back(dwarf::DW_OP_constu);
10528 Ops.push_back(Coef + 1);
10529 Ops.push_back(dwarf::DW_OP_mul);
10530 } else {
10531 if (Op && Op2.getReg() != X86::NoRegister) {
10532 int dwarfReg = TRI->getDwarfRegNum(Op2.getReg(), false);
10533 if (dwarfReg < 0)
10534 return std::nullopt;
10535 else if (dwarfReg < 32) {
10536 Ops.push_back(dwarf::DW_OP_breg0 + dwarfReg);
10537 Ops.push_back(0);
10538 } else {
10539 Ops.push_back(dwarf::DW_OP_bregx);
10540 Ops.push_back(dwarfReg);
10541 Ops.push_back(0);
10542 }
10543 } else if (!Op) {
10544 assert(Op2.getReg() != X86::NoRegister);
10545 Op = &Op2;
10546 }
10547
10548 if (Coef > 1) {
10549 assert(Op2.getReg() != X86::NoRegister);
10550 Ops.push_back(dwarf::DW_OP_constu);
10551 Ops.push_back(Coef);
10552 Ops.push_back(dwarf::DW_OP_mul);
10553 }
10554
10555 if (((Op1.isReg() && Op1.getReg() != X86::NoRegister) || Op1.isFI()) &&
10556 Op2.getReg() != X86::NoRegister) {
10557 Ops.push_back(dwarf::DW_OP_plus);
10558 }
10559 }
10560
10562 Expr = DIExpression::get(MI.getMF()->getFunction().getContext(), Ops);
10563
10564 return ParamLoadedValue(*Op, Expr);
10565 }
10566 case X86::MOV8ri:
10567 case X86::MOV16ri:
10568 // TODO: Handle MOV8ri and MOV16ri.
10569 return std::nullopt;
10570 case X86::MOV32ri:
10571 case X86::MOV64ri:
10572 case X86::MOV64ri32:
10573 // MOV32ri may be used for producing zero-extended 32-bit immediates in
10574 // 64-bit parameters, so we need to consider super-registers.
10575 if (!TRI->isSuperRegisterEq(MI.getOperand(0).getReg(), Reg))
10576 return std::nullopt;
10577 return ParamLoadedValue(MI.getOperand(1), Expr);
10578 case X86::MOV8rr:
10579 case X86::MOV16rr:
10580 case X86::MOV32rr:
10581 case X86::MOV64rr:
10582 return describeMOVrrLoadedValue(MI, Reg, TRI);
10583 case X86::XOR32rr: {
10584 // 64-bit parameters are zero-materialized using XOR32rr, so also consider
10585 // super-registers.
10586 if (!TRI->isSuperRegisterEq(MI.getOperand(0).getReg(), Reg))
10587 return std::nullopt;
10588 if (MI.getOperand(1).getReg() == MI.getOperand(2).getReg())
10590 return std::nullopt;
10591 }
10592 case X86::MOVSX64rr32: {
10593 // We may need to describe the lower 32 bits of the MOVSX; for example, in
10594 // cases like this:
10595 //
10596 // $ebx = [...]
10597 // $rdi = MOVSX64rr32 $ebx
10598 // $esi = MOV32rr $edi
10599 if (!TRI->isSubRegisterEq(MI.getOperand(0).getReg(), Reg))
10600 return std::nullopt;
10601
10602 Expr = DIExpression::get(MI.getMF()->getFunction().getContext(), {});
10603
10604 // If the described register is the destination register we need to
10605 // sign-extend the source register from 32 bits. The other case we handle
10606 // is when the described register is the 32-bit sub-register of the
10607 // destination register, in case we just need to return the source
10608 // register.
10609 if (Reg == MI.getOperand(0).getReg())
10610 Expr = DIExpression::appendExt(Expr, 32, 64, true);
10611 else
10612 assert(getX86MCRegisterClass(X86::GR32RegClassID).contains(Reg) &&
10613 "Unhandled sub-register case for MOVSX64rr32");
10614
10615 return ParamLoadedValue(MI.getOperand(1), Expr);
10616 }
10617 default:
10618 assert(!MI.isMoveImmediate() && "Unexpected MoveImm instruction");
10620 }
10621}
10622
10623/// This is an architecture-specific helper function of reassociateOps.
10624/// Set special operand attributes for new instructions after reassociation.
10626 MachineInstr &OldMI2,
10627 MachineInstr &NewMI1,
10628 MachineInstr &NewMI2) const {
10629 // Integer instructions may define an implicit EFLAGS dest register operand.
10630 MachineOperand *OldFlagDef1 =
10631 OldMI1.findRegisterDefOperand(X86::EFLAGS, /*TRI=*/nullptr);
10632 MachineOperand *OldFlagDef2 =
10633 OldMI2.findRegisterDefOperand(X86::EFLAGS, /*TRI=*/nullptr);
10634
10635 assert(!OldFlagDef1 == !OldFlagDef2 &&
10636 "Unexpected instruction type for reassociation");
10637
10638 if (!OldFlagDef1 || !OldFlagDef2)
10639 return;
10640
10641 assert(OldFlagDef1->isDead() && OldFlagDef2->isDead() &&
10642 "Must have dead EFLAGS operand in reassociable instruction");
10643
10644 MachineOperand *NewFlagDef1 =
10645 NewMI1.findRegisterDefOperand(X86::EFLAGS, /*TRI=*/nullptr);
10646 MachineOperand *NewFlagDef2 =
10647 NewMI2.findRegisterDefOperand(X86::EFLAGS, /*TRI=*/nullptr);
10648
10649 assert(NewFlagDef1 && NewFlagDef2 &&
10650 "Unexpected operand in reassociable instruction");
10651
10652 // Mark the new EFLAGS operands as dead to be helpful to subsequent iterations
10653 // of this pass or other passes. The EFLAGS operands must be dead in these new
10654 // instructions because the EFLAGS operands in the original instructions must
10655 // be dead in order for reassociation to occur.
10656 NewFlagDef1->setIsDead();
10657 NewFlagDef2->setIsDead();
10658}
10659
10660std::pair<unsigned, unsigned>
10662 return std::make_pair(TF, 0u);
10663}
10664
10667 using namespace X86II;
10668 static const std::pair<unsigned, const char *> TargetFlags[] = {
10669 {MO_GOT_ABSOLUTE_ADDRESS, "x86-got-absolute-address"},
10670 {MO_PIC_BASE_OFFSET, "x86-pic-base-offset"},
10671 {MO_GOT, "x86-got"},
10672 {MO_GOTOFF, "x86-gotoff"},
10673 {MO_GOTPCREL, "x86-gotpcrel"},
10674 {MO_GOTPCREL_NORELAX, "x86-gotpcrel-norelax"},
10675 {MO_PLT, "x86-plt"},
10676 {MO_TLSGD, "x86-tlsgd"},
10677 {MO_TLSLD, "x86-tlsld"},
10678 {MO_TLSLDM, "x86-tlsldm"},
10679 {MO_GOTTPOFF, "x86-gottpoff"},
10680 {MO_INDNTPOFF, "x86-indntpoff"},
10681 {MO_TPOFF, "x86-tpoff"},
10682 {MO_DTPOFF, "x86-dtpoff"},
10683 {MO_NTPOFF, "x86-ntpoff"},
10684 {MO_GOTNTPOFF, "x86-gotntpoff"},
10685 {MO_DLLIMPORT, "x86-dllimport"},
10686 {MO_DARWIN_NONLAZY, "x86-darwin-nonlazy"},
10687 {MO_DARWIN_NONLAZY_PIC_BASE, "x86-darwin-nonlazy-pic-base"},
10688 {MO_TLVP, "x86-tlvp"},
10689 {MO_TLVP_PIC_BASE, "x86-tlvp-pic-base"},
10690 {MO_SECREL, "x86-secrel"},
10691 {MO_COFFSTUB, "x86-coffstub"}};
10692 return ArrayRef(TargetFlags);
10693}
10694
10695/// Constants defining how certain sequences should be outlined.
10696///
10697/// \p MachineOutlinerDefault implies that the function is called with a call
10698/// instruction, and a return must be emitted for the outlined function frame.
10699///
10700/// That is,
10701///
10702/// I1 OUTLINED_FUNCTION:
10703/// I2 --> call OUTLINED_FUNCTION I1
10704/// I3 I2
10705/// I3
10706/// ret
10707///
10708/// * Call construction overhead: 1 (call instruction)
10709/// * Frame construction overhead: 1 (return instruction)
10710///
10711/// \p MachineOutlinerTailCall implies that the function is being tail called.
10712/// A jump is emitted instead of a call, and the return is already present in
10713/// the outlined sequence. That is,
10714///
10715/// I1 OUTLINED_FUNCTION:
10716/// I2 --> jmp OUTLINED_FUNCTION I1
10717/// ret I2
10718/// ret
10719///
10720/// * Call construction overhead: 1 (jump instruction)
10721/// * Frame construction overhead: 0 (don't need to return)
10722///
10724
10725std::optional<std::unique_ptr<outliner::OutlinedFunction>>
10727 const MachineModuleInfo &MMI,
10728 std::vector<outliner::Candidate> &RepeatedSequenceLocs,
10729 unsigned MinRepeats) const {
10730 unsigned SequenceSize = 0;
10731 for (auto &MI : RepeatedSequenceLocs[0]) {
10732 // FIXME: x86 doesn't implement getInstSizeInBytes, so
10733 // we can't tell the cost. Just assume each instruction
10734 // is one byte.
10735 if (MI.isDebugInstr() || MI.isKill())
10736 continue;
10737 SequenceSize += 1;
10738 }
10739
10740 // We check to see if CFI Instructions are present, and if they are
10741 // we find the number of CFI Instructions in the candidates.
10742 unsigned CFICount = 0;
10743 for (auto &I : RepeatedSequenceLocs[0]) {
10744 if (I.isCFIInstruction())
10745 CFICount++;
10746 }
10747
10748 // We compare the number of found CFI Instructions to the number of CFI
10749 // instructions in the parent function for each candidate. We must check this
10750 // since if we outline one of the CFI instructions in a function, we have to
10751 // outline them all for correctness. If we do not, the address offsets will be
10752 // incorrect between the two sections of the program.
10753 for (outliner::Candidate &C : RepeatedSequenceLocs) {
10754 std::vector<MCCFIInstruction> CFIInstructions =
10755 C.getMF()->getFrameInstructions();
10756
10757 if (CFICount > 0 && CFICount != CFIInstructions.size())
10758 return std::nullopt;
10759 }
10760
10761 // FIXME: Use real size in bytes for call and ret instructions.
10762 if (RepeatedSequenceLocs[0].back().isTerminator()) {
10763 for (outliner::Candidate &C : RepeatedSequenceLocs)
10764 C.setCallInfo(MachineOutlinerTailCall, 1);
10765
10766 return std::make_unique<outliner::OutlinedFunction>(
10767 RepeatedSequenceLocs, SequenceSize,
10768 0, // Number of bytes to emit frame.
10769 MachineOutlinerTailCall // Type of frame.
10770 );
10771 }
10772
10773 if (CFICount > 0)
10774 return std::nullopt;
10775
10776 for (outliner::Candidate &C : RepeatedSequenceLocs)
10777 C.setCallInfo(MachineOutlinerDefault, 1);
10778
10779 return std::make_unique<outliner::OutlinedFunction>(
10780 RepeatedSequenceLocs, SequenceSize, 1, MachineOutlinerDefault);
10781}
10782
10784 MachineFunction &MF, bool OutlineFromLinkOnceODRs) const {
10785 const Function &F = MF.getFunction();
10786
10787 // Does the function use a red zone? If it does, then we can't risk messing
10788 // with the stack.
10789 if (Subtarget.getFrameLowering()->has128ByteRedZone(MF)) {
10790 // It could have a red zone. If it does, then we don't want to touch it.
10792 if (!X86FI || X86FI->getUsesRedZone())
10793 return false;
10794 }
10795
10796 // If we *don't* want to outline from things that could potentially be deduped
10797 // then return false.
10798 if (!OutlineFromLinkOnceODRs && F.hasLinkOnceODRLinkage())
10799 return false;
10800
10801 // This function is viable for outlining, so return true.
10802 return true;
10803}
10804
10808 unsigned Flags) const {
10809 MachineInstr &MI = *MIT;
10810
10811 // Is this a terminator for a basic block?
10812 if (MI.isTerminator())
10813 // TargetInstrInfo::getOutliningType has already filtered out anything
10814 // that would break this, so we can allow it here.
10816
10817 // Don't outline anything that modifies or reads from the stack pointer.
10818 //
10819 // FIXME: There are instructions which are being manually built without
10820 // explicit uses/defs so we also have to check the MCInstrDesc. We should be
10821 // able to remove the extra checks once those are fixed up. For example,
10822 // sometimes we might get something like %rax = POP64r 1. This won't be
10823 // caught by modifiesRegister or readsRegister even though the instruction
10824 // really ought to be formed so that modifiesRegister/readsRegister would
10825 // catch it.
10826 if (MI.modifiesRegister(X86::RSP, &RI) || MI.readsRegister(X86::RSP, &RI) ||
10827 MI.getDesc().hasImplicitUseOfPhysReg(X86::RSP) ||
10828 MI.getDesc().hasImplicitDefOfPhysReg(X86::RSP))
10830
10831 // Outlined calls change the instruction pointer, so don't read from it.
10832 if (MI.readsRegister(X86::RIP, &RI) ||
10833 MI.getDesc().hasImplicitUseOfPhysReg(X86::RIP) ||
10834 MI.getDesc().hasImplicitDefOfPhysReg(X86::RIP))
10836
10837 // Don't outline CFI instructions.
10838 if (MI.isCFIInstruction())
10840
10842}
10843
10846 const outliner::OutlinedFunction &OF) const {
10847 // If we're a tail call, we already have a return, so don't do anything.
10848 if (OF.FrameConstructionID == MachineOutlinerTailCall)
10849 return;
10850
10851 // We're a normal call, so our sequence doesn't have a return instruction.
10852 // Add it in.
10853 MachineInstr *retq = BuildMI(MF, DebugLoc(), get(X86::RET64));
10854 MBB.insert(MBB.end(), retq);
10855}
10856
10860 // Is it a tail call?
10861 if (C.CallConstructionID == MachineOutlinerTailCall) {
10862 // Yes, just insert a JMP.
10863 It = MBB.insert(It, BuildMI(MF, DebugLoc(), get(X86::TAILJMPd64))
10864 .addGlobalAddress(M.getNamedValue(MF.getName())));
10865 } else {
10866 // No, insert a call.
10867 It = MBB.insert(It, BuildMI(MF, DebugLoc(), get(X86::CALL64pcrel32))
10868 .addGlobalAddress(M.getNamedValue(MF.getName())));
10869 }
10870
10871 return It;
10872}
10873
10876 DebugLoc &DL,
10877 bool AllowSideEffects) const {
10878 const MachineFunction &MF = *MBB.getParent();
10879 const X86Subtarget &ST = MF.getSubtarget<X86Subtarget>();
10881
10882 if (ST.hasMMX() && X86::VR64RegClass.contains(Reg))
10883 // FIXME: Should we ignore MMX registers?
10884 return;
10885
10886 if (TRI.isGeneralPurposeRegister(MF, Reg)) {
10887 // Convert register to the 32-bit version. Both 'movl' and 'xorl' clear the
10888 // upper bits of a 64-bit register automagically.
10889 Reg = getX86SubSuperRegister(Reg, 32);
10890
10891 if (!AllowSideEffects)
10892 // XOR affects flags, so use a MOV instead.
10893 BuildMI(MBB, Iter, DL, get(X86::MOV32ri), Reg).addImm(0);
10894 else
10895 BuildMI(MBB, Iter, DL, get(X86::XOR32rr), Reg)
10896 .addReg(Reg, RegState::Undef)
10897 .addReg(Reg, RegState::Undef);
10898 } else if (X86::VR128RegClass.contains(Reg)) {
10899 // XMM#
10900 if (!ST.hasSSE1())
10901 return;
10902
10903 BuildMI(MBB, Iter, DL, get(X86::V_SET0), Reg);
10904 } else if (X86::VR256RegClass.contains(Reg)) {
10905 // YMM#
10906 if (!ST.hasAVX())
10907 return;
10908
10909 BuildMI(MBB, Iter, DL, get(X86::V_SET0), TRI.getSubReg(Reg, X86::sub_xmm));
10910 } else if (X86::VR512RegClass.contains(Reg)) {
10911 // ZMM#
10912 if (!ST.hasAVX512())
10913 return;
10914
10915 BuildMI(MBB, Iter, DL, get(X86::AVX512_128_SET0),
10916 TRI.getSubReg(Reg, X86::sub_xmm));
10917 } else if (X86::VK1RegClass.contains(Reg) || X86::VK2RegClass.contains(Reg) ||
10918 X86::VK4RegClass.contains(Reg) || X86::VK8RegClass.contains(Reg) ||
10919 X86::VK16RegClass.contains(Reg)) {
10920 if (!ST.hasAVX512())
10921 return;
10922
10923 unsigned Op = ST.hasBWI() ? X86::KSET0Q : X86::KSET0W;
10924 BuildMI(MBB, Iter, DL, get(Op), Reg);
10925 }
10926}
10927
10929 MachineInstr &Root, SmallVectorImpl<unsigned> &Patterns,
10930 bool DoRegPressureReduce) const {
10931 unsigned Opc = Root.getOpcode();
10932 switch (Opc) {
10933 case X86::VPDPWSSDrr:
10934 case X86::VPDPWSSDrm:
10935 case X86::VPDPWSSDYrr:
10936 case X86::VPDPWSSDYrm: {
10937 if (!Subtarget.hasFastDPWSSD()) {
10939 return true;
10940 }
10941 break;
10942 }
10943 case X86::VPDPWSSDZ128rr:
10944 case X86::VPDPWSSDZ128rm:
10945 case X86::VPDPWSSDZ256rr:
10946 case X86::VPDPWSSDZ256rm:
10947 case X86::VPDPWSSDZrr:
10948 case X86::VPDPWSSDZrm: {
10949 if (Subtarget.hasBWI() && !Subtarget.hasFastDPWSSD()) {
10951 return true;
10952 }
10953 break;
10954 }
10955 }
10957 Patterns, DoRegPressureReduce);
10958}
10959
10960static void
10964 DenseMap<Register, unsigned> &InstrIdxForVirtReg) {
10965 MachineFunction *MF = Root.getMF();
10967
10968 unsigned Opc = Root.getOpcode();
10969 unsigned AddOpc = 0;
10970 unsigned MaddOpc = 0;
10971 switch (Opc) {
10972 default:
10973 assert(false && "It should not reach here");
10974 break;
10975 // vpdpwssd xmm2,xmm3,xmm1
10976 // -->
10977 // vpmaddwd xmm3,xmm3,xmm1
10978 // vpaddd xmm2,xmm2,xmm3
10979 case X86::VPDPWSSDrr:
10980 MaddOpc = X86::VPMADDWDrr;
10981 AddOpc = X86::VPADDDrr;
10982 break;
10983 case X86::VPDPWSSDrm:
10984 MaddOpc = X86::VPMADDWDrm;
10985 AddOpc = X86::VPADDDrr;
10986 break;
10987 case X86::VPDPWSSDZ128rr:
10988 MaddOpc = X86::VPMADDWDZ128rr;
10989 AddOpc = X86::VPADDDZ128rr;
10990 break;
10991 case X86::VPDPWSSDZ128rm:
10992 MaddOpc = X86::VPMADDWDZ128rm;
10993 AddOpc = X86::VPADDDZ128rr;
10994 break;
10995 // vpdpwssd ymm2,ymm3,ymm1
10996 // -->
10997 // vpmaddwd ymm3,ymm3,ymm1
10998 // vpaddd ymm2,ymm2,ymm3
10999 case X86::VPDPWSSDYrr:
11000 MaddOpc = X86::VPMADDWDYrr;
11001 AddOpc = X86::VPADDDYrr;
11002 break;
11003 case X86::VPDPWSSDYrm:
11004 MaddOpc = X86::VPMADDWDYrm;
11005 AddOpc = X86::VPADDDYrr;
11006 break;
11007 case X86::VPDPWSSDZ256rr:
11008 MaddOpc = X86::VPMADDWDZ256rr;
11009 AddOpc = X86::VPADDDZ256rr;
11010 break;
11011 case X86::VPDPWSSDZ256rm:
11012 MaddOpc = X86::VPMADDWDZ256rm;
11013 AddOpc = X86::VPADDDZ256rr;
11014 break;
11015 // vpdpwssd zmm2,zmm3,zmm1
11016 // -->
11017 // vpmaddwd zmm3,zmm3,zmm1
11018 // vpaddd zmm2,zmm2,zmm3
11019 case X86::VPDPWSSDZrr:
11020 MaddOpc = X86::VPMADDWDZrr;
11021 AddOpc = X86::VPADDDZrr;
11022 break;
11023 case X86::VPDPWSSDZrm:
11024 MaddOpc = X86::VPMADDWDZrm;
11025 AddOpc = X86::VPADDDZrr;
11026 break;
11027 }
11028 // Create vpmaddwd.
11029 const TargetRegisterClass *RC =
11030 RegInfo.getRegClass(Root.getOperand(0).getReg());
11031 Register NewReg = RegInfo.createVirtualRegister(RC);
11032 MachineInstr *Madd = Root.getMF()->CloneMachineInstr(&Root);
11033 Madd->setDesc(TII.get(MaddOpc));
11034 Madd->untieRegOperand(1);
11035 Madd->removeOperand(1);
11036 Madd->getOperand(0).setReg(NewReg);
11037 InstrIdxForVirtReg.insert(std::make_pair(NewReg, 0));
11038 // Create vpaddd.
11039 Register DstReg = Root.getOperand(0).getReg();
11040 bool IsKill = Root.getOperand(1).isKill();
11041 MachineInstr *Add =
11042 BuildMI(*MF, MIMetadata(Root), TII.get(AddOpc), DstReg)
11043 .addReg(Root.getOperand(1).getReg(), getKillRegState(IsKill))
11044 .addReg(Madd->getOperand(0).getReg(), getKillRegState(true));
11045 InsInstrs.push_back(Madd);
11046 InsInstrs.push_back(Add);
11047 DelInstrs.push_back(&Root);
11048}
11049
11051 MachineInstr &Root, unsigned Pattern,
11054 DenseMap<Register, unsigned> &InstrIdxForVirtReg) const {
11055 switch (Pattern) {
11056 default:
11057 // Reassociate instructions.
11059 DelInstrs, InstrIdxForVirtReg);
11060 return;
11062 genAlternativeDpCodeSequence(Root, *this, InsInstrs, DelInstrs,
11063 InstrIdxForVirtReg);
11064 return;
11065 }
11066}
11067
11068// See also: X86DAGToDAGISel::SelectInlineAsmMemoryOperand().
11070 int FI) const {
11073 M.Base.FrameIndex = FI;
11074 M.getFullAddress(Ops);
11075}
11076
11078X86InstrInfo::insertCodePrefetchInstr(MachineBasicBlock &MBB,
11079 MachineBasicBlock::iterator InsertBefore,
11080 const GlobalValue *GV) const {
11081 MachineFunction &MF = *MBB.getParent();
11082 MachineInstr *PrefetchInstr = MF.CreateMachineInstr(
11083 get(X86::PREFETCHIT1),
11084 InsertBefore == MBB.instr_end() ? MBB.findPrevDebugLoc(InsertBefore)
11085 : InsertBefore->getDebugLoc(),
11086 true);
11087 MachineInstrBuilder MIB(MF, PrefetchInstr);
11090 /*base_alignment=*/llvm::Align(1)));
11091 MIB.addReg(X86::RIP).addImm(1).addReg(X86::NoRegister);
11092 MIB.addGlobalAddress(GV);
11093 MIB.addReg(X86::NoRegister);
11094 MBB.insert(InsertBefore, PrefetchInstr);
11095 return PrefetchInstr;
11096}
11097
11098#define GET_INSTRINFO_HELPERS
11099#include "X86GenInstrInfo.inc"
MachineInstrBuilder & UseMI
MachineInstrBuilder MachineInstrBuilder & DefMI
static bool isFrameStoreOpcode(int Opcode)
static bool isFrameLoadOpcode(int Opcode)
MachineOutlinerClass
Constants defining how certain sequences should be outlined.
@ MachineOutlinerTailCall
Emit a save, restore, call, and return.
@ MachineOutlinerDefault
unsigned RegSize
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
unsigned Imm
unsigned uint64_t
MachineBasicBlock & MBB
MachineBasicBlock MachineBasicBlock::iterator DebugLoc DL
MachineBasicBlock MachineBasicBlock::iterator MBBI
static GCRegistry::Add< ShadowStackGC > C("shadow-stack", "Very portable GC for uncooperative code generators")
static GCRegistry::Add< StatepointGC > D("statepoint-example", "an example strategy for statepoint")
static GCRegistry::Add< OcamlGC > B("ocaml", "ocaml 3.10-compatible GC")
DXIL Forward Handle Accesses
const HexagonInstrInfo * TII
IRTranslator LLVM IR MI
Module.h This file contains the declarations for the Module class.
static bool lookup(const GsymReader &GR, GsymDataExtractor &Data, uint64_t &Offset, uint64_t BaseAddr, uint64_t Addr, SourceLocations &SrcLocs, llvm::Error &Err)
A Lookup helper functions.
const size_t AbstractManglingParser< Derived, Alloc >::NumOps
const AbstractManglingParser< Derived, Alloc >::OperatorInfo AbstractManglingParser< Derived, Alloc >::Ops[]
This file implements the LivePhysRegs utility for tracking liveness of physical registers.
static SDValue isNOT(SDValue V, SelectionDAG &DAG)
static bool Expand2AddrUndef(MachineInstrBuilder &MIB, const MCInstrDesc &Desc)
Expand a single-def pseudo instruction to a two-addr instruction with two undef reads of the register...
#define F(x, y, z)
Definition MD5.cpp:54
#define I(x, y, z)
Definition MD5.cpp:57
This file declares the MachineConstantPool class which is an abstract constant pool to keep track of ...
Register Reg
Register const TargetRegisterInfo * TRI
Promote Memory to Register
Definition Mem2Reg.cpp:110
const SmallVectorImpl< MachineOperand > MachineBasicBlock * TBB
const SmallVectorImpl< MachineOperand > & Cond
bool IsDead
This file contains some templates that are useful if you are working with the STL at all.
static bool contains(SmallPtrSetImpl< ConstantExpr * > &Cache, ConstantExpr *Expr, Constant *C)
Definition Value.cpp:484
Provides some synthesis utilities to produce sequences of values.
static SPCC::CondCodes GetOppositeBranchCondition(SPCC::CondCodes CC)
#define LLVM_DEBUG(...)
Definition Debug.h:119
#define FROM_TO(FROM, TO)
cl::opt< bool > X86EnableAPXForRelocation
static bool is64Bit(const char *name)
#define GET_EGPR_IF_ENABLED(OPC)
static bool isLEA(unsigned Opcode)
static void addOperands(MachineInstrBuilder &MIB, ArrayRef< MachineOperand > MOs, int PtrOffset=0)
static std::optional< ParamLoadedValue > describeMOVrrLoadedValue(const MachineInstr &MI, Register DescribedReg, const TargetRegisterInfo *TRI)
If DescribedReg overlaps with the MOVrr instruction's destination register then, if possible,...
static cl::opt< unsigned > PartialRegUpdateClearance("partial-reg-update-clearance", cl::desc("Clearance between two register writes " "for inserting XOR to avoid partial " "register update"), cl::init(64), cl::Hidden)
static bool shouldPreventUndefRegUpdateMemFold(MachineFunction &MF, MachineInstr &MI)
static unsigned CopyToFromAsymmetricReg(Register DestReg, Register SrcReg, const X86Subtarget &Subtarget)
static bool isConvertibleLEA(MachineInstr *MI)
static bool ExpandMOVImmSExti8(MachineInstrBuilder &MIB, const TargetInstrInfo &TII, const X86Subtarget &Subtarget)
static bool isAMXOpcode(unsigned Opc)
static int getJumpTableIndexFromReg(const MachineRegisterInfo &MRI, Register Reg)
static void updateOperandRegConstraints(MachineFunction &MF, MachineInstr &NewMI, const TargetInstrInfo &TII)
static int getJumpTableIndexFromAddr(const MachineInstr &MI)
static bool AdjustBlendMask(unsigned OldMask, unsigned OldWidth, unsigned NewWidth, unsigned *pNewMask=nullptr)
static bool expandMOV32r1(MachineInstrBuilder &MIB, const TargetInstrInfo &TII, bool MinusOne)
static unsigned getNewOpcFromTable(ArrayRef< X86TableEntry > Table, unsigned Opc)
static unsigned getStoreRegOpcode(Register SrcReg, const TargetRegisterClass *RC, bool IsStackAligned, const X86Subtarget &STI)
#define FOLD_BROADCAST(SIZE)
static cl::opt< unsigned > UndefRegClearance("undef-reg-clearance", cl::desc("How many idle instructions we would like before " "certain undef register reads"), cl::init(128), cl::Hidden)
#define CASE_BCAST_TYPE_OPC(TYPE, OP16, OP32, OP64)
static bool isTruncatedShiftCountForLEA(unsigned ShAmt)
Check whether the given shift count is appropriate can be represented by a LEA instruction.
static cl::opt< bool > ReMatPICStubLoad("remat-pic-stub-load", cl::desc("Re-materialize load from stub in PIC mode"), cl::init(false), cl::Hidden)
static SmallVector< MachineMemOperand *, 2 > extractLoadMMOs(ArrayRef< MachineMemOperand * > MMOs, MachineFunction &MF)
static MachineInstr * fuseTwoAddrInst(MachineFunction &MF, unsigned Opcode, ArrayRef< MachineOperand > MOs, MachineBasicBlock::iterator InsertPt, MachineInstr &MI, const TargetInstrInfo &TII)
static void printFailMsgforFold(const MachineInstr &MI, unsigned Idx)
static bool canConvert2Copy(unsigned Opc)
static cl::opt< bool > NoFusing("disable-spill-fusing", cl::desc("Disable fusing of spill code into instructions"), cl::Hidden)
static bool expandNOVLXStore(MachineInstrBuilder &MIB, const TargetRegisterInfo *TRI, const MCInstrDesc &StoreDesc, const MCInstrDesc &ExtractDesc, unsigned SubIdx)
static bool isX87Reg(Register Reg)
Return true if the Reg is X87 register.
static bool Expand2AddrKreg(MachineInstrBuilder &MIB, const MCInstrDesc &Desc, Register Reg)
Expand a single-def pseudo instruction to a two-addr instruction with two k0 reads.
#define VPERM_CASES_BROADCAST(Suffix)
static std::pair< X86::CondCode, unsigned > isUseDefConvertible(const MachineInstr &MI)
Check whether the use can be converted to remove a comparison against zero.
static bool findRedundantFlagInstr(MachineInstr &CmpInstr, MachineInstr &CmpValDefInstr, const MachineRegisterInfo *MRI, MachineInstr **AndInstr, const TargetRegisterInfo *TRI, const X86Subtarget &ST, bool &NoSignFlag, bool &ClearsOverflowFlag)
static bool expandSHXDROT(MachineInstrBuilder &MIB, const MCInstrDesc &Desc)
static unsigned getLoadRegOpcode(Register DestReg, const TargetRegisterClass *RC, bool IsStackAligned, const X86Subtarget &STI)
static void expandLoadStackGuard(MachineInstrBuilder &MIB, const TargetInstrInfo &TII)
static bool hasUndefRegUpdate(unsigned Opcode, unsigned OpNum, bool ForLoadFold=false)
static MachineInstr * makeM0Inst(const TargetInstrInfo &TII, unsigned Opcode, ArrayRef< MachineOperand > MOs, MachineBasicBlock::iterator InsertPt, MachineInstr &MI)
#define GET_ND_IF_ENABLED(OPC)
static bool expandMOVSHP(MachineInstrBuilder &MIB, MachineInstr &MI, const TargetInstrInfo &TII, bool HasAVX)
static bool hasPartialRegUpdate(unsigned Opcode, const X86Subtarget &Subtarget, bool ForLoadFold=false)
Return true for all instructions that only update the first 32 or 64-bits of the destination register...
#define CASE_NF(OP)
static const uint16_t * lookupAVX512(unsigned opcode, unsigned domain, ArrayRef< uint16_t[4]> Table)
static unsigned getLoadStoreRegOpcode(Register Reg, const TargetRegisterClass *RC, bool IsStackAligned, const X86Subtarget &STI, bool Load)
#define VPERM_CASES(Suffix)
#define FROM_TO_SIZE(A, B, S)
static void commuteVPTERNLOG(MachineInstr &MI, unsigned SrcOpIdx1, unsigned SrcOpIdx2)
static bool isDefConvertible(const MachineInstr &MI, bool &NoSignFlag, bool &ClearsOverflowFlag)
Check whether the definition can be converted to remove a comparison against zero.
static MachineInstr * fuseInst(MachineFunction &MF, unsigned Opcode, unsigned OpNo, ArrayRef< MachineOperand > MOs, MachineBasicBlock::iterator InsertPt, MachineInstr &MI, const TargetInstrInfo &TII, int PtrOffset=0)
static X86::CondCode getSwappedCondition(X86::CondCode CC)
Assuming the flags are set by MI(a,b), return the condition code if we modify the instructions such t...
static unsigned getCommutedVPERMV3Opcode(unsigned Opcode)
static bool isCmpRedundantAfterLTZCNT(Register SrcReg, Register SrcReg2, int64_t ImmMask, int64_t ImmValue, const MachineInstr &OI)
static bool expandXorFP(MachineInstrBuilder &MIB, const TargetInstrInfo &TII)
static MachineBasicBlock * getFallThroughMBB(MachineBasicBlock *MBB, MachineBasicBlock *TBB)
static bool isNonFoldablePartialRegisterLoad(const MachineInstr &LoadMI, const MachineInstr &UserMI, const MachineFunction &MF)
Check if LoadMI is a partial register load that we can't fold into MI because the latter uses content...
static cl::opt< unsigned > MaxNFConversions("x86-max-nf-conversions-for-cmp-reuse", cl::desc("Maximum number of NF conversions allowed to reuse EFLAGS from a " "producer dominating a multi-predecessor block"), cl::init(6), cl::Hidden)
static unsigned getLoadStoreOpcodeForFP16(bool Load, const X86Subtarget &STI)
static bool isHReg(Register Reg)
Test if the given register is a physical h register.
static cl::opt< bool > PrintFailedFusing("print-failed-fuse-candidates", cl::desc("Print instructions that the allocator wants to" " fuse, but the X86 backend currently can't"), cl::Hidden)
static bool expandNOVLXLoad(MachineInstrBuilder &MIB, const TargetRegisterInfo *TRI, const MCInstrDesc &LoadDesc, const MCInstrDesc &BroadcastDesc, unsigned SubIdx)
#define CASE_EVEX(OP)
static void genAlternativeDpCodeSequence(MachineInstr &Root, const TargetInstrInfo &TII, SmallVectorImpl< MachineInstr * > &InsInstrs, SmallVectorImpl< MachineInstr * > &DelInstrs, DenseMap< Register, unsigned > &InstrIdxForVirtReg)
#define CASE_ND(OP)
static unsigned getThreeSrcCommuteCase(uint64_t TSFlags, unsigned SrcOpIdx1, unsigned SrcOpIdx2)
This determines which of three possible cases of a three source commute the source indexes correspond...
static unsigned getTruncatedShiftCount(const MachineInstr &MI, unsigned ShiftAmtOperandIdx)
Check whether the shift count for a machine operand is non-zero.
static SmallVector< MachineMemOperand *, 2 > extractStoreMMOs(ArrayRef< MachineMemOperand * > MMOs, MachineFunction &MF)
static unsigned getBroadcastOpcode(const X86FoldTableEntry *I, const TargetRegisterClass *RC, const X86Subtarget &STI)
static unsigned convertALUrr2ALUri(unsigned Opc)
Convert an ALUrr opcode to corresponding ALUri opcode.
static bool regIsPICBase(Register BaseReg, const MachineRegisterInfo &MRI)
Return true if register is PIC base; i.e.g defined by X86::MOVPC32r.
static bool isCommutableVPERMV3Instruction(unsigned Opcode)
static APInt getMaxValue(unsigned numBits)
Gets maximum unsigned value of APInt for specific bit width.
Definition APInt.h:202
static APInt getSignedMaxValue(unsigned numBits)
Gets maximum signed value of APInt for a specific bit width.
Definition APInt.h:205
static APInt getSignedMinValue(unsigned numBits)
Gets minimum signed value of APInt for a specific bit width.
Definition APInt.h:215
Represent a constant reference to an array (0 or more elements consecutively in memory),...
Definition ArrayRef.h:40
size_t size() const
Get the array size.
Definition ArrayRef.h:141
Predicate
This enumeration lists the possible predicates for CmpInst subclasses.
Definition InstrTypes.h:740
@ FCMP_OEQ
0 0 0 1 True if ordered and equal
Definition InstrTypes.h:743
@ ICMP_SLT
signed less than
Definition InstrTypes.h:769
@ ICMP_SLE
signed less or equal
Definition InstrTypes.h:770
@ FCMP_OLT
0 1 0 0 True if ordered and less than
Definition InstrTypes.h:746
@ FCMP_ULE
1 1 0 1 True if unordered, less than, or equal
Definition InstrTypes.h:755
@ FCMP_OGT
0 0 1 0 True if ordered and greater than
Definition InstrTypes.h:744
@ FCMP_OGE
0 0 1 1 True if ordered and greater than or equal
Definition InstrTypes.h:745
@ ICMP_UGE
unsigned greater or equal
Definition InstrTypes.h:764
@ ICMP_UGT
unsigned greater than
Definition InstrTypes.h:763
@ ICMP_SGT
signed greater than
Definition InstrTypes.h:767
@ FCMP_ULT
1 1 0 0 True if unordered or less than
Definition InstrTypes.h:754
@ FCMP_ONE
0 1 1 0 True if ordered and operands are unequal
Definition InstrTypes.h:748
@ FCMP_UEQ
1 0 0 1 True if unordered or equal
Definition InstrTypes.h:751
@ ICMP_ULT
unsigned less than
Definition InstrTypes.h:765
@ FCMP_UGT
1 0 1 0 True if unordered or greater than
Definition InstrTypes.h:752
@ FCMP_OLE
0 1 0 1 True if ordered and less than or equal
Definition InstrTypes.h:747
@ FCMP_ORD
0 1 1 1 True if ordered (no nans)
Definition InstrTypes.h:749
@ ICMP_NE
not equal
Definition InstrTypes.h:762
@ ICMP_SGE
signed greater or equal
Definition InstrTypes.h:768
@ FCMP_UNE
1 1 1 0 True if unordered or not equal
Definition InstrTypes.h:756
@ ICMP_ULE
unsigned less or equal
Definition InstrTypes.h:766
@ FCMP_UGE
1 0 1 1 True if unordered, greater than, or equal
Definition InstrTypes.h:753
@ FCMP_UNO
1 0 0 0 True if unordered: isnan(X) | isnan(Y)
Definition InstrTypes.h:750
This is an important base class in LLVM.
Definition Constant.h:43
static LLVM_ABI Constant * getAllOnesValue(Type *Ty)
static LLVM_ABI Constant * getNullValue(Type *Ty)
Constructor to create a '0' constant of arbitrary type.
DWARF expression.
static LLVM_ABI void appendOffset(SmallVectorImpl< uint64_t > &Ops, int64_t Offset)
Append Ops with operations to apply the Offset.
static LLVM_ABI DIExpression * appendExt(const DIExpression *Expr, unsigned FromSize, unsigned ToSize, bool Signed)
Append a zero- or sign-extension to Expr.
A debug info location.
Definition DebugLoc.h:126
std::pair< iterator, bool > insert(const std::pair< KeyT, ValueT > &KV)
Definition DenseMap.h:843
static LLVM_ABI FixedVectorType * get(Type *ElementType, unsigned NumElts)
Definition Type.cpp:843
bool hasOptSize() const
Optimize this function for size (-Os) or minimum size (-Oz).
Definition Function.h:699
bool hasMinSize() const
Optimize this function for minimum size (-Oz).
Definition Function.h:696
LLVMContext & getContext() const
getContext - Return a reference to the LLVMContext associated with this function.
Definition Function.cpp:356
LiveInterval - This class represents the liveness of a register, or stack slot.
SlotIndex InsertMachineInstrInMaps(MachineInstr &MI)
SlotIndex getInstructionIndex(const MachineInstr &Instr) const
Returns the base index of the given instruction.
LiveInterval & getInterval(Register Reg)
LLVM_ABI void removePhysRegDefAt(MCRegister Reg, SlotIndex Pos)
Remove value numbers and related live segments starting at position Pos that are part of any liverang...
SlotIndex ReplaceMachineInstrInMaps(MachineInstr &MI, MachineInstr &NewMI)
A set of physical registers with utility functions to track liveness when walking backward/forward th...
const Segment * getSegmentContaining(SlotIndex Idx) const
Return the segment that contains the specified index, or null if there is none.
static LocationSize precise(uint64_t Value)
bool usesWindowsCFI() const
Definition MCAsmInfo.h:675
static MCCFIInstruction createAdjustCfaOffset(MCSymbol *L, int64_t Adjustment, SMLoc Loc={})
.cfi_adjust_cfa_offset Same as .cfi_def_cfa_offset, but Offset is a relative value that is added/subt...
Definition MCDwarf.h:651
Instances of this class represent a single low-level machine instruction.
Definition MCInst.h:188
void setOpcode(unsigned Op)
Definition MCInst.h:201
Describe properties that are true of each instruction in the target description file.
This holds information about one operand of a machine instruction, indicating the register class for ...
Definition MCInstrDesc.h:88
static MDTuple * get(LLVMContext &Context, ArrayRef< Metadata * > MDs)
Definition Metadata.h:1579
Set of metadata that should be preserved when using BuildMI().
SimpleValueType SimpleTy
MachineInstrBundleIterator< const MachineInstr > const_iterator
LLVM_ABI const MachineBasicBlock * getSinglePredecessor() const
Return the predecessor of this block if it has a single predecessor.
MachineInstr * remove(MachineInstr *I)
Remove the unbundled instruction from the instruction list without deleting it.
MachineInstrBundleIterator< MachineInstr, true > reverse_iterator
LLVM_ABI bool isLayoutSuccessor(const MachineBasicBlock *MBB) const
Return true if the specified MBB will be emitted immediately after this block, such that if this bloc...
LLVM_ABI instr_iterator erase(instr_iterator I)
Remove an instruction from the instruction list and delete it.
iterator_range< succ_iterator > successors()
iterator_range< pred_iterator > predecessors()
MachineInstrBundleIterator< MachineInstr > iterator
@ LQR_Dead
Register is known to be fully dead.
This class is a data container for one entry in a MachineConstantPool.
union llvm::MachineConstantPoolEntry::@004270020304201266316354007027341142157160323045 Val
The constant itself.
bool isMachineConstantPoolEntry() const
isMachineConstantPoolEntry - Return true if the MachineConstantPoolEntry is indeed a target specific ...
The MachineConstantPool class keeps track of constants referenced by a function which must be spilled...
LLVM_ABI unsigned getConstantPoolIndex(const Constant *C, Align Alignment)
getConstantPoolIndex - Create a new entry in the constant pool or return an existing one.
The MachineFrameInfo class represents an abstract stack frame until prolog/epilog code is inserted.
Align getObjectAlign(int ObjectIdx) const
Return the alignment of the specified stack object.
int64_t getObjectSize(int ObjectIdx) const
Return the size of the specified object.
bool isFixedObjectIndex(int ObjectIdx) const
Returns true if the specified index corresponds to a fixed stack object.
const TargetSubtargetInfo & getSubtarget() const
getSubtarget - Return the subtarget for which this machine code is being compiled.
StringRef getName() const
getName - Return the name of the corresponding LLVM function.
bool needsFrameMoves() const
True if this function needs frame moves for debug or exceptions.
MachineFrameInfo & getFrameInfo()
getFrameInfo - Return the frame info object for the current function.
MachineRegisterInfo & getRegInfo()
getRegInfo - Return information about the registers currently in use.
Function & getFunction()
Return the LLVM function that this machine code represents.
Ty * getInfo()
getInfo - Keep track of various per-function pieces of information for backends that would like to do...
MachineConstantPool * getConstantPool()
getConstantPool - Return the constant pool object for the current function.
MachineMemOperand * getMachineMemOperand(MachinePointerInfo PtrInfo, MachineMemOperand::Flags F, LLT MemTy, Align BaseAlignment, const MMOMetadata &Metadata=MMOMetadata(), SyncScope::ID SSID=SyncScope::System, AtomicOrdering Ordering=AtomicOrdering::NotAtomic, AtomicOrdering FailureOrdering=AtomicOrdering::NotAtomic)
getMachineMemOperand - Allocate a new MachineMemOperand.
const TargetMachine & getTarget() const
getTarget - Return the target machine this machine code is compiled with
Register getReg(unsigned Idx) const
Get the register for the operand index.
const MachineInstrBuilder & setMemRefs(ArrayRef< MachineMemOperand * > MMOs) const
const MachineInstrBuilder & addReg(Register RegNo, RegState Flags={}, unsigned SubReg=0) const
Add a new virtual register operand.
const MachineInstrBuilder & setMIFlag(MachineInstr::MIFlag Flag) const
const MachineInstrBuilder & addImm(int64_t Val) const
Add a new immediate operand.
const MachineInstrBuilder & add(const MachineOperand &MO) const
const MachineInstrBuilder & addGlobalAddress(const GlobalValue *GV, int64_t Offset=0, unsigned TargetFlags=0) const
const MachineInstrBuilder & addDisp(const MachineOperand &Disp, int64_t off, unsigned char TargetFlags=0) const
const MachineInstrBuilder & addMBB(MachineBasicBlock *MBB, unsigned TargetFlags=0) const
const MachineInstrBuilder & addDef(Register RegNo, RegState Flags={}, unsigned SubReg=0) const
Add a virtual register definition operand.
const MachineInstrBuilder & copyImplicitOps(const MachineInstr &OtherMI) const
Copy all the implicit operands from OtherMI onto this one.
const MachineInstrBuilder & addMemOperand(MachineMemOperand *MMO) const
MachineInstr * getInstr() const
If conversion operators fail, use this method to get the MachineInstr explicitly.
Representation of each machine instruction.
mop_iterator operands_begin()
unsigned getOpcode() const
Returns the opcode of this MachineInstr.
bool isImplicitDef() const
const MachineBasicBlock * getParent() const
void dropDebugNumber()
Drop any variable location debugging information associated with this instruction.
LLVM_ABI void addImplicitDefUseOperands(MachineFunction &MF)
Add all implicit def and use operands to this instruction.
bool getFlag(MIFlag Flag) const
Return whether an MI flag is set.
unsigned getNumOperands() const
Retuns the total number of operands.
LLVM_ABI void addOperand(MachineFunction &MF, const MachineOperand &Op)
Add the specified operand to the instruction.
LLVM_ABI unsigned getNumExplicitOperands() const
Returns the number of non-implicit operands.
bool modifiesRegister(Register Reg, const TargetRegisterInfo *TRI) const
Return true if the MachineInstr modifies (fully define or partially define) the specified register.
const MCInstrDesc & getDesc() const
Returns the target instruction descriptor of this MachineInstr.
void untieRegOperand(unsigned OpIdx)
Break any tie involving OpIdx.
LLVM_ABI void setDesc(const MCInstrDesc &TID)
Replace the instruction descriptor (thus opcode) of the current instruction with a new one.
LLVM_ABI unsigned getNumExplicitDefs() const
Returns the number of non-implicit definitions.
LLVM_ABI void eraseFromBundle()
Unlink 'this' from its basic block and delete it.
bool hasOneMemOperand() const
Return true if this instruction has exactly one MachineMemOperand.
LLVM_ABI void substituteRegister(Register FromReg, Register ToReg, unsigned SubIdx, const TargetRegisterInfo &RegInfo)
Replace all occurrences of FromReg with ToReg:SubIdx, properly composing subreg indices where necessa...
mmo_iterator memoperands_begin() const
Access to memory operands of the instruction.
LLVM_ABI bool isIdenticalTo(const MachineInstr &Other, MICheckType Check=CheckDefs) const
Return true if this instruction is identical to Other.
LLVM_ABI const MachineFunction * getMF() const
Return the function that contains the basic block that this instruction belongs to.
void setFlag(MIFlag Flag)
Set a MI flag.
const DebugLoc & getDebugLoc() const
Returns the debug location id of this MachineInstr.
LLVM_ABI void removeOperand(unsigned OpNo)
Erase an operand from an instruction, leaving it with one fewer operand than it started with.
LLVM_ABI void dump() const
const MachineOperand & getOperand(unsigned i) const
unsigned getNumDefs() const
Returns the total number of definitions.
LLVM_ABI MachineInstrBundleIterator< MachineInstr > eraseFromParent()
Unlink 'this' from the containing basic block and delete it.
void setDebugLoc(DebugLoc DL)
Replace current source information with new such.
MachineOperand * findRegisterDefOperand(Register Reg, const TargetRegisterInfo *TRI, bool isDead=false, bool Overlap=false)
Wrapper for findRegisterDefOperandIdx, it returns a pointer to the MachineOperand rather than an inde...
A description of a memory reference used in the backend.
@ MODereferenceable
The memory access is dereferenceable (i.e., doesn't trap).
@ MOLoad
The memory access reads data.
@ MOInvariant
The memory access always returns the same value (or traps).
@ MOStore
The memory access writes data.
This class contains meta information specific to a module.
MachineOperand class - Representation of each machine instruction operand.
void setSubReg(unsigned subReg)
unsigned getSubReg() const
void setImplicit(bool Val=true)
void setImm(int64_t immVal)
int64_t getImm() const
bool readsReg() const
readsReg - Returns true if this operand reads the previous value of its register.
bool isReg() const
isReg - Tests if this is a MO_Register operand.
MachineBasicBlock * getMBB() const
bool isCPI() const
isCPI - Tests if this is a MO_ConstantPoolIndex operand.
void setIsDead(bool Val=true)
LLVM_ABI void setReg(Register Reg)
Change the register this operand corresponds to.
bool isImm() const
isImm - Tests if this is a MO_Immediate operand.
void setIsKill(bool Val=true)
bool isJTI() const
isJTI - Tests if this is a MO_JumpTableIndex operand.
LLVM_ABI void ChangeToRegister(Register Reg, bool isDef, bool isImp=false, bool isKill=false, bool isDead=false, bool isUndef=false, bool isDebug=false)
ChangeToRegister - Replace this operand with a new register operand of the specified value.
static MachineOperand CreateImm(int64_t Val)
void setIsUndef(bool Val=true)
Register getReg() const
getReg - Returns the register number.
bool isFI() const
isFI - Tests if this is a MO_FrameIndex operand.
LLVM_ABI bool isIdenticalTo(const MachineOperand &Other) const
Returns true if this operand is identical to the specified operand except for liveness related flags ...
static MachineOperand CreateCPI(unsigned Idx, int Offset, unsigned TargetFlags=0)
static MachineOperand CreateReg(Register Reg, bool isDef, bool isImp=false, bool isKill=false, bool isDead=false, bool isUndef=false, bool isEarlyClobber=false, unsigned SubReg=0, bool isDebug=false, bool isInternalRead=false, bool isRenamable=false)
int64_t getOffset() const
Return the offset from the symbol in this operand.
static MachineOperand CreateFI(int Idx)
MachineRegisterInfo - Keep track of information for virtual and physical registers,...
LLVM_ABI bool hasOneNonDBGUse(Register RegNo) const
hasOneNonDBGUse - Return true if there is exactly one non-Debug use of the specified register.
const TargetRegisterClass * getRegClass(Register Reg) const
Return the register class of the specified virtual register.
LLVM_ABI LLVM_READONLY MachineInstr * getVRegDef(Register Reg) const
getVRegDef - Return the machine instr that defines the specified virtual register or null if none is ...
iterator_range< def_instr_iterator > def_instructions(Register Reg) const
bool use_nodbg_empty(Register RegNo) const
use_nodbg_empty - Return true if there are no non-Debug instructions using the specified register.
LLVM_ABI Register createVirtualRegister(const TargetRegisterClass *RegClass, StringRef Name="")
createVirtualRegister - Create and return a new virtual register in the function with the specified r...
const TargetRegisterInfo * getTargetRegisterInfo() const
LLVM_ABI const TargetRegisterClass * constrainRegClass(Register Reg, const TargetRegisterClass *RC, unsigned MinNumRegs=0)
constrainRegClass - Constrain the register class of the specified virtual register to be a common sub...
LLVM_ABI LLVM_READONLY MachineInstr * getUniqueVRegDef(Register Reg) const
getUniqueVRegDef - Return the unique machine instr that defines the specified virtual register or nul...
A Module instance is used to store all the information related to an LLVM module.
Definition Module.h:68
Wrapper class representing virtual and physical registers.
Definition Register.h:20
constexpr bool isValid() const
Definition Register.h:112
constexpr bool isVirtual() const
Return true if the specified register number is in the virtual register namespace.
Definition Register.h:79
constexpr bool isPhysical() const
Return true if the specified register number is in the physical register namespace.
Definition Register.h:83
Wrapper class for IR location info (IR ordering and DebugLoc) to be passed into SDNode creation funct...
Represents one node in the SelectionDAG.
bool isMachineOpcode() const
Test if this node has a post-isel opcode, directly corresponding to a MachineInstr opcode.
unsigned getMachineOpcode() const
This may only be called if isMachineOpcode returns true.
const SDValue & getOperand(unsigned Num) const
EVT getValueType(unsigned ResNo) const
Return the type of a specified result.
Unlike LLVM values, Selection DAG nodes may return multiple values as the result of a computation.
This is used to represent a portion of an LLVM function in a low-level Data Dependence DAG representa...
LLVM_ABI MachineSDNode * getMachineNode(unsigned Opcode, const SDLoc &dl, EVT VT)
These are used for target selectors to create a new node with specified return type(s),...
LLVM_ABI void setNodeMemRefs(MachineSDNode *N, ArrayRef< MachineMemOperand * > NewMemRefs)
Mutate the specified machine node's memory references to the provided list.
MachineFunction & getMachineFunction() const
SlotIndex - An opaque wrapper around machine indexes.
Definition SlotIndexes.h:66
SlotIndex getBaseIndex() const
Returns the base index for associated with this index.
SlotIndex getRegSlot(bool EC=false) const
Returns the register use/def slot in the current instruction for a normal or early-clobber def.
std::pair< iterator, bool > insert(PtrType Ptr)
Inserts Ptr if and only if there is no element in the container equal to Ptr.
SmallPtrSet - This class implements a set which is optimized for holding SmallSize or less elements.
This class consists of common code factored out of the SmallVector class to reduce code duplication b...
void append(ItTy in_start, ItTy in_end)
Add the specified range to the end of the SmallVector.
void push_back(const T &Elt)
This is a 'vector' (really, a variable-sized array), optimized for the case when the array is small.
Represent a constant reference to a string, i.e.
Definition StringRef.h:56
Information about stack frame layout on the target.
bool hasFP(const MachineFunction &MF) const
hasFP - Return true if the specified function should have a dedicated frame pointer register.
Align getStackAlign() const
getStackAlignment - This method returns the number of bytes to which the stack pointer must be aligne...
TargetInstrInfo - Interface to description of machine instruction set.
virtual const TargetRegisterClass * getRegClass(const MCInstrDesc &MCID, unsigned OpNum) const
Given a machine instruction descriptor, returns the register class constraint for OpNum,...
virtual bool findCommutedOpIndices(const MachineInstr &MI, unsigned &SrcOpIdx1, unsigned &SrcOpIdx2) const
Returns true iff the routine could find two commutable operands in the given machine instruction.
virtual bool hasReassociableOperands(const MachineInstr &Inst, const MachineBasicBlock *MBB) const
Return true when \P Inst has reassociable operands in the same \P MBB.
virtual void genAlternativeCodeSequence(MachineInstr &Root, unsigned Pattern, SmallVectorImpl< MachineInstr * > &InsInstrs, SmallVectorImpl< MachineInstr * > &DelInstrs, DenseMap< Register, unsigned > &InstIdxForVirtReg) const
When getMachineCombinerPatterns() finds patterns, this function generates the instructions that could...
virtual std::optional< ParamLoadedValue > describeLoadedValue(const MachineInstr &MI, Register Reg) const
Produce the expression describing the MI loading a value into the physical register Reg.
virtual bool getMachineCombinerPatterns(MachineInstr &Root, SmallVectorImpl< unsigned > &Patterns, bool DoRegPressureReduce) const
Return true when there is potentially a faster code sequence for an instruction chain ending in Root.
virtual bool isReMaterializableImpl(const MachineInstr &MI) const
For instructions with opcodes for which the M_REMATERIALIZABLE flag is set, this hook lets the target...
virtual bool isSchedulingBoundary(const MachineInstr &MI, const MachineBasicBlock *MBB, const MachineFunction &MF) const
Test if the given instruction should be considered a scheduling boundary.
virtual MachineInstr * commuteInstructionImpl(MachineInstr &MI, bool NewMI, unsigned OpIdx1, unsigned OpIdx2) const
This method commutes the operands of the given machine instruction MI.
bool isPositionIndependent() const
const MCAsmInfo & getMCAsmInfo() const
Return target specific asm information.
CodeModel::Model getCodeModel() const
Returns the code model.
TargetRegisterInfo base class - We assume that the target defines a static array of TargetRegisterDes...
Provide an instruction scheduling machine model to CodeGen passes.
virtual const TargetFrameLowering * getFrameLowering() const
virtual const TargetRegisterInfo * getRegisterInfo() const =0
Return the target's register information.
Target - Wrapper for Target specific information.
static constexpr TypeSize getFixed(ScalarTy ExactSize)
Definition TypeSize.h:339
static constexpr TypeSize getZero()
Definition TypeSize.h:345
The instances of the Type class are immutable: once they are created, they are never changed.
Definition Type.h:46
static LLVM_ABI IntegerType * getInt32Ty(LLVMContext &C)
Definition Type.cpp:299
static LLVM_ABI Type * getFP128Ty(LLVMContext &C)
Definition Type.cpp:281
static LLVM_ABI Type * getDoubleTy(LLVMContext &C)
Definition Type.cpp:277
static LLVM_ABI Type * getFloatTy(LLVMContext &C)
Definition Type.cpp:276
static LLVM_ABI Type * getHalfTy(LLVMContext &C)
Definition Type.cpp:274
SlotIndex def
The index of the defining instruction.
LLVM Value Representation.
Definition Value.h:75
MCRegister getPhys(Register virtReg) const
returns the physical register mapped to the specified virtual register
Definition VirtRegMap.h:91
void BuildCFI(MachineBasicBlock &MBB, MachineBasicBlock::iterator MBBI, const DebugLoc &DL, const MCCFIInstruction &CFIInst, MachineInstr::MIFlag Flag=MachineInstr::NoFlags) const
Wraps up getting a CFI index and building a MachineInstr for it.
void getFrameIndexOperands(SmallVectorImpl< MachineOperand > &Ops, int FI) const override
bool optimizeCompareInstr(MachineInstr &CmpInstr, Register SrcReg, Register SrcReg2, int64_t CmpMask, int64_t CmpValue, const MachineRegisterInfo *MRI) const override
Check if there exists an earlier instruction that operates on the same source operands and sets eflag...
bool getMachineCombinerPatterns(MachineInstr &Root, SmallVectorImpl< unsigned > &Patterns, bool DoRegPressureReduce) const override
void copyPhysReg(MachineBasicBlock &MBB, MachineBasicBlock::iterator MI, const DebugLoc &DL, Register DestReg, Register SrcReg, bool KillSrc, bool RenamableDest=false, bool RenamableSrc=false) const override
bool isSchedulingBoundary(const MachineInstr &MI, const MachineBasicBlock *MBB, const MachineFunction &MF) const override
Overrides the isSchedulingBoundary from Codegen/TargetInstrInfo.cpp to make it capable of identifying...
MachineBasicBlock::iterator insertOutlinedCall(Module &M, MachineBasicBlock &MBB, MachineBasicBlock::iterator &It, MachineFunction &MF, outliner::Candidate &C) const override
void replaceBranchWithTailCall(MachineBasicBlock &MBB, SmallVectorImpl< MachineOperand > &Cond, const MachineInstr &TailCall) const override
bool analyzeBranch(MachineBasicBlock &MBB, MachineBasicBlock *&TBB, MachineBasicBlock *&FBB, SmallVectorImpl< MachineOperand > &Cond, bool AllowModify) const override
bool canInsertSelect(const MachineBasicBlock &, ArrayRef< MachineOperand > Cond, Register, Register, Register, int &, int &, int &) const override
void insertSelect(MachineBasicBlock &MBB, MachineBasicBlock::iterator MI, const DebugLoc &DL, Register DstReg, ArrayRef< MachineOperand > Cond, Register TrueReg, Register FalseReg) const override
unsigned getOpcodeAfterMemoryUnfold(unsigned Opc, bool UnfoldLoad, bool UnfoldStore, unsigned *LoadRegIndex=nullptr) const override
bool findCommutedOpIndices(const MachineInstr &MI, unsigned &SrcOpIdx1, unsigned &SrcOpIdx2) const override
Returns true iff the routine could find two commutable operands in the given machine instruction.
bool areLoadsFromSameBasePtr(SDNode *Load1, SDNode *Load2, int64_t &Offset1, int64_t &Offset2) const override
void loadRegFromStackSlot(MachineBasicBlock &MBB, MachineBasicBlock::iterator MI, Register DestReg, int FrameIndex, const TargetRegisterClass *RC, Register VReg, unsigned SubReg=0, MachineInstr::MIFlag Flags=MachineInstr::NoFlags) const override
X86InstrInfo(const X86Subtarget &STI)
static bool isDataInvariantLoad(MachineInstr &MI)
Returns true if the instruction has no behavior (specified or otherwise) that is based on the value l...
MachineInstr * commuteInstructionImpl(MachineInstr &MI, bool NewMI, unsigned CommuteOpIdx1, unsigned CommuteOpIdx2) const override
bool isFunctionSafeToOutlineFrom(MachineFunction &MF, bool OutlineFromLinkOnceODRs) const override
const X86RegisterInfo & getRegisterInfo() const
getRegisterInfo - TargetInstrInfo is a superset of MRegister info.
bool hasCommutePreference(MachineInstr &MI, bool &Commute) const override
Returns true if we have preference on the operands order in MI, the commute decision is returned in C...
bool hasLiveCondCodeDef(MachineInstr &MI) const
True if MI has a condition code def, e.g.
std::optional< ParamLoadedValue > describeLoadedValue(const MachineInstr &MI, Register Reg) const override
bool canMakeTailCallConditional(SmallVectorImpl< MachineOperand > &Cond, const MachineInstr &TailCall) const override
bool getMemOperandsWithOffsetWidth(const MachineInstr &LdSt, SmallVectorImpl< const MachineOperand * > &BaseOps, int64_t &Offset, bool &OffsetIsScalable, LocationSize &Width, const TargetRegisterInfo *TRI) const override
bool unfoldMemoryOperand(MachineFunction &MF, MachineInstr &MI, Register Reg, bool UnfoldLoad, bool UnfoldStore, SmallVectorImpl< MachineInstr * > &NewMIs) const override
std::optional< DestSourcePair > isCopyInstrImpl(const MachineInstr &MI) const override
std::pair< unsigned, unsigned > decomposeMachineOperandsTargetFlags(unsigned TF) const override
bool expandPostRAPseudo(MachineInstr &MI) const override
void storeRegToStackSlot(MachineBasicBlock &MBB, MachineBasicBlock::iterator MI, Register SrcReg, bool isKill, int FrameIndex, const TargetRegisterClass *RC, Register VReg, MachineInstr::MIFlag Flags=MachineInstr::NoFlags) const override
bool isAssociativeAndCommutative(const MachineInstr &Inst, bool Invert) const override
MCInst getNop() const override
Return the noop instruction to use for a noop.
outliner::InstrType getOutliningTypeImpl(const MachineModuleInfo &MMI, MachineBasicBlock::iterator &MIT, unsigned Flags) const override
const TargetRegisterClass * getInlineAsmMemoryOperandRegClass(InlineAsm::ConstraintCode C) const override
bool shouldScheduleLoadsNear(SDNode *Load1, SDNode *Load2, int64_t Offset1, int64_t Offset2, unsigned NumLoads) const override
This is a used by the pre-regalloc scheduler to determine (in conjunction with areLoadsFromSameBasePt...
bool analyzeCompare(const MachineInstr &MI, Register &SrcReg, Register &SrcReg2, int64_t &CmpMask, int64_t &CmpValue) const override
bool getConstValDefinedInReg(const MachineInstr &MI, const Register Reg, int64_t &ImmVal) const override
std::optional< ExtAddrMode > getAddrModeFromMemoryOp(const MachineInstr &MemI, const TargetRegisterInfo *TRI) const override
Register isStoreToStackSlotPostFE(const MachineInstr &MI, int &FrameIndex) const override
isStoreToStackSlotPostFE - Check for post-frame ptr elimination stack locations as well.
const TargetRegisterClass * getRegClass(const MCInstrDesc &MCID, unsigned OpNum) const override
Given a machine instruction descriptor, returns the register class constraint for OpNum,...
bool isUnconditionalTailCall(const MachineInstr &MI) const override
void reMaterialize(MachineBasicBlock &MBB, MachineBasicBlock::iterator MI, Register DestReg, unsigned SubIdx, const MachineInstr &Orig, LaneBitmask UsedLanes=LaneBitmask::getAll()) const override
bool reverseBranchCondition(SmallVectorImpl< MachineOperand > &Cond) const override
std::optional< std::unique_ptr< outliner::OutlinedFunction > > getOutliningCandidateInfo(const MachineModuleInfo &MMI, std::vector< outliner::Candidate > &RepeatedSequenceLocs, unsigned MinRepeats) const override
Register isLoadFromStackSlotPostFE(const MachineInstr &MI, int &FrameIndex) const override
isLoadFromStackSlotPostFE - Check for post-frame ptr elimination stack locations as well.
void setExecutionDomain(MachineInstr &MI, unsigned Domain) const override
unsigned insertBranch(MachineBasicBlock &MBB, MachineBasicBlock *TBB, MachineBasicBlock *FBB, ArrayRef< MachineOperand > Cond, const DebugLoc &DL, int *BytesAdded=nullptr) const override
ArrayRef< std::pair< unsigned, const char * > > getSerializableDirectMachineOperandTargetFlags() const override
Register isStoreToStackSlot(const MachineInstr &MI, int &FrameIndex) const override
bool setExecutionDomainCustom(MachineInstr &MI, unsigned Domain) const
int getSPAdjust(const MachineInstr &MI) const override
getSPAdjust - This returns the stack pointer adjustment made by this instruction.
bool verifyInstruction(const MachineInstr &MI, StringRef &ErrInfo) const override
bool isReMaterializableImpl(const MachineInstr &MI) const override
Register getGlobalBaseReg(MachineFunction *MF) const
getGlobalBaseReg - Return a virtual register initialized with the the global base register value.
int getJumpTableIndex(const MachineInstr &MI) const override
void insertNoop(MachineBasicBlock &MBB, MachineBasicBlock::iterator MI) const override
void setSpecialOperandAttr(MachineInstr &OldMI1, MachineInstr &OldMI2, MachineInstr &NewMI1, MachineInstr &NewMI2) const override
This is an architecture-specific helper function of reassociateOps.
std::pair< uint16_t, uint16_t > getExecutionDomain(const MachineInstr &MI) const override
bool isCoalescableExtInstr(const MachineInstr &MI, Register &SrcReg, Register &DstReg, unsigned &SubIdx) const override
isCoalescableExtInstr - Return true if the instruction is a "coalescable" extension instruction.
void loadStoreTileReg(MachineBasicBlock &MBB, MachineBasicBlock::iterator MI, unsigned Opc, Register Reg, int FrameIdx, bool isKill=false) const
void genAlternativeCodeSequence(MachineInstr &Root, unsigned Pattern, SmallVectorImpl< MachineInstr * > &InsInstrs, SmallVectorImpl< MachineInstr * > &DelInstrs, DenseMap< Register, unsigned > &InstrIdxForVirtReg) const override
When getMachineCombinerPatterns() finds potential patterns, this function generates the instructions ...
bool hasReassociableOperands(const MachineInstr &Inst, const MachineBasicBlock *MBB) const override
bool analyzeBranchPredicate(MachineBasicBlock &MBB, TargetInstrInfo::MachineBranchPredicate &MBP, bool AllowModify=false) const override
static bool isDataInvariant(MachineInstr &MI)
Returns true if the instruction has no behavior (specified or otherwise) that is based on the value o...
unsigned getUndefRegClearance(const MachineInstr &MI, unsigned OpNum, const TargetRegisterInfo *TRI) const override
Inform the BreakFalseDeps pass how many idle instructions we would like before certain undef register...
MachineInstr * foldMemoryOperandImpl(MachineFunction &MF, MachineInstr &MI, ArrayRef< unsigned > Ops, int FrameIndex, MachineInstr *&CopyMI, LiveIntervals *LIS=nullptr, VirtRegMap *VRM=nullptr) const override
Fold a load or store of the specified stack slot into the specified machine instruction for the speci...
void breakPartialRegDependency(MachineInstr &MI, unsigned OpNum, const TargetRegisterInfo *TRI) const override
void buildClearRegister(Register Reg, MachineBasicBlock &MBB, MachineBasicBlock::iterator Iter, DebugLoc &DL, bool AllowSideEffects=true) const override
Register isLoadFromStackSlot(const MachineInstr &MI, int &FrameIndex) const override
int64_t getFrameAdjustment(const MachineInstr &I) const
Returns the stack pointer adjustment that happens inside the frame setup..destroy sequence (e....
bool hasHighOperandLatency(const TargetSchedModel &SchedModel, const MachineRegisterInfo *MRI, const MachineInstr &DefMI, unsigned DefIdx, const MachineInstr &UseMI, unsigned UseIdx) const override
bool isSafeToMoveRegClassDefs(const TargetRegisterClass *RC) const override
bool classifyLEAReg(MachineInstr &MI, const MachineOperand &Src, unsigned LEAOpcode, bool AllowSP, Register &NewSrc, unsigned &NewSrcSubReg, bool &isKill, MachineOperand &ImplicitOp, LiveIntervals *LIS) const
Given an operand within a MachineInstr, insert preceding code to put it into the right format for a p...
uint16_t getExecutionDomainCustom(const MachineInstr &MI) const
bool isHighLatencyDef(int opc) const override
void buildOutlinedFrame(MachineBasicBlock &MBB, MachineFunction &MF, const outliner::OutlinedFunction &OF) const override
bool foldImmediate(MachineInstr &UseMI, MachineInstr &DefMI, Register Reg, MachineRegisterInfo *MRI) const override
foldImmediate - 'Reg' is known to be defined by a move immediate instruction, try to fold the immedia...
MachineInstr * convertToThreeAddress(MachineInstr &MI, LiveIntervals *LIS) const override
convertToThreeAddress - This method must be implemented by targets that set the M_CONVERTIBLE_TO_3_AD...
unsigned removeBranch(MachineBasicBlock &MBB, int *BytesRemoved=nullptr) const override
unsigned getFMA3OpcodeToCommuteOperands(const MachineInstr &MI, unsigned SrcOpIdx1, unsigned SrcOpIdx2, const X86InstrFMA3Group &FMA3Group) const
Returns an adjusted FMA opcode that must be used in FMA instruction that performs the same computatio...
bool preservesZeroValueInReg(const MachineInstr *MI, const Register NullValueReg, const TargetRegisterInfo *TRI) const override
unsigned getPartialRegUpdateClearance(const MachineInstr &MI, unsigned OpNum, const TargetRegisterInfo *TRI) const override
Inform the BreakFalseDeps pass how many idle instructions we would like before a partial register upd...
X86MachineFunctionInfo - This class is derived from MachineFunction and contains private X86 target-s...
const TargetRegisterClass * constrainRegClassToNonRex2(const TargetRegisterClass *RC) const
bool hasAVX512() const
const X86RegisterInfo * getRegisterInfo() const override
bool hasAVX() const
const X86FrameLowering * getFrameLowering() const override
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
constexpr char Align[]
Key for Kernel::Arg::Metadata::mAlign.
CondCode
ISD::CondCode enum - These are ordered carefully to make the bitfields below work out,...
@ X86
Windows x64, Windows Itanium (IA-64)
Definition MCAsmInfo.h:53
X86II - This namespace holds all of the target specific flags that instruction info tracks.
bool isKMergeMasked(uint64_t TSFlags)
bool hasNewDataDest(uint64_t TSFlags)
@ MO_GOT_ABSOLUTE_ADDRESS
MO_GOT_ABSOLUTE_ADDRESS - On a symbol operand, this represents a relocation of: SYMBOL_LABEL + [.
@ MO_INDNTPOFF
MO_INDNTPOFF - On a symbol operand this indicates that the immediate is the absolute address of the G...
@ MO_GOTNTPOFF
MO_GOTNTPOFF - On a symbol operand this indicates that the immediate is the offset of the GOT entry w...
@ MO_GOTTPOFF
MO_GOTTPOFF - On a symbol operand this indicates that the immediate is the offset of the GOT entry wi...
@ MO_GOTPCREL
MO_GOTPCREL - On a symbol operand this indicates that the immediate is offset to the GOT entry for th...
int getMemoryOperandIdx(const MCInstrDesc &Desc)
@ EVEX
EVEX - Specifies that this instruction use EVEX form which provides syntax support up to 32 512-bit r...
@ SSEDomainShift
Execution domain for SSE instructions.
bool canUseApxExtendedReg(const MCInstrDesc &Desc)
bool isPseudo(uint64_t TSFlags)
bool isKMasked(uint64_t TSFlags)
Define some predicates that are used for node matching.
CondCode getCondFromBranch(const MachineInstr &MI)
CondCode getCondFromCFCMov(const MachineInstr &MI)
@ LAST_VALID_COND
Definition X86BaseInfo.h:95
CondCode getCondFromMI(const MachineInstr &MI)
Return the condition code of the instruction.
int getFirstAddrOperandIdx(const MachineInstr &MI)
Return the index of the instruction's first address operand, if it has a memory reference,...
@ AddrNumOperands
Definition X86BaseInfo.h:37
unsigned getSwappedVCMPImm(unsigned Imm)
Get the VCMP immediate if the opcodes are swapped.
CondCode GetOppositeBranchCondition(CondCode CC)
GetOppositeBranchCondition - Return the inverse of the specified cond, e.g.
unsigned getSwappedVPCOMImm(unsigned Imm)
Get the VPCOM immediate if the opcodes are swapped.
bool isX87Instruction(MachineInstr &MI)
Check if the instruction is X87 instruction.
unsigned getNonNDVariant(unsigned Opc)
unsigned getVPCMPImmForCond(ISD::CondCode CC)
Get the VPCMP immediate for the given condition.
std::pair< CondCode, bool > getX86ConditionCode(CmpInst::Predicate Predicate)
Return a pair of condition code for the given predicate and whether the instruction operands should b...
CondCode getCondFromSETCC(const MachineInstr &MI)
unsigned getSwappedVPCMPImm(unsigned Imm)
Get the VPCMP immediate if the opcodes are swapped.
CondCode getCondFromCCMP(const MachineInstr &MI)
int getCCMPCondFlagsFromCondCode(CondCode CC)
int getCondSrcNoFromDesc(const MCInstrDesc &MCID)
Return the source operand # for condition code by MCID.
const Constant * getConstantFromPool(const MachineInstr &MI, unsigned OpNo)
Find any constant pool entry associated with a specific instruction operand.
unsigned getNFVariantIfClobberRemovable(const MachineInstr &MI, const TargetRegisterInfo *TRI=nullptr)
unsigned getMOVriOpcode(bool Use64BitReg, int64_t Imm)
Return a MOVri opcode for materializing Imm into a 32- or 64-bit GPR.
unsigned getCMovOpcode(unsigned RegBytes, bool HasMemoryOperand=false, bool HasNDD=false)
Return a cmov opcode for the given register size in bytes, and operand type.
unsigned getNFVariant(unsigned Opc)
unsigned getVectorRegisterWidth(const MCOperandInfo &Info)
Get the width of the vector register operand.
CondCode getCondFromCMov(const MachineInstr &MI)
initializer< Ty > init(const Ty &Val)
InstrType
Represents how an instruction should be mapped by the outliner.
This is an optimization pass for GlobalISel generic memory operations.
auto drop_begin(T &&RangeOrContainer, size_t N=1)
Return a range covering RangeOrContainer with the first N elements excluded.
Definition STLExtras.h:316
@ Offset
Definition DWP.cpp:577
bool all_of(R &&range, UnaryPredicate P)
Provide wrappers to std::all_of which take ranges instead of having to pass begin/end explicitly.
Definition STLExtras.h:1755
static bool isAddMemInstrWithRelocation(const MachineInstr &MI)
MachineInstrBuilder BuildMI(MachineFunction &MF, const MIMetadata &MIMD, const MCInstrDesc &MCID)
Builder interface. Specify how to create the initial instruction itself.
constexpr bool isInt(int64_t x)
Checks if an integer fits into the given bit width.
Definition MathExtras.h:166
LLVM_ABI bool isNullConstant(SDValue V)
Returns true if V is a constant integer zero.
RegState
Flags to represent properties of register accesses.
@ Implicit
Not emitted register (e.g. carry, or temporary result).
@ Kill
The last use of a register.
@ Undef
Value of the register doesn't matter.
@ Define
Register definition.
static bool isMem(const MachineInstr &MI, unsigned Op)
constexpr RegState getKillRegState(bool B)
decltype(auto) dyn_cast(const From &Val)
dyn_cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:643
bool isAligned(Align Lhs, uint64_t SizeInBytes)
Checks that SizeInBytes is a multiple of the alignment.
Definition Alignment.h:134
MCRegister getX86SubSuperRegister(MCRegister Reg, unsigned Size, bool High=false)
@ Load
The value being inserted comes from a load (InsertElement only).
@ Store
The extracted value is stored (ExtractElement only).
iterator_range< T > make_range(T x, T y)
Convenience function for iterating over sub-ranges.
void append_range(Container &C, Range &&R)
Wrapper function to append range R to container C.
Definition STLExtras.h:2224
static const MachineInstrBuilder & addRegReg(const MachineInstrBuilder &MIB, Register Reg1, bool isKill1, unsigned SubReg1, Register Reg2, bool isKill2, unsigned SubReg2)
addRegReg - This function is used to add a memory reference of the form: [Reg + Reg].
static const MachineInstrBuilder & addFrameReference(const MachineInstrBuilder &MIB, int FI, int Offset=0, bool mem=true)
addFrameReference - This function is used to add a reference to the base of an abstract object on the...
constexpr RegState getDeadRegState(bool B)
Op::Description Desc
constexpr int popcount(T Value) noexcept
Count the number of set bits in a value.
Definition bit.h:156
bool isNonFoldableWithSameMask(unsigned RegOp)
const X86FoldTableEntry * lookupBroadcastFoldTable(unsigned RegOp, unsigned OpNum)
int countr_zero(T Val)
Count number of 0's from the least significant bit to the most stopping at the first 1.
Definition bit.h:204
const X86InstrFMA3Group * getFMA3Group(unsigned Opcode, uint64_t TSFlags)
Returns a reference to a group of FMA3 opcodes to where the given Opcode is included.
auto reverse(ContainerTy &&C)
Definition STLExtras.h:408
MachineInstr * getImm(const MachineOperand &MO, const MachineRegisterInfo *MRI)
decltype(auto) get(const PointerIntPair< PointerTy, IntBits, IntType, PtrTraits, Info > &Pair)
LLVM_ABI raw_ostream & dbgs()
dbgs() - This returns a reference to a raw_ostream for debugging messages.
Definition Debug.cpp:209
bool none_of(R &&Range, UnaryPredicate P)
Provide wrappers to std::none_of which take ranges instead of having to pass begin/end explicitly.
Definition STLExtras.h:1769
LLVM_ABI void report_fatal_error(Error Err, bool gen_crash_diag=true)
Definition Error.cpp:163
const X86FoldTableEntry * lookupTwoAddrFoldTable(unsigned RegOp)
constexpr uint64_t alignTo(uint64_t Size, Align A)
Returns a multiple of A needed to store Size bytes.
Definition Alignment.h:144
bool is_sorted(R &&Range, Compare C)
Wrapper function around std::is_sorted to check if elements in a range R are sorted with respect to a...
Definition STLExtras.h:1986
constexpr RegState getDefRegState(bool B)
constexpr bool isUInt(uint64_t x)
Checks if an unsigned integer fits into the given bit width.
Definition MathExtras.h:190
class LLVM_GSL_OWNER SmallVector
Forward declaration of SmallVector so that calculateSmallVectorDefaultInlinedElements can reference s...
RegState getRegState(const MachineOperand &RegOp)
Get all register state flags from machine operand RegOp.
static bool isMemInstrWithGOTPCREL(const MachineInstr &MI)
static const MachineInstrBuilder & addOffset(const MachineInstrBuilder &MIB, int Offset)
auto lower_bound(R &&Range, T &&Value)
Provide wrappers to std::lower_bound which take ranges instead of having to pass begin/end explicitly...
Definition STLExtras.h:2068
@ Sub
Subtraction of integers.
@ Add
Sum of integers.
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Count
Definition InstrProf.h:145
DWARFExpression::Operation Op
ArrayRef(const T &OneElt) -> ArrayRef< T >
const X86FoldTableEntry * lookupUnfoldTable(unsigned MemOp)
constexpr unsigned BitWidth
decltype(auto) cast(const From &Val)
cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:559
constexpr auto seq(T Begin, T End)
Iterate over an integral type from Begin up to - but not including - End.
Definition Sequence.h:341
MaybeAlign getStackAlign(const Function &F, unsigned Index)
bool matchBroadcastSize(const X86FoldTableEntry &Entry, unsigned BroadcastBits)
std::pair< MachineOperand, DIExpression * > ParamLoadedValue
const X86FoldTableEntry * lookupFoldTable(unsigned RegOp, unsigned OpNum)
static const MachineInstrBuilder & addRegOffset(const MachineInstrBuilder &MIB, Register Reg, bool isKill, int Offset)
addRegOffset - This function is used to add a memory reference of the form [Reg + Offset],...
constexpr RegState getUndefRegState(bool B)
MCRegisterClass TargetRegisterClass
Definition FastISel.h:58
void swap(llvm::BitVector &LHS, llvm::BitVector &RHS)
Implement std::swap in terms of BitVector swap.
Definition BitVector.h:880
#define N
This struct is a compact representation of a valid (non-zero power of two) alignment.
Definition Alignment.h:39
Extended Value Type.
Definition ValueTypes.h:35
MVT getSimpleVT() const
Return the SimpleValueType held in the specified simple EVT.
Definition ValueTypes.h:339
Used to describe addressing mode similar to ExtAddrMode in CodeGenPrepare.
This represents a simple continuous liveness interval for a value.
This class contains a discriminated union of information about pointers in memory operands,...
static LLVM_ABI MachinePointerInfo getGOT(MachineFunction &MF)
Return a MachinePointerInfo record that refers to a GOT entry.
X86AddressMode - This struct holds a generalized full x86 address mode.
enum llvm::X86AddressMode::@202116273335065351270200035056227005202106004277 BaseType
This class is used to group {132, 213, 231} forms of FMA opcodes together.
unsigned get213Opcode() const
Returns the 213 form of FMA opcode.
unsigned get231Opcode() const
Returns the 231 form of FMA opcode.
bool isIntrinsic() const
Returns true iff the group of FMA opcodes holds intrinsic opcodes.
unsigned get132Opcode() const
Returns the 132 form of FMA opcode.
An individual sequence of instructions to be replaced with a call to an outlined function.
The information necessary to create an outlined function for some class of candidate.