26#define DEBUG_TYPE "si-post-ra-16bit-mov-folding"
30class SIPostRA16BitMovFolding {
37 MCRegister &SrcReg32,
bool &SrcIsHi,
bool &SrcIsImm,
38 int64_t &ImmVal)
const;
41 bool IsHiFirst)
const;
55 return "SI post-RA 16bit Mov Folding";
64 return SIPostRA16BitMovFolding().run(MF);
71 "SI Post RA 16bit Mov Folding",
false,
false)
73char SIPostRA16BitMovFoldingLegacy::ID = 0;
80void SIPostRA16BitMovFolding::getMovB16Info(
82 bool &SrcIsVGPR,
MCRegister &SrcReg32,
bool &SrcIsHi,
bool &SrcIsImm,
83 int64_t &ImmVal)
const {
99 SrcIsVGPR = AMDGPU::VGPR_16RegClass.contains(SrcReg16);
102 SrcReg32 =
TRI->get32BitRegister(SrcReg16);
122bool SIPostRA16BitMovFolding::mergeSingleMovB16Pair(
MachineInstr &
Lo,
124 bool IsHiFirst)
const {
126 MCRegister LoDst =
Lo.getOperand(0).getReg().asMCReg();
127 MCRegister HiDst =
Hi.getOperand(0).getReg().asMCReg();
128 MCRegister Dst32 =
TRI->get32BitRegister(LoDst);
131 MCRegister LoSrc16, LoSrc32, HiSrc16, HiSrc32;
132 bool LoSrcIsHi, HiSrcIsHi, LoSrcIsImm, HiSrcIsImm, LoSrcIsVGPR, HiSrcIsVGPR;
133 int64_t LoImm = 0, HiImm = 0;
135 getMovB16Info(
Lo,
TRI, LoSrc16, LoSrcIsVGPR, LoSrc32, LoSrcIsHi, LoSrcIsImm,
137 getMovB16Info(
Hi,
TRI, HiSrc16, HiSrcIsVGPR, HiSrc32, HiSrcIsHi, HiSrcIsImm,
140 MachineInstr &FirstMI = IsHiFirst ?
Hi :
Lo;
141 MachineInstr &SecondMI = IsHiFirst ?
Lo :
Hi;
146 unsigned LoopCnt = 0, UpperBoundCnt = UINT_MAX, LowerBoundCnt = 0;
155 MCRegister FirstSrc16 = IsHiFirst ? HiSrc16 : LoSrc16;
156 MCRegister FirstDst16 = IsHiFirst ? HiDst : LoDst;
157 MCRegister SecondSrc16 = IsHiFirst ? LoSrc16 : HiSrc16;
158 MCRegister SecondDst16 = IsHiFirst ? LoDst : HiDst;
160 if (SecondSrc16 &&
TRI->regsOverlap(SecondSrc16, FirstDst16))
163 for (MachineInstr &Scan :
165 if (Scan.isDebugInstr())
167 if (Scan.modifiesRegister(Dst32,
TRI))
169 assert(!Scan.modifiesRegister(AMDGPU::EXEC,
TRI) &&
170 "Expect no write on EXEC!");
172 if (LoopCnt < UpperBoundCnt &&
173 ((FirstSrc16 && Scan.modifiesRegister(FirstSrc16,
TRI)) ||
174 Scan.readsRegister(FirstDst16,
TRI))) {
175 UpperBound = Scan.getIterator();
176 UpperBoundCnt = LoopCnt;
178 if (LoopCnt > LowerBoundCnt &&
179 ((SecondSrc16 && Scan.modifiesRegister(SecondSrc16,
TRI)) ||
180 Scan.readsRegister(SecondDst16,
TRI))) {
182 LowerBoundCnt = LoopCnt;
187 if (LowerBoundCnt >= UpperBoundCnt)
192 MachineInstr &Selected = *UpperBound;
200 if (!HiSrcIsImm && !LoSrcIsImm) {
202 if (!LoSrcIsVGPR && !HiSrcIsVGPR && HiSrc32 != LoSrc32)
204 unsigned MaskHiSrc = HiSrcIsHi ? 0x0706 : 0x0504;
205 unsigned MaskLoSrc = LoSrcIsHi ? 0x0302 : 0x0100;
209 .
addImm((MaskHiSrc << 16) | MaskLoSrc);
210 Lo.eraseFromParent();
211 Hi.eraseFromParent();
216 AMDGPU::VGPR_32_Lo128RegClass.contains(Dst32) &&
218 (LoSrcIsVGPR && AMDGPU::VGPR_32_Lo128RegClass.contains(LoSrc32))) &&
220 (HiSrcIsVGPR && AMDGPU::VGPR_32_Lo128RegClass.contains(HiSrc32)));
224 if (HiSrcIsImm && HiImm == 0 && !LoSrcIsImm && !LoSrcIsHi) {
226 TII->get(Usevop2 ? AMDGPU::V_AND_B32_e32 : AMDGPU::V_AND_B32_e64),
230 Lo.eraseFromParent();
231 Hi.eraseFromParent();
237 if (HiSrcIsImm && HiImm == 0 && !LoSrcIsImm && LoSrcIsHi) {
239 TII->get(Usevop2 ? AMDGPU::V_LSHRREV_B32_e32
240 : AMDGPU::V_LSHRREV_B32_e64),
244 Lo.eraseFromParent();
245 Hi.eraseFromParent();
251 if (LoSrcIsImm && LoImm == 0 && !HiSrcIsImm && !HiSrcIsHi) {
253 TII->get(Usevop2 ? AMDGPU::V_LSHLREV_B32_e32
254 : AMDGPU::V_LSHLREV_B32_e64),
258 Lo.eraseFromParent();
259 Hi.eraseFromParent();
265 if (LoSrcIsImm && LoImm == 0 && !HiSrcIsImm && HiSrcIsHi) {
267 TII->get(Usevop2 ? AMDGPU::V_AND_B32_e32 : AMDGPU::V_AND_B32_e64),
271 Lo.eraseFromParent();
272 Hi.eraseFromParent();
281bool SIPostRA16BitMovFolding::mergeMovB16Pairs(
MachineFunction &MF)
const {
283 for (MachineBasicBlock &
MBB : MF) {
293 const unsigned ScanLimit = 16;
294 std::array<Pending, ScanLimit> CirBuf = {};
295 SmallDenseMap<MCRegister, unsigned> PendingWrites;
299 if (
MI.isDebugInstr())
302 unsigned Opc =
MI.getOpcode();
303 bool IsMovB16 = (
Opc == AMDGPU::V_MOV_B16_t16_e32 ||
304 Opc == AMDGPU::V_MOV_B16_t16_e64);
306 if (++Head == ScanLimit)
310 PendingWrites.
erase(CirBuf[Head].Dst32);
313 CirBuf[Head] = {MCRegister(),
nullptr,
false};
318 MCRegister DstReg =
MI.getOperand(0).getReg().asMCReg();
320 MCRegister Dst32 =
TRI->get32BitRegister(DstReg);
323 CirBuf[Head] = {Dst32, &
MI, DstIsHi};
327 if (CirBuf[It->second].IsHi == DstIsHi) {
333 MachineInstr &LoMI = !DstIsHi ?
MI : *CirBuf[It->second].MI;
334 MachineInstr &HiMI = DstIsHi ?
MI : *CirBuf[It->second].MI;
335 bool IsHiFirst = CirBuf[It->second].IsHi;
336 if (mergeSingleMovB16Pair(LoMI, HiMI, IsHiFirst)) {
338 PendingWrites.
erase(It);
352 SIPostRA16BitMovFolding().run(MF);
359 TII = ST.getInstrInfo();
363 if (ST.useRealTrue16Insts())
364 Changed |= mergeMovB16Pairs(MF);
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
Provides AMDGPU specific target descriptions.
MachineBasicBlock MachineBasicBlock::iterator DebugLoc DL
AMD GCN specific subclass of TargetSubtarget.
const HexagonInstrInfo * TII
Register const TargetRegisterInfo * TRI
#define INITIALIZE_PASS(passName, arg, name, cfg, analysis)
This file implements a set that has insertion order iteration characteristics.
Represent the analysis usage information of a pass.
void setPreservesAll()
Set by analyses that do not transform their input at all.
bool erase(const KeyT &Val)
std::pair< iterator, bool > insert(const std::pair< KeyT, ValueT > &KV)
Wrapper class representing physical registers. Should be passed by value.
const MachineFunction * getParent() const
Return the MachineFunction containing this basic block.
MachineInstrBundleIterator< MachineInstr > iterator
MachineFunctionPass - This class adapts the FunctionPass interface to allow convenient creation of pa...
void getAnalysisUsage(AnalysisUsage &AU) const override
getAnalysisUsage - Subclasses that override getAnalysisUsage must call this.
const TargetSubtargetInfo & getSubtarget() const
getSubtarget - Return the subtarget for which this machine code is being compiled.
const MachineInstrBuilder & addReg(Register RegNo, RegState Flags={}, unsigned SubReg=0) const
Add a new virtual register operand.
const MachineInstrBuilder & addImm(int64_t Val) const
Add a new immediate operand.
Representation of each machine instruction.
const DebugLoc & getDebugLoc() const
Returns the debug location id of this MachineInstr.
MachineOperand class - Representation of each machine instruction operand.
static PreservedAnalyses all()
Construct a special preserved set that preserves all passes.
MCRegister asMCReg() const
Utility to check-convert this value to a MCRegister.
PreservedAnalyses run(MachineFunction &MF, MachineFunctionAnalysisManager &MFAM)
Represent a constant reference to a string, i.e.
self_iterator getIterator()
bool isHi16Reg(MCRegister Reg, const MCRegisterInfo &MRI)
This is an optimization pass for GlobalISel generic memory operations.
auto drop_begin(T &&RangeOrContainer, size_t N=1)
Return a range covering RangeOrContainer with the first N elements excluded.
MachineInstrBuilder BuildMI(MachineFunction &MF, const MIMetadata &MIMD, const MCInstrDesc &MCID)
Builder interface. Specify how to create the initial instruction itself.
iterator_range< T > make_range(T x, T y)
Convenience function for iterating over sub-ranges.
iterator_range< early_inc_iterator_impl< detail::IterOfRange< RangeT > > > make_early_inc_range(RangeT &&Range)
Make a range that does early increment to allow mutation of the underlying range without disrupting i...
AnalysisManager< MachineFunction > MachineFunctionAnalysisManager
char & SIPostRA16BitMovFoldingLegacyID
LLVM_ABI raw_ostream & dbgs()
dbgs() - This returns a reference to a raw_ostream for debugging messages.